
腾讯|混元基座模型-Reward System研究实习
岗位职责
课题背景:
奖励系统(Reward System)是一种在人工智能,尤其是大模型RLHF训练中,为模型提供关键奖励信号的核心组件。奖励系统主要通过构建一个Reward Model,模拟人类的价值观和偏好,对大模型生成的候选回答进行自动打分与排序。它不是让模型在海量数据中盲目模仿,而是通过精确的奖惩反馈机制,引导大模型朝着更符合人类期望的方向演进。通过奖励系统,大模型显著提升了人类对齐水平、增强了输出的安全性和有用性、更好地适应了复杂的交互场景。不过,随着模型能力的提升,当前的奖励系统正面临严峻挑战,例如“Reward Hacking”现象导致模型学会了迎合打分规则而非真正解决问题;同时,高质量人类偏好数据的标注成本极其高昂且带有主观偏见,容易引发过度优化(Over-optimization),极大限制了模型综合能力的上限。
课题挑战:
如何构建更加鲁棒、低成本且能精准反映复杂价值判断的奖励系统(如探索基于规则或过程的奖励机制),已经成为大模型对齐技术进一步突破上限的当务之急,目前业界仍缺乏能够有效解决奖励失效的成熟方案,亟待我们攻坚突破。
具体工作:
针对上述挑战,本课题具体工作包括:
1、 引入大模型辅助反馈(RLAIF)与自动化规则约束,大幅降低人工标注成本并减少主观偏见;
2、研发动态对抗与多目标奖励融合机制,通过迭代更新有效识别并抑制“Reward Hacking”现象;
3、构建多维度价值评价体系,平衡安全性与有用性,缓解过度优化,全面提升奖励系统的鲁棒性与对齐上限。
任职要求
1、自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士以上学历;
2、在NLP、LLM、深度学习、强化学习方面有一定研究基础,熟悉主流模型和算法,并有一定的实践经验;
3、较强的工程实现能力,熟练掌握C/C++,Python等至少一种语言,有实际编程项目经验,熟悉DeepSpeed、Megatron等分布式训练框架,熟练使用至少一种深度学习框架(如TensorFlow,PyTorch等);
4、有高质量论文发表者优先(如ACL、EMNLP、NeurIPS、ICML、ICLR等);
5、具备强烈的进取心、自驱力及团队合作精神,热衷于追求技术创新。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元基座模型-Reward System研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
