腾讯|混元基座模型-强化学习生产范式研究实习

腾讯 · TEG · 工作地点:北京 · 更新时间:2026-06-01

岗位职责

课题背景: 强化学习已成为突破大模型智能上限与构建统一多维能力的核心技术。随着应用场景逐渐从单一文本模态扩展至多模态、任务类型从简单聊天扩展至长思维链的复杂推理,以及与环境产生复杂交互的agent任务,探索面向多样化异构任务的高效RL训练与融合生产范式,实现大模型全场景能力的统一,已成为通往AGI的关键命题。 课题挑战: 1、agent等任务依赖环境反馈和长上下文交互,在RL学习与on-policy distillation(opd)中极易出现训推不一致以及奖励稀疏的问题,如何RL及OPD稳定性以及提升效果上限; 2、统一模型需要兼容跨模态理解与生成、agent与非agent任务、长超上下文与长期记忆等,跨任务的融合容易出现效果冲突,如何实现多样化异构任务的无损融合和蒸馏; 3、当前基于模型合并及OPD的融合范式,其在复杂OOD任务上的真实泛化能力仍缺乏系统性验证,其理论局限性尚未被完全揭示。 具体工作: 你将参与agent任务的RL及OPD的训练稳定性及算法效果优化,以及异构任务的能力融合与蒸馏及其泛化性研究。

任职要求

1、学历和专业要求:计算机、人工智能、机器学习、自然语言处理、自动化、数学、统计学等相关专业硕士及以上学历,博士优先; 2、熟练掌握Python,熟悉PyTorch等深度学习框架,有较强实验设计与工程实现能力; 3、具备良好的技术视野,理解大模型相关技术原理,熟悉大模型SFT、RL及reward建模等训练范式,对RL/OPD等有深入的实践和研究经验; 3、具备较强的问题分析能力、自驱力和协作意识,对前沿算法研究有持续热情,能够独立推进研究问题分析、实验验证与方案迭代; 4、有高质量论文发表者优先(如ACL、EMNLP、NeurIPS、ICML、ICLR等); 5、具备强烈的进取心、自驱力及团队合作精神,热衷于追求技术创新。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:混元基座模型-强化学习生产范式研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。