
腾讯|混元基座模型-强化学习算法研究&强推理能力优化实习
岗位职责
课题背景:
强化学习已成为大模型后训练阶段持续提升推理能力与智能上限的关键技术。随着数学、代码、科学、逻辑推理等复杂任务成为模型竞争核心,模型优化正从单纯依赖参数和数据规模扩展,转向以长思维链、过程监督、可验证奖励和工具增强为核心的推理优化范式。因此,面向推理场景开展强化学习算法研究,并系统提升模型高阶推理能力,已成为基座模型持续演进的重要方向。
课题挑战:
1、长思维链与长轨迹训练中普遍存在奖励稀疏、信用分配困难、训练不稳定等问题,鲁棒训练、样本效率与探索利用平衡难以兼顾;
2、数学、科学等高难任务对中间过程正确性要求高,如何构建通用验证器、过程监督与可验证奖励体系,是提升模型泛化能力的关键;
3、推理链条常伴随冗余反思与无效解码,如何结合强化学习、数据闭环与工具使用,实现正确率、推理效率与训练成本的协同优化,仍缺乏成熟方案。
具体工作:
你将参与推理场景强化学习算法设计、推理数据构建、奖励与验证体系建设、思维链优化,以及数学、科学等高难任务的能力迭代,持续提升模型推理上限与效率。
任职要求
1、学历和专业要求:计算机、人工智能、机器学习、自然语言处理、自动化、数学、统计学等相关专业硕士及以上学历,博士优先。
2、技术技能要求:具备强化学习、深度学习或大语言模型相关研究基础,熟悉PPO、GRPO、DPO等训练或对齐方法,了解大模型推理增强、数据构造或评测方法;熟练掌握Python,熟悉PyTorch等深度学习框架,有较强实验设计与工程实现能力;
3、软性素质要求:具备较强的问题分析能力、自驱力和协作意识,对前沿算法研究有持续热情,能够独立推进研究问题分析、实验验证与方案迭代;
4、有高质量论文发表者优先(如ACL、EMNLP、NeurIPS、ICML、ICLR等);
5、具备强烈的进取心、自驱力及团队合作精神,热衷于追求技术创新。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元基座模型-强化学习算法研究&强推理能力优化岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
