
腾讯|混元-大模型复杂推理过程评测与过程奖励建模研究实习
岗位职责
课题背景:
当前主流评测基准普遍仅关注最终答案正确性,无法区分模型是通过严谨推理还是捷径匹配得出结论。随着大模型在数学证明、代码调试、多步科学推理等高阶任务中的应用深入,对推理过程本身的质量评估变得至关重要。构建一套量化每一步推理质量的过程级评测体系,既能精准诊断模型推理能力边界,又能为过程奖励模型(PRM)的强化学习提供高质量监督信号。
课题挑战:
1、推理过程的质量定义与自动化评估困难。同一正确结论可能对应多条风格迥异的推理链路,如何定义逻辑严谨性、步骤必要性、知识准确性等多维标准,并设计能自动判别推理步骤正确性、识别逻辑跳跃与幻觉注入的评测算法,是核心挑战。同时需探索基于模型互评与共识机制的低成本评测方案;
2、过程评测到训练的闭环缺乏系统方法论。如何将评测结论转化为可用于强化学习的稠密过程奖励信号,需要研究推理步骤粒度划分策略、过程奖励模型训练范式(自动标注 vs 蒙特卡洛估计),以及过程奖励与结果奖励的联合优化机制。
具体工作:
1、推理过程评测体系研究与落地,包括推理链质量多维评价指标设计、跨任务类型(数学、代码、逻辑、科学)的过程级评测基准构建,以及自动化过程评测流水线搭建;
2、过程奖励建模研究,包括过程奖励模型(PRM)的训练与校准、评测信号与强化学习训练的闭环打通,以及评测基准的持续迭代与难度进化机制。
任职要求
1、计算机或者相关专业硕士或者以上学历,具备推荐/广告/CV/NLP/RL相关实习经验优先,有大模型调优化应用、评测经历优先;
2、在ICLR、NeurIPS,ICML、KDD、AAAI,IJCAI等机器学习领域会议或者期刊有第一作者发表过至少一篇文章。
腾讯招聘实习生:混元-大模型复杂推理过程评测与过程奖励建模研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
