腾讯|混元-大模型后训练数据全链路智能治理研究实习

腾讯 · TEG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 大模型后训练数据的质量瓶颈正发生结构性转移:一方面,角色扮演、长文本创作、长程记忆等成熟场景中,数据缺陷从显性的事实错误演变为人设崩塌、逻辑断裂、记忆丢失等更隐蔽的系统性问题,现有质检手段难以精准定位与闭环修复;另一方面,Agentic 场景(多步决策、工具调用、环境交互)正快速崛起,但高质量 RL 训练数据的生产与验证范式缺乏。 课题挑战: 1、多场景数据质量的自动化评测与闭环治理: 构建覆盖角色扮演、文本创作、长程记忆等线上核心场景的可扩展多维 Rubrics 评分体系与自动化质检 Pipeline,解决自动评分与人类偏好的对齐难题;在此基础上打通从维度评分到缺陷归因、再到定向修复的闭环,解决当前"能发现问题却无法定位成因、无法自动修复"的链路断裂问题; 2、Agentic 场景的 RL 数据合成: 探索在多步决策、工具调用、环境交互等 Agent 场景下,如何合成高质量 RL 训练数据,并设计可靠的过程级 reward 信号与轨迹级验证机制,解决 Agent 数据获取成本高、验证难、分布窄的核心瓶颈。 具体工作: 参与大模型后训练数据质量治理与 Agentic 数据生产的前沿研究,一方面研发多场景 Rubrics 评测、结构化归因与自动修复的端到端质量闭环,另一方面探索 Agent 场景下 RL 训练数据的自动化合成与验证方法,推动两条技术线在线上核心场景的落地与持续迭代。

任职要求

1、计算机科学、人工智能、自然语言处理等相关专业硕士及以上; 2、在大模型评测、数据质量、Agent/RL 训练、对话系统等方向有深入研究经验者优先; 3、有 ICLR、NeurIPS 和 ICML等顶会论文或高影响力开源贡献者优先; 4、熟练掌握深度学习框架;深入理解 Transformer 架构及 SFT/RL 后训练原理;熟悉Rubric-based Evaluation 等前沿评测方法论; 5、具备从海量数据与实验结果中发现隐含规律的洞察力,以及从 insight 到落地的全链路推动力。

腾讯招聘实习生:混元-大模型后训练数据全链路智能治理研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。