
腾讯|混元-面向复杂指令与智能体场景的大模型后训练数据飞轮构建研究实习
岗位职责
课题背景:
随着前沿模型基础能力持续提升,后训练阶段的核心问题逐步集中到复杂场景数据供给。长篇生成、多约束复杂指令、多轮交互、工具调用与长链路任务,对数据覆盖深度、结构质量、评价标准和迭代效率提出了更高要求。围绕高难样本发现、失败模式归因、自动化质检与定向补强构建数据飞轮,已成为复杂能力持续优化的关键路径。
课题挑战:
复杂场景数据具有长上下文、多约束、多步骤和动态交互等特征,数据复杂度高;模型复杂能力提升依赖任务类型、约束组合、工具链路和异常路径的充分覆盖,数据多样性要求高;数据提质不能停留在单次质检或局部修补,而需要构建“评测发现问题—错误归因分析—数据定向补强—配方迭代优化—效果回流验证”的飞轮闭环,持续提升数据质量与能力收益转化效率。
具体工作:
参与大模型后训练(SFT+RL)阶段长文、复杂指令与智能体数据的全链路研发,建立高难样本挖掘、场景分类与难度分层体系;设计长文本与长轨迹数据生产、反例构造和定向修复方案,保障长程连贯性、结构完整性与指令遵循精度;搭建 Rubrics 生成、自动评分、结果验证与多层质量校验 pipeline;沉淀失败模式归因框架,形成“评测发现问题—数据补强—配方迭代—效果回流”的闭环。
任职要求
1、计算机科学、人工智能、自然语言处理等相关专业硕士及以上;
2、在大模型评测、数据质量、Agent/RL 训练、对话系统等方向有深入研究经验者优先;
3、有 ICLR、NeurIPS 和 ICML等顶会论文或高影响力开源贡献者优先;
4、熟练掌握claude code等 ai工具,有基于此落地的soild工作者优先;深入理解 Transformer 架构及 SFT/RL 后训练原理;熟悉Rubric-based Evaluation 等前沿评测方法论;
5、具备从海量数据与实验结果中发现隐含规律的洞察力,以及从 insight 到落地的全链路推动力。
腾讯招聘实习生:混元-面向复杂指令与智能体场景的大模型后训练数据飞轮构建研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
