腾讯|混元-面向大模型后训练Agent能力的数据策略研究实习

腾讯 · TEG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 随着大模型Agent能力的快速演进,Agent场景下的多轮交互、长链路规划及工具调用对后训练(SFT+RL)阶段的数据质量与多样性提出了极高要求。团队当前正深度打造混元大模型的Agent能力,支持OpenClaw、QClaw等面向真实用户的智能体产品,这些场景对模型的工具调用准确性、长链路任务规划能力及探索效率有极高的落地标准。当前Agent训练数据在复杂轨迹覆盖、探索效率、任务多样性等方面面临诸多挑战,本课题旨在通过研究高效的Agent数据生产、自动化质检与评测驱动的数据飞轮机制,持续提升产品级Agent核心能力、降低数据迭代成本、加速技术从研究到产品的闭环落地过程。 课题挑战: 1、Agent轨迹/环境生产与质检:基于多智能体博弈与复杂轨迹生成技术,研究面向Agent场景的高质量数据自动化生产方案,并设计自动化质检与定向修复算法,确保数据在多轮交互一致性、工具调用准确性、思维链质量等维度达到高标准; 2、评测驱动的数据飞轮机制:设计科学的Agent能力自动化评测方案,通过深度剖析模型在探索效率、工具使用、长链路规划等实际任务中的弱项,构建"评测发现问题—数据定向强化—效果闭环提升"的数据飞轮,实现模型能力的持续迭代优化; 3、前沿数据技术追踪与转化:持续跟踪Agent数据合成、复杂轨迹构建、多模态与多智能体互动等前沿方向,结合业务实际提出优化方案,将研究成果转化为可落地的业务价值。 具体工作: Agent场景下SFT、RL复杂轨迹/环境的数据合成与自动化质检;Agent能力的自动化评测能力与数据飞轮;Agent RL数据的前沿方向研究与在Openclaw、Qclaw等核心场景的落地。

任职要求

1、计算机科学、人工智能等相关专业硕士及以上学历; 2、熟悉大语言模型训练原理(Transformer架构、RLHF、LLM Alignment等),拥有大模型数据工程或模型训练实际项目经验,在顶会(NeurIPS、ICLR、ICML、ACL等)发表论文或在开源社区有高影响力贡献者优先; 3、深入实践过ReAct、Reflexion等前沿Agent推理框架,能够系统性优化Agent思维链质量、工具调用鲁棒性及环境反馈准确性; 4、熟练使用Python、PyTorch等语言及工具,具备快速阅读和复现论文的能力,熟悉Agentic Workflow; 5、具备强烈的数据敏感度与技术热情,拥有优秀的跨团队(模型、评测)协作与沟通能力。

腾讯招聘实习生:混元-面向大模型后训练Agent能力的数据策略研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。