腾讯|混元-Agent 长程任务评测体系构建 & 自主协作能力持续深化研究实习

腾讯 · TEG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 随着大模型从单轮问答走向自主执行复杂任务的 Agent 范式,如何系统性地评估 Agent 在真实场景中的长程规划、工具调用、多步推理与协作能力,成为推动 AGI 落地的关键瓶颈。当前的评测体系大多停留在静态问答或单步操作层面,难以衡量 Agent 在面对开放式、跨系统、长周期任务时的决策质量、容错恢复与自主演进能力。构建一套贴近真实工程场景、可自动化执行、具备足够区分度的 Agent 评测体系,对于牵引模型向更高阶智能迭代具有重要的战略价值。 课题挑战: 1、长程任务(Long-Horizon Task)的评测设计极其困难。此类任务涉及多步骤决策链路、环境状态持续变化、中间结果依赖与错误级联传播等问题,如何定义合理的任务粒度、设计可分解且可度量的评价指标、构建既能反映真实复杂度又可自动化执行的评测环境,是核心挑战。同时需要兼顾任务的多样性(代码仓库级修复、跨系统运维、端到端研发流程等)与标准化之间的平衡; 2、多 Agent 协作与自主研究场景缺乏成熟的评测范式。在多 Agent 协同场景中,需要评估角色分工、信息共享、冲突消解与联合推理等能力,而在自主研究场景中,还需衡量 Agent 的探索策略、假设生成、实验设计与结论归纳等高阶认知能力。如何构建可复现、可扩展的评测框架来覆盖这些新兴能力维度,并设计兼顾过程评价与结果评价的自动化验证机制,是亟待突破的难题。 具体工作: 1、面向 Agent 长程任务的评测体系研究与落地,包括任务环境构建(容器化仿真、多工具链集成)、多层级自动化验证器(状态验证、功能验证、端到端集成验证)设计,以及基于结构化评分标准的自动评测流水线搭建; 2、多 Agent 协作与自主研究评测能力的联合推进与深化,包括但不限于多 Agent 角色编排与协同效率评估、长程任务中的规划-执行-反思闭环能力度量、自主探索与知识获取效率分析,以及评测任务的众包生产与质量控制体系建设。

任职要求

1、计算机或者相关专业硕士或者以上学历,具备推荐/广告/CV/NLP/RL相关实习经验优先,有大模型调优化应用、评测经历优先; 2、在ICLR、NeurIPS,ICML、KDD、AAAI,IJCAI等机器学习领域会议或者期刊有第一作者发表过至少一篇文章。

腾讯招聘实习生:混元-Agent 长程任务评测体系构建 & 自主协作能力持续深化研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。