
腾讯|元宝—面向开放域任务的智能体协同进化与经验单元沉淀研究实习
岗位职责
课题背景:
随着大模型智能体在搜索、信息分析、工具调用和复杂决策等开放域任务中的应用不断深入,如何让系统在真实环境交互中持续积累经验、提升能力,正成为智能体研究与落地的重要方向。相较于依赖单条轨迹、单次任务完成结果进行优化的传统范式,开放域智能体往往需要在大量动态、异构且长链路的任务中,通过反复执行、反馈收集、策略迭代和经验复用实现能力演进。
在这一过程中,多容器并行环境为智能体提供了可扩展的交互基础:通过在多个同质化容器中同时运行任务,可以高效收集执行轨迹、环境反馈与中间状态,为奖励建模、策略优化和行为分析提供丰富数据来源。然而,仅有并行采样并不足以支撑能力持续进化,关键还在于如何将海量原始反馈进一步转化为可抽象、可索引、可迁移的“经验单元”,沉淀为能够在新任务中复用的能力资产。
因此,本课题聚焦于开放域场景下的智能体协同进化机制,研究如何在同质化多容器环境中并行收集反馈,并将其转化为结构化、可复用的经验单元,支撑智能体在复杂开放任务中的持续学习与能力进化。
课题挑战:
1、多容器并行反馈采集机制设计:如何在同质化的多个容器环境中高效调度智能体并行执行任务,稳定采集轨迹、状态、动作、环境返回和成败信号等多粒度反馈;
2、协同进化策略设计:如何在多个并行实例之间建立有效的协同机制,支持行为比较、优胜劣汰、策略变异、多样性保持与群体级能力演进;
3、经验单元抽象与表示:如何从原始执行轨迹中提炼出具备复用价值的经验单元,例如查询改写模式、工具调用策略、错误恢复路径、证据筛选规则和任务拆解模板;
4、经验复用与迁移机制:如何让沉淀下来的经验单元在新任务、新环境和新问题类型中被有效召回、组合与重用,提升智能体的跨任务泛化能力;
5、开放域能力进化评测体系:如何构建面向开放域任务的评测框架,量化经验沉淀与协同进化对任务成功率、执行效率、鲁棒性和泛化性的真实收益。
具体工作:
你将参与开放域智能体协同进化系统的设计与实现,研究多容器并行环境下的任务分发、反馈采集、轨迹管理与行为分析机制;参与探索群体级策略优化方法,构建面向开放任务的协同进化流程;研究从执行轨迹到经验单元的抽象、组织与检索方法,推动经验在不同任务间的复用与迁移;参与自动化评测系统建设,验证经验沉淀与协同进化对混元大模型开放域能力持续提升的效果。
任职要求
1、包含但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程、统计学、应用数学、物理学/量子计算、信息安全、信号与信息处理等专业的博士和优秀硕士;
2、熟练掌握大模型、多模态相关的基本算法及应用,熟悉caffe、tensorflow,pytorch等至少一个深度学习框架;
3、较强的工程实现能力,熟练掌握 C/C++ 编程,熟悉 Shell/Python/Matlab 至少一种编程语言。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:元宝—面向开放域任务的智能体协同进化与经验单元沉淀研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
