腾讯|混元多模态-全模态Agentic Model研究实习

腾讯 · TEG · 工作地点:北京 · 更新时间:2026-06-01

岗位职责

课题背景: 随着多模态大模型能力不断提升,模型正从被动感知与理解走向具备规划、推理与行动能力的 Agent 范式。面向真实复杂任务,构建支持文本、视觉、音频、音视频等全模态输入,并能够完成复杂工具调用与多智能体协同的 Agentic Model,已成为多模态智能的重要研究方向。 课题挑战: 本课题的主要挑战在于,如何构建支持全模态输入的 Agent 模型,使其能够将感知、推理与工具调用进行统一建模,并在复杂任务中实现稳定有效的决策与执行;如何设计高质量的后训练数据,支撑模型在全模态场景下的指令跟随、工具使用与任务分解能力提升;此外,还需进一步探索多智能体协同机制,以及适用于全模态 multi-agent 场景的强化学习方法与训练范式。 具体工作: 参与全模态 Agent 后训练数据构建,开展后训练数据设计与实验研究,并探索全模态 multi-agent 强化学习算法。

任职要求

学历与专业: 来自计算机科学、人工智能、电子信息、信号处理等相关专业的博士/硕士同学,具备扎实的机器学习理论基础,有多模态方向研究经验者优先。 技能要求: 精通PyTorch框架与Python编程;深度掌握Transformer架构及主流MLLM(如LLaVA,Qwen-Audio,Qwen-Omni)原理;熟悉PPO、GRPO等强化学习算法及DeepSpeed/Megatron分布式训练工具。 软性素质: 具备较强的问题分解与独立研究能力;能在模糊问题定义上给出清晰的拆解思路和方法。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:混元多模态-全模态Agentic Model研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。