
腾讯|混元多模态-全模态Agentic Model研究实习
岗位职责
课题背景:
随着多模态大模型能力不断提升,模型正从被动感知与理解走向具备规划、推理与行动能力的 Agent 范式。面向真实复杂任务,构建支持文本、视觉、音频、音视频等全模态输入,并能够完成复杂工具调用与多智能体协同的 Agentic Model,已成为多模态智能的重要研究方向。
课题挑战:
本课题的主要挑战在于,如何构建支持全模态输入的 Agent 模型,使其能够将感知、推理与工具调用进行统一建模,并在复杂任务中实现稳定有效的决策与执行;如何设计高质量的后训练数据,支撑模型在全模态场景下的指令跟随、工具使用与任务分解能力提升;此外,还需进一步探索多智能体协同机制,以及适用于全模态 multi-agent 场景的强化学习方法与训练范式。
具体工作:
参与全模态 Agent 后训练数据构建,开展后训练数据设计与实验研究,并探索全模态 multi-agent 强化学习算法。
任职要求
学历与专业:
来自计算机科学、人工智能、电子信息、信号处理等相关专业的博士/硕士同学,具备扎实的机器学习理论基础,有多模态方向研究经验者优先。
技能要求:
精通PyTorch框架与Python编程;深度掌握Transformer架构及主流MLLM(如LLaVA,Qwen-Audio,Qwen-Omni)原理;熟悉PPO、GRPO等强化学习算法及DeepSpeed/Megatron分布式训练工具。
软性素质:
具备较强的问题分解与独立研究能力;能在模糊问题定义上给出清晰的拆解思路和方法。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元多模态-全模态Agentic Model研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
