
腾讯|混元多模态-视觉智能体强化学习关键技术研究实习
岗位职责
课题背景:
近年来,强化学习后训练技术持续推动大模型在复杂推理、工具调用与智能体任务上的能力飞跃,多模态大模型也正在从“看懂画面的语言模型”演变为“理解环境、规划决策、执行操作、获取反馈”的通用智能体。围绕 GUI Agent、通用视觉智能体等方向,模型需要在网页、桌面、移动端及开放环境中完成感知、推理、动作与反馈闭环,这对多步决策、环境交互、工具使用和长程任务求解能力提出了更高要求。如何构建适用于视觉智能体的强化学习关键技术与系统能力,仍处于快速演进阶段,也是下一阶段多模态模型能力突破的重要方向。
课题挑战:
1、Agentic RL范式探索:如何在多模态环境下构建高效的Agentic RL流程,使视觉智能体能够基于视觉和语言的混合反馈进行高效感知、推理,并自主规划工具调用;
2、训练稳定性与探索-利用权衡:视觉智能体的强化学习训练容易出现模式坍缩、策略退化等问题,影响长期训练的收敛性。需要设计有效的正则化机制、熵控制策略与 Off-Policy 修正算法,实现可扩展的 RL 训练;
3、优化过程的可解释性与白盒诊断工具:视觉智能体强化学习的优化过程涉及多模态输入、复杂网络结构和时序决策,其内部机制常被视为黑盒,缺乏有效的分析工具来诊断优化瓶颈。例如,难以量化基模先验的影响、数据质量与分布偏移的影响、训练与推理一致性、Off-Policy 算法的偏差与方差、梯度异常等。这阻碍了研究者定位问题根源,限制了算法的稳定提升与高效迭代。因此,亟需构建白盒化的可解释性分析框架与诊断工具,以揭示优化过程中的关键影响因素,指导算法设计与系统优化。
具体工作:
你将深度参与视觉智能体强化学习核心算法研究,结合大规模多模态强化学习系统开展 co-design,支撑模型提升关键 Benchmark 与实际业务场景中的智能水平;探索可解释性分析工具,提升训练过程的透明度与调试效率,沉淀中长期技术路线与框架迭代需求。
任职要求
1、计算机、人工智能、自动化、软件工程、数学等相关专业博士,或特别优秀的硕士;在多模态模型训练、强化学习等方向有研究积累或相关实践经验者优先;
2、扎实的深度学习基础,深入理解经典强化学习算法及大模型后训练范式;具备极强的工程实现能力,熟悉Megatron-LM,DeepSpeed或Ray等分布式训练及RL框架者优先;
3、具备较强的问题抽象、科研探索与工程落地能力,能够将模型迭代中的真实痛点转化为系统化技术方案;沟通协作能力强,对视觉理解、视觉智能体的技术发展有持续热情和独到见解。
腾讯招聘实习生:混元多模态-视觉智能体强化学习关键技术研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
