
腾讯|混元多模态-视觉生成强化学习关键技术研究实习
岗位职责
课题背景:
强化学习后训练技术持续推动基于自回归建模的语言模型在复杂推理问题、长程智能体任务与人类偏好建模等方面的能力飞跃。与此同时,视觉生成模型虽然在图像与视频生成质量方面不断取得突破,但 Diffusion 建模的强化学习技术仍处于快速演进阶段:如何建立合理且可泛化的奖励体系,如何实现有效的多目标优化、抑制 reward hacking,以支撑基于 RL 的有效 scaling,仍是极具挑战、也极具研究价值的开放问题。围绕这些关键问题,视觉生成强化学习有望成为下一阶段图像与视频生成模型能力突破的重要技术方向。
课题挑战:
1、后训练范式持续迭代:面向视觉生成模型的强化学习后训练,基线算法尚未统一。不同技术路线在优化目标、策略建模方式、likelihood 处理、采样路径及训练稳定性假设、适用范围等方面存在显著差异,亟需抽象出通用、可扩展的强化后训练算法方案;
2、强化学习链路与系统架构复杂:强化学习工作流涉及 rollout 采样、奖励计算、训练优化、评测分析等多个环节,系统层面还需统筹数据分发、任务编排、资源调度等关键模块。如何围绕视觉生成 RL 全流程推动算法设计、计算实现与系统架构协同演进,是落地中的重要挑战;
3、奖励与评测体系难以闭环:图像、视频及原生多模态生成任务的优化目标通常同时涉及生成质量、审美偏好、指令遵循、多参考一致性、时序稳定性、物理合理性等多个维度,单一奖励难以完整刻画,自动评测与真实偏好之间也容易存在偏差;
4、优化稳定性与 scaling 难题:Diffusion 模型的多步去噪过程、高维生成空间与稀疏反馈特性使视觉生成 RL 在奖励分配、探索效率、训练稳定性及 reward hacking 抑制等方面面临多重挑战;攻克这些挑战,有望使强化学习后训练从特定评测维度的小范围验证,进一步走向通用、可扩展的训练范式。
具体工作:
你将参与视觉生成模型强化学习后训练算法设计与系统协同优化,结合大规模多模态强化学习系统开展 co-design,支撑图像/视频生成模型能力和产品效果提升,并沉淀中长期技术路线与框架迭代需求。
任职要求
1、包含但不限于计算机、人工智能、自动化、软件工程、数学等相关专业博士,或特别优秀的硕士;
2、熟悉图像或视频生成模型、强化学习相关技术方向,具备扎实的软件工程基础,能够参与算法框架与系统研发;
3、熟悉Diffusion-DPO、ReFL、GRPO-Like等强化学习算法,或Janus、BAGEL、HunyuanImage等原生多模态模型训练,或量化、剪枝、步数蒸馏、稀疏注意力等加速方法,有前期研究积累或业界实践经验者优先;
4、具备较强的问题抽象、科研探索与工程落地能力,能够将模型迭代中的真实痛点转化为系统化技术方案;沟通协作能力强,对前沿生成模型与后训练技术发展有持续热情和独到见解。
腾讯招聘实习生:混元多模态-视觉生成强化学习关键技术研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
