腾讯|混元多模态-多模态强化学习研究实习

腾讯 · TEG · 工作地点:北京 · 更新时间:2026-06-01

岗位职责

课题背景: 近年来,多模态模型快速发展,包括生成模型(Diffusion Models)和理解模型(VLMs),但如何通过强化学习(RL)实现高质量后训练(post-training)来提升模型能力仍是开放问题。本课题将探索面向多模态生成与理解模型的强化学习训练框架,包括生成模型(文生图/视频)与视觉语言理解模型的RL后训练方法,并构建可扩展的RL Infra与Reward系统,以提升模型生成质量、推理效率与任务泛化能力。 课题挑战: 1、多模态RL训练框架搭建:如何构建可扩展的RL Infra,统一训练引擎、推理引擎与reward server,支持生成模型与VLM的高效后训练; 2、生成模型RL算法研究:设计适用于diffusion/生成模型的RL算法,例如dense reward、multi-reward优化及off-policy稳定训练; 3、高效生成与推理优化:探索Sparse/Linear Attention、Quantization、feature cache等技术以加速图像/视频生成; 4、生成蒸馏与RL结合:研究diffusion step reduction与distillation算法,并与RL训练流程融合; 5、多任务reward系统构建:设计reward hub与pipeline,为不同任务构建高质量reward信号。 具体工作: 参与多模态强化学习研究,包括RL Infra搭建、生成模型RL算法设计、推理加速与蒸馏方法研究,以及多任务reward系统构建与实验验证。

任职要求

1、计算机相关专业的博士、硕士、以及特别优秀的高年级本科生; 2、工程代码能力强或理论功底扎实; 3、发表过一作顶会论文,包括ICML/NeurIPS/ICLR、CVPR/ICCV/ECCV。 加分项: 1、有diffusionmodels(image/videogeneration)相关工作发表,并具备一定的大规模训练经验; 2、有RLinfra相关工程搭建经验,熟悉常用的trainingengine(FSDP/Megatron)和inferenceengine(vllm/SGLang),并对生成模型有一定的了解; 3、有VLMagent/tooluse、rewardserver相关工程搭建经验。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:混元多模态-多模态强化学习研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。