腾讯|混元多模态-面向多模态强化的全异步训推解耦系统与极致分布式架构的研究实习

腾讯 · TEG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 在多模态大模型(如高分辨长图文问答、超长视频解析)的强化学习对齐中,传统的同步PPO架构强制推理与训练串行执行。由于多模态数据(如不同时长的视频)和不同难度的任务带来的推理延迟差异极大,同步架构会产生严重的GPU空转气泡(Bubble)与流水线阻塞。为实现多模态理解模型的高效迭代,亟需打破同步壁垒。本课题旨在构建一套全异步的多模态RL底层架构,将海量多模态张量的生成与训练深度解耦,实现异构计算资源的高效并发,极致提升多模态强化的综合吞吐。 课题挑战: 该课题面临三大极具挑战的系统与算法协同难题:第一,全异步架构下的多模态算法收敛稳定性。异步训练不可避免地引入策略延迟(Staleness),导致经验生成策略与更新策略产生严重偏差(Off-policy)。在多模态理解(如长视频)高方差的Reward下,陈旧数据的异步更新极易打破PPO的信任域(Trust Region),导致KL散度爆炸和模型崩溃;第二,高频参数同步与无阻塞流水的博弈。训练节点需将更新后的千亿参数高频异步下发至推理节点,如何在不中断大并发生成(无阻塞)的前提下完成参数的高效热更新,是全异步架构的核心挑战;第三,海量多模态特征流转与网络风暴。训推节点隔离后,跨节点高频并发传输海量高清视频张量、中间态Logits等异构数据,极易耗尽RDMA带宽。 具体工作: 构建训推解耦的全异步多模态强化编排与调度框架;研发基于RDMA的高吞吐多模态数据管道与无阻塞参数热更新机制;设计并实现补偿策略延迟(Staleness)的异步对齐算法与稳定训练Infra。

任职要求

学历专业要求: 应届博士毕业生,计算机体系结构、分布式系统、高性能计算或人工智能等相关专业。 技能要求: 精通C++/Python与高并发系统开发;深入理解Ray、Megatron、vLLM等分布式框架底层机制;熟悉异步RL/PPO算法逻辑及延迟补偿数学原理;具备大规模异步架构设计与RDMA通信优化经验。

腾讯招聘实习生:混元多模态-面向多模态强化的全异步训推解耦系统与极致分布式架构的研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。