
腾讯|混元多模态-面向多模态低精度强化学习的稳定训练架构和数值对齐系统的研究实习
岗位职责
课题背景:
在多模态理解大模型(如复杂高分辨图文问答、超长视频解析)的强化后训练过程中,PPO算法需高频交替进行经验生成(推理)与网络更新(训练)。由于需同时在显存中维持多个模型状态,并处理海量多模态长序列特征,集群面临严峻的“显存墙”与性能瓶颈。本课题旨在引入极低精度(如FP8/INTx/FP4)计算,核心目标是大幅削减PPO全链路的峰值显存占用,打破显存带宽限制,从而极致提升多模态强化学习中“推理生成”与“训练更新”的综合吞吐性能。
课题挑战:
本课题需解决算法数值特性与底层硬件架构深度耦合的三大难题:第一,多模态理解特征的异常值(Outliers)处理。超长视觉特征与文本分布差异巨大,存在海量难以预测的激活极值,传统的极低精度静态缩放极易产生截断误差,导致梯度爆炸;第二,RL算法对舍入误差的极度敏感性。PPO中的优势函数计算及Actor-Critic梯度的微小扰动,在低精度下会被非线性放大,极易引发Reward Hacking或策略坍塌;第三,低精度下训推一体的极致显存与性能调度。PPO跨越推理与训练,如何在FP8等计算态下,实现多模态动态分块量化、底层KV显存的高效复用,以及混合精度算子的完美交织,最大化整体性能,难度极高。
具体工作:
开展极低精度多模态强化学习的数值稳定性研究,攻克梯度异常难题;开发高效的FP8/INTx定制化多模态CUDA算子;开发面向长序列视频场景的sparse attention和低精度attention的加速方案;构建兼顾高吞吐与极低显存的端到端低精度多模态强化训推系统。
任职要求
学历专业要求:
来自海内外顶尖高校应届硕士和博士毕业生,计算机体系结构、人工智能、高性能计算或相关专业。
技能要求:
精通C++/Python及CUDA/Triton内核开发;深刻理解大模型量化加速(FP8/PTQ等)技术以解决显存与性能瓶颈;熟悉RLHF/PPO算法与分布式架构;具备Megatron/vLLM核心源码级优化能力。
腾讯招聘实习生:混元多模态-面向多模态低精度强化学习的稳定训练架构和数值对齐系统的研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
