腾讯|混元多模态-视频世界模型(Video World Models)与底层系统研究实习

腾讯 · TEG · 工作地点:北京 · 更新时间:2026-06-01

岗位职责

课题背景: 本课题聚焦于构建下一代交互式“视频世界模型(Video World Models)”,致力于让基础模型直接从海量互联网数据中学习物理规律、因果关系、动作空间以及复杂的动态变化等。Scaling世界模型,需要突破GPU计算的极限。本课题处于生成式AI大模型与高性能机器学习系统(ML Systems)的交叉领域,我们需要具备全栈能力的极客研究员(hacker-researchers)。既是前瞻视野的理论探索者,也是顶尖的工程师。能够设计新的模型架构,同时在万卡GPU集群上构建高度优化的训练infra。 课题挑战: 1,基础模型架构的设计与扩展:如何有效融合Diffusion, Autoregressive Transformers, VAEs, LLMs, VLMs等模块,在海量视频数据集上设计并训练下一代的交互式世界模型; 2,超大规模分布式训练系统构建:如何设计高扩展性的分布式训练系统,利用不同的并行策略,在超大规模GPU集群上高效训练海量参数的基础模型。面对极高的计算与显存压力,如何对模型架构进行深度性能剖析与极致优化,打破算力与资源的物理壁垒; 3,底层算子与实时推理优化:如何编写高性能的定制化底层算子(Kernels),最大化模型算力利用率(MFU),从而满足真实交互场景下超低延迟的实时推理需求。 具体工作: 你将参与到下一代交互式视频世界模型的前沿架构设计和训练,海量数据的高效处理,超大规模分布式训练系统的搭建,模型显存与计算瓶颈的剖析调优,基于CUDA/Triton等高性能底层算子的开发等工作中,软硬协同,全面提升视频世界模型的训练效率与实时交互推理能力。

任职要求

1、包含但不限于计算机科学、机器学习、计算机体系结构或相关专业的博士和优秀硕士; 2、具备卓越的代码开发和工程实现能力,熟练掌握Python或其他语言,有算法或编程竞赛(如ACM等)背景者优先考虑; 3、拥有AIinfra和大规模机器学习系统开发经验(如PyTorchFSDP、Megatron等),具备CUDA/Triton经验者优先; 4、在生成模型领域具备扎实的理论基础和实践经验,深入理解生成模型范式(Diffusion,ViT,Autoregressivemodeling,连续和离散的Tokenizer等); 5、在人工智能顶级学术会议(如NeurIPS、ICLR、ICML、CVPR、ICCV)或顶级机器学习系统会议(如MLSys、OSDI、ASPLOS)上有第一作者的论文发表记录。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:混元多模态-视频世界模型(Video World Models)与底层系统研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。