腾讯|混元多模态-视频生成基础模型实习

腾讯 · TEG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 视频生成大模型正逐渐从学术研究走向应用落地。混元近年来先后发布并开源的 Video1.0、1.5 等模型均取得了业界的高度关注。未来视频的音画一致生成和多模态参考生成是应用潜力巨大的方向。 课题挑战: 1、高质量音画一致生成:如何在数据、模型架构、训练策略等多个维度进行优化以实现复杂多人场景下高质量、影视级的音画一致生成; 2、视频生成在提升分辨率和时长后,训练和推理效率成为制约视频能力和质量提升的关键瓶颈,如何在保持质量的前提下提升训推效率(例如优化 attention 设计)是一个重要挑战; 3、音视频的参考生成涉及文本、图、音频、视频等多种模态的条件输入。如何实现多模态条件的有效融合和控制是未来多媒体一体化创作的关键挑战。 具体工作: 负责上述课题挑战的预研工作,优秀的解决方案有机会进入未来的主模型版本并成为核心贡献者。同时较强的实习生也可以参与到当前主模型版本的训练中,成为主模型版本的贡献者,并体验工业大模型的生产过程。

任职要求

学历和专业要求: 来自计算机、人工智能、自动化、数学等相关专业的优秀博士/硕士。 技术技能要求: 熟悉深度学习,有扎实的深度学习实践基础;熟练掌握图像&视频(&音频)生成模型原理,有相关实践经验和相关顶会论文发表;代码能力强,熟练掌握PyTorch。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:混元多模态-视频生成基础模型岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。