腾讯|混元多模态-原生多模态模型探索实习

腾讯 · TEG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 原生多模态架构逐渐成为生图的主流方案,例如混元发布的Hunyuan-Image-3.0就是一个原生多模态模型,在文生图和图生图都取得了不错的效果。未来各个模态归一到统一的模型中进行预训练是一个大的研究趋势,其中各种问题都亟需人才进行探索和攻破。 课题挑战: 当前原生多模态模型依然在存在着很多需要探索的方向,在架构、训练策略、数据策略等方向都存在诸多挑战:例如如何进一步扩展原生多模态架构将视频和音频生成统一到一个框架中,如何设计支持图像理解和生成的统一encoder,如何设计LLM、生成、理解的预训练策略来实现更好的协同,如何设计模态融合任务来使得生成、理解互相促进。 具体工作: 青云实习生一部分时间参与上述挑战课题的前沿学术研究,包括但不限于: 1、原生多模态架构设计; 2、理解生成统一Encoder设计; 3、多任务多模态预训练策略探索; 4、多模态协同促进研究探索等。较强的实习生可以参与主模型的训练,成为主模型版本的contributor,并体验工业大模型的生产过程。

任职要求

学历和专业要求: 来自计算机、人工智能、自动化等相关专业的优秀博士/硕士。 技术技能要求: 熟悉深度学习,有扎实的深度学习实践基础;熟练掌握图像&视频生成模型原理并有相关实践经验和相关顶会论文发表;代码能力强,熟练掌握PyTorch。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:混元多模态-原生多模态模型探索岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。