腾讯|微信-统一理解和生成的多模态多语言大模型研究实习

腾讯 · WXG · 工作地点:上海 · 更新时间:2026-06-01

岗位职责

随着人工智能技术的快速发展,多模态大模型已成为当前学术界与工业界的核心研究方向之一。本课题依托海量的图文等多模态数据资源与业务场景,聚焦于构建能够在统一框架下同时完成多模态理解与生成任务的大模型。 研究目标涵盖以下核心方向: 1、统一架构设计:探索将图像、文本多种模态在统一的模型架构下进行联合建模,打破理解与生成任务之间的割裂,实现端到端的多模态能力融合。 2、多模态理解:研究跨模态语义对齐、细粒度视觉-语言理解、多模态推理等关键技术,提升模型对复杂场景的认知、问答、翻译能力。 3、多模态生成:探索高质量图像及多模态内容的生成技术,包括文生图、图文互生等方向,满足微信生态多模态翻译场景需求(包括端到端图片翻译、游戏图片翻译、多语言图片编辑等)。 4、大规模高效后训练:研究适用于超大规模数据的后训练RL算法,以及参数高效的微调方法(如 LoRA、Adapter 等),支撑模型在实际产品中的快速落地。

任职要求

基本条件 1、计算机科学、人工智能、电子信息、统计学等相关专业,本科及以上学历(优秀硕士或博士); 2、对多模态大模型、视觉-语言模型、生成式 AI 等方向有浓厚兴趣,具备扎实的深度学习理论基础; 3、熟练掌握 Python,熟悉 PyTorch 或 JAX 等主流深度学习框架; 4、具备良好的科研素养,能够独立阅读和复现顶会论文。 优先条件(具备以下任一者优先考虑) 1、在 NeurIPS、ICML、ICLR、CVPR、ICCV、ECCV、ACL、EMNLP 等顶级学术会议或期刊发表过论文; 2、有多模态模型(如 LLaVA、Flamingo、DALL-E、Stable Diffusion、Sora、QwenImage 等)复现或改进经验; 3、参与过大规模预训练项目(百亿参数及以上),熟悉分布式训练框架(如 Megatron-LM、DeepSpeed、verl); 4、有图像/视频生成、视觉问答(VQA)、图文检索等方向的项目经验; 5、熟悉 RLHF、DPO、GRPO、OPD 等后训练技术在多模态场景下的应用。

腾讯招聘实习生:微信-统一理解和生成的多模态多语言大模型研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。