腾讯|多模态大模型在游戏场景中的研究与应用实习

腾讯 · IEG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 近年来,以GPT-4o、Gemini、Qwen-VL为代表的多模态大模型(Multimodal Large Language Models, MLLMs)在通用视觉理解、跨模态生成等领域取得了突破性进展,成为AI领域最受关注的前沿方向之一。游戏作为天然的多模态富媒体场景,涵盖画面、文本、音频、视频、UI界面、3D模型及玩家行为序列等多种异构信息,为多模态大模型提供了极具价值的落地土壤。然而,当前通用多模态大模型在游戏这一"高度风格化、强交互、强实时"的垂直领域中,仍面临领域适配不足、游戏画面细粒度理解能力欠缺、生成可控性弱、游戏专有知识匮乏等核心挑战。因此,本课题聚焦于将多模态大模型的通用能力高效迁移并深度适配至游戏场景,释放其在游戏研发、运营、测试及玩家体验全链路中的价值。典型应用场景例如:基于游戏截图/视频的智能UI元素识别与状态解析,自动化检测穿模、渲染异常等画面缺陷;构建"看懂游戏画面、理解游戏语境"的多模态对话系统,实现基于截图的智能客服问答、游戏攻略自动生成;游戏视频长时序理解,包括操作序列识别、高光时刻自动提取与战斗片段智能摘要等等。 课题挑战: 1、游戏领域多模态数据建设: 游戏画面具有高度风格化、类别多样、UI元素密集等特点,如何构建高质量的游戏领域多模态训练数据集与评测Benchmark?如何设计高效的数据标注流水线与自动化数据合成策略,以覆盖游戏场景中的多样视觉理解与生成需求? 2、游戏视觉细粒度理解与定位: 游戏画面中包含大量领域特有的视觉元素(技能图标、状态栏、小地图标注、装备属性面板等),通用多模态模型的识别精度不足。如何通过领域适配微调、视觉Grounding增强等方法,使模型具备对游戏画面的细粒度理解与精确定位能力? 3、游戏视频长时序理解与推理: 游戏视频包含复杂的时序动态信息(操作序列、战斗节奏、剧情进展),如何在长视频理解中平衡计算效率与时序建模精度?如何使模型具备跨时间步的因果推理与事件关联能力? 4、游戏专有知识融合与多模态检索: 游戏场景中存在大量专有术语、机制规则、版本更新知识等,如何将结构化/非结构化的游戏知识与视觉信息高效融合?如何构建统一的游戏多模态表征空间,实现"以图搜资产""以文本检索3D模型"等跨模态检索能力? 5、推理效率与部署优化: 游戏场景对实时性要求高(如实时画面理解、在线客服响应),大规模多模态模型的推理延迟和计算开销难以直接满足线上需求。如何通过模型蒸馏、量化、推测解码等技术实现多模态大模型在游戏场景中的高效部署? 具体工作: 你将参与到游戏领域多模态数据集构建与Benchmark设计、多模态大模型的游戏领域适配微调(视觉理解/对话)、游戏画面细粒度理解与视觉Grounding能力建设、游戏视频长时序理解与高光时刻提取、游戏多模态知识库构建与跨模态检索系统搭建、以及模型推理优化与线上部署等工作中,提升多模态大模型在游戏研发、运营、测试与玩家体验全链路中的实际应用能力。

任职要求

1、包含但不限于计算机科学、人工智能、模式识别、信息工程、多媒体技术、计算机视觉、自然语言处理、电子工程、应用数学、统计学、自动化、软件工程等专业的博士和优秀硕士; 2、熟练掌握多模态大模型(如CLIP、LLaVA、Qwen-VL、GPT-4V等)的基本原理与技术架构,熟悉视觉-语言预训练、指令微调、RLHF等核心方法,具备大模型训练/微调的实践经验; 3、熟悉PyTorch、DeepSpeed、Hugging Face Transformers等至少一个主流深度学习/大模型训练框架,具有较强的工程实现能力; 4、熟悉Shell/Python等编程语言,具备良好的代码规范与实验管理习惯; 5、加分项:在计算机视觉、多模态学习、NLP等相关领域发表过顶会/顶刊论文(如CVPR、NeurIPS、ACL、ICLR、AAAI等);有多模态大模型相关开源项目维护经验;有游戏行业相关项目经历。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:多模态大模型在游戏场景中的研究与应用岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。