
腾讯|游戏AI-基于多模态大语言模型的游戏Agent:感知、决策与交流一体化研究实习
岗位职责
课题背景:
近年来,游戏Agent已成为提升玩家体验的关键技术之一,强化学习等人工智能技术的突破,使得游戏Agent能够通过与环境的持续交互进行训练,从而学会完成复杂任务、制定长期策略等能力。然而,基于传统强化学习的Agent缺乏自然语言理解与对话能力,难以实现拟人化的沟通与协作,制约了沉浸式交互游戏体验的进一步提升。
本课题旨在探索以多模态大语言模型(MLLM)为核心驱动,升级游戏Agent的交互与认知能力,最终实现具备“感知、交流、决策”能力的Agent。本课题涉及多模态理解、游戏状态表示与压缩、视觉-语言-动作建模(VLA)、以及基于世界模型(World Models)等多个研究方向。
课题挑战:
1、游戏状态感知与理解:当前主流多模态大模型主要面向图像、视频、音频与文本理解,缺乏对复杂、高维动态游戏状态的有效建模能力,难以直接基于高维动态信息进行实时决策与上下文相关的对话生成;
2、模型结构设计:如何设计一个Agent框架和模型结构,使得Agent具备“能听、会说、会玩”的能力;
3、推理效率与成本:游戏状态信息较多且复杂,若直接作为提示输入大模型,过长的上下文将对模型效果、推理延迟及计算成本产生显著影响;
4、泛化与拓展性:如何提升游戏Agent的泛化拓展能力,涉及游戏状态的统一表示,以及模型的统一建模等,使得Agent能够处理不同场景不同品类的游戏。
具体工作:
主要参与游戏Agent的模型结构设计(涉及多模态结构)、训练数据构建、奖励函数设计、强化学习算法优化(PPO、GRPO等)、性能优化及效果评估等研发工作,旨在提升游戏Agent的决策能力与交互体验。
任职要求
1、包括但不限于计算机、信息工程、人工智能、自动化、应用数学等相关专业的博士或优秀硕士在读;
2、对LLM/VLMAgent、RL后训练有深入理解;
3、具备优秀的科研视野与工程实现能力,熟练掌握PyTorch等深度学习框架。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:游戏AI-基于多模态大语言模型的游戏Agent:感知、决策与交流一体化研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
