
腾讯|面向真实物理世界的多模态大模型研究实习
岗位职责
课题背景:
随着具身智能系统从仿真环境走向真实物理世界,智能体不仅需要在复杂开放场景中对环境进行精准感知与语义理解,还需要在动态、不确定场景下形成对未来状态的合理预判。传统视觉模型侧重静态识别与检测任务,难以支持空间关系建模、物理逻辑理解以及对潜在变化的推演能力。当前多模态大模型虽具备图文理解能力,但在真实场景中的三维空间建模、跨模态对齐以及物理一致性推理的能力方面仍存在不足。因此,有必要构建面向真实物理世界的多模态感知大模型,实现对语义、空间与物理逻辑的统一建模。
课题价值:
本课题旨在构建具备语义理解、空间推理与物理逻辑建模能力的多模态感知大模型,并在此基础上引入符合物理规律的认知想象机制。通过统一图像、视频、文本等多模态信息,实现对物体属性、相对位置、可供性以及动态演化趋势的结构化表达,为上层Agent提供高质量环境表征,为下层VLA模型提供可执行语义与状态预测支持。该能力将有效提升具身系统在复杂任务中的交互稳定性与动态适应能力,为真实场景下的持续决策与安全执行提供认知基础。
课题挑战:
1、真实世界复杂性挑战:真实环境存在遮挡、光照变化、动态干扰等问题,多模态感知模型需具备高鲁棒性与泛化能力;
2、三维空间与物理逻辑建模难题:现有VLM多基于二维图像理解,缺乏对三维空间结构、物体相对关系及物理约束的深度建模能力;
3、感知到想象的能力跃迁难题:如何在保证感知精度的基础上,引入物理一致性的状态推演能力,是模型设计中的关键问题;
4、数据构建、标注与评测难题:高质量、多模态、带空间与物理标签的数据构建成本高昂,且缺乏统一评测体系。
具体工作:
(一项或多项)
1、通用理解与生成 unified 具身模型研发:参与面向真实物理世界的多模态大模型研发,探索统一感知、理解、想象与推理的具身模型架构,提升模型对语义信息、空间关系、物理规律及任务状态的综合建模能力;
2、面向真实物理世界的人类视频学习:研究利用大规模人类与真实物理世界交互视频,提升模型对任务过程、操作意图、物理状态变化规律理解与泛化能力;
3、大模型架构与训练机制探索:探索适用于具身场景的大模型架构与训练方法,研究其在多模态理解、状态生成与时序推理中的应用潜力;
4、多模态认知与VLA协同:研究多模态大模型的能力如何与 VLA 模型有效结合,探索通过状态建模与交互反馈辅助机器人操作执行,提升在未见任务及复杂任务中的规划能力、稳定性与成功率;
5、数据构建、评测与实验验证:参与多模态数据构建、评测基准设计与实验分析,支持模型在真实物理世界任务中的验证与持续优化。
任职要求
基本要求:
1、计算机、人工智能、自动化、机器人、电子信息等相关专业在读硕士/博士;
2、具备扎实的编程能力,熟悉Python、PyTorch等深度学习开发工具;
3、对多模态大模型、具身智能、世界模型或机器人学习方向有浓厚兴趣。
技能要求(满足一项或多项即可):
1、有LLM/VLM/多模态大模型的预训练、微调或强化学习相关经验;
2、熟悉Transformer、Attention机制及主流大模型架构,理解其在长序列建模、多模态对齐和时序推理中的应用;
3、熟悉AutoRegressive、Diffusion、FlowMatching等生成建模方法,有相关训练或研究经验;
4、熟悉MoE/MoT等模型架构,理解稀疏激活、多路径推理或任务分治等相关机制;
5、有视频/图理解、图生成、时序建模、3D视觉、双目感知相关研究/项目经验;
6、熟悉大规模训练与推理框架,如DeepSpeed、Megatron、vLLM、SGLang等。
加分项:
1、在具身智能、多模态大模型、计算机视觉、机器人、机器学习等方向有科研成果;
2、在CVPR、ICCV、ECCV、NeurIPS、ICML、ICLR、CoRL、RSS、ICRA等顶会/顶刊发表过论文;
3、有开源项目贡献、大规模模型训练/部署经验或较强工程实现能力。
素质要求:
1、对前沿研究有强烈兴趣,具备较强的自驱力与独立探索能力;
2、具备良好的沟通协作能力和团队合作意识;
3、具备较好的问题分析能力、实验迭代能力与英文学术阅读/写作能力。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:面向真实物理世界的多模态大模型研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
