腾讯|复杂3D场景的多模态理解与生成实习

腾讯 · IEG · 工作地点:上海 · 更新时间:2026-06-01

岗位职责

课题背景: 大模型的深层语义理解需超越"看图说话"的表层认知。当前主流方案(如UnrealLLM等)依赖多视角渲染或资产元数据匹配,难以捕获空间拓扑、物理约束与交互可用性(Affordance),导致视觉感知与物理逻辑割裂。本课题旨在建立3D原生数据结构与大模型高维语义空间的精准对齐机制,打通"视觉-物理"的认知壁垒。 课题价值: 1、理论范式:构建多模态场景语义图(Multimodal Scene Graph),实现视觉特征、物理属性与逻辑约束的统一表征,为下一步的生成和编辑提供高维推理认知基座; 2、应用突破:攻克"知其形而不知其理"的认知瓶颈,使大模型深度理解资产间的空间关联与交互机制,支撑3D场景的动态生成与复杂推理; 3、引擎验证:基于游戏引擎或3D制作工具理解场景,进一步根据用户指令生成场景。

任职要求

1、包含但不限于计算机、人工智能、图形学等相关专业的硕士或优秀本科生; 2、深入理解UE底层架构(UObject体系、渲染管线),熟练掌握C++/Python编程; 3、熟悉多模态大模型(MLLM)、3D表征学习或图神经网络(GNN)的前沿进展,具备较强的模态对齐算法落地能力。

腾讯招聘实习生:复杂3D场景的多模态理解与生成岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。