
腾讯|混元多模态-基于统一表征的3D生成理解一体化大模型研究实习
岗位职责
课题简介:3D多模态生成与理解是AI与3D世界进行交互的重要能力,其目标是构建能“看懂、生成、编辑”3D世界的智能系统,支撑元宇宙、机器人、AR/VR等核心应用。然而,现有方法仍面临三大核心瓶颈:一是文本/图片与3D几何、语义的跨模态统一表征难,模态差异导致生成内容与输入指令“语义错位”;二是高质量3D生成的细节与结构缺失,尤其在复杂场景(如室内布局)和精细几何(如物体纹理、部件结构)上,常出现“形状模糊、物理不合理”等问题;三是3D语义理解与编辑的精确性不足,难以实现“按指令修形状、按场景摆物体”的灵活交互。本课题聚焦“3D多模态的统一建模”,围绕表征对齐、生成增强、语义交互展开研究,推动3D智能从“能生成”迈向“高质量、可理解、易编辑”。
研究方向:
1、面向3D的统一表征形式:设计新的表征空间,可以将文本、图片、3D等模态统一编码到该特征空间,实现跨模态对齐,促进3D多模态生成与理解任务;
2、3D理解与生成一体化模型:研发3D多模态架构,包括数据构造、架构设计、模型选型、loss设计等,最终输出兼容多种模态输入输出的3D多模态模型,可同时支持理解与生成任务;
3、细粒度3D语义理解:研究part或更细粒度的3D理解模型,支持在3D模态进行细分、定位、描述等任务,并逐渐从物体级理解升级至场景级理解。
任职要求
1、包含但不限于计算机、模式识别、人工智能、计算机视觉、图形学、自动化、信息工程、应用数学等专业的博士和优秀硕士;
2、熟悉3D数据表征、三维视觉基础、多模态大模型算法、深度学习核心算法,熟练掌握Python及PyTorch/TensorFlow框架,有3D生成、多模态建模等相关项目经验者优先;
3、具备良好的沟通协作能力、较强的问题分析与解决能力,自驱力强,能独立设计实验并推动研究落地,对前沿技术有持续学习热情。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元多模态-基于统一表征的3D生成理解一体化大模型研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
