腾讯|面向通用机器人操作的具身多模态模型实习

腾讯 · TEG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 随着视觉大模型和多模态模型的发展,机器已经基本具备“看得懂、听得懂”的能力,但在真实世界中“稳定干活”仍明显不足。现实中存在形态各异的机器人,分布在家庭、商用、工业等不同场景,当前主流仍是“单本体、单场景、单任务”的定制方案。因此亟需一个统一视觉、语言与动作决策的通用 VLA 基础操作模型,作为跨本体、跨场景具身智能应用的共性底座。 课题价值: 通用、稳定的 具身操作模型(如VLA) 基础操作模型可以像“操作层 GPT”一样,为多种机器人本体提供统一的感知–理解–操作能力,让不同厂商和不同类型机器人在同一模型之上复用抓取、搬运、装配、服务等基础技能,实现生活与工业场景之间的知识迁移与任务泛化 课题挑战: 1、泛化性 / 通用性:对特定数据和本体依赖重,难以在新本体、新物体组合和新任务指令上做到可靠的零/少样本视觉–语言到行动迁移; 2、准确率:非结构化环境下的光照、遮挡和动态干扰会放大为执行偏差,抓取、插拔、装配等操作成功率和精度仍不足; 3、节拍慢 / 时延高:大模型推理开销大,响应速度难以满足工业节拍和高频实时交互需求; 4、缺乏记忆:多为短时上下文,缺少对历史状态和子任务的长期记忆,易在多步、长周期任务中丢步骤、难恢复; 5、力触融合难:将力觉、触觉与视觉、语言有效融合以理解力度、摩擦和约束并保证安全,同时控制数据成本、模型复杂度和推理延迟,工程实现难度高。 具体工作(一项或多项): 1、通用VLA模型研发:参与视觉-语言-动作(VLA)基础模型的架构设计与训练,探索跨本体统一动作表征与零/少样本迁移方法; 2、世界模型与视频生成驱动的操作学习:探索基于视频生成模型/世界模型(World Model)的操作策略学习路线; 3、模型推理加速与部署:研究模型量化、蒸馏、动作chunk并行预测及分层异步决策等加速方案,推动模型在边缘端的实时部署; 4、长时记忆与多步任务执行:设计面向长周期任务的记忆机制与层次化规划策略,提升多步骤复杂任务的鲁棒执行与异常恢复能力; 5、多模态感知融合:研究力觉、触觉与视觉、语言的对齐融合方法,支撑精密操作与安全交互场景; 6、仿真与真机实验:在主流仿真平台搭建评测环境,完成sim-to-real验证;撰写技术报告。

任职要求

基本要求: 1、计算机、人工智能、机器人、自动化等相关专业在读硕士/博士; 2、扎实的数学基础与良好的编程能力(Python/PyTorch)。 技能要求(满足一项或多项即可): 1、有Transformer、扩散模型、VQ-VAE等生成模型的训练经验; 2、有LLM/VLM预训练、微调或推理优化经验,熟悉DeepSpeed、vLLM等框架; 3、有模仿学习、强化学习或机器人操作策略学习经验,了解ACT、DiffusionPolicy、RT系列、OpenVLA、π₀等工作; 4、有视频生成模型(Sora、SVD、CogVideo等)或世界模型(UniSim、GAIA-1、GameGen等)相关研究或项目经验; 5、熟悉ROS/ROS2,有真实机械臂或移动操作平台实验经验; 5、有3D视觉、触觉/力觉传感或机器人仿真(IsaacSim、MuJoCo等)经验。 加分项: 1、在CoRL、RSS、ICRA、NeurIPS、ICML、CVPR等顶会/顶刊发表过论文; 2、有开源项目贡献或大规模模型部署工程经验; 3、具备跨学科背景(机械、控制×深度学习)。 素质要求: 对具身智能方向有浓厚兴趣,具备自驱力与独立研究能力良好的团队协作、沟通能力与英文学术写作能力。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:面向通用机器人操作的具身多模态模型岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。