理想汽车|【基座模型】全模态感知算法实习生

理想汽车 · 杭州 · 更新时间:2026-08-04

岗位职责

汽车以及机器人全模态Edge模型建设,实现具身交互always on全模态感知能力,作为具身交互入口,判断用户和环境的交互意图,建设具备主动感知能力、工具调用、数字和物理世界统一建模、视频流与多模态记忆,可于马赫芯片高效部署的全模态底座模型。包括原生架构设计、视频流token压缩、编码器特征对齐、多模态统一空间、强化学习、多模态蒸馏、量化裁剪压缩等,作为具身交互中高层语义感知和理解的大脑,配合本体操作和移动,形成完成的具身智能汽车和机器人的交互体验: 1. 负责原生全模态大模型基座架构设计和训练交付,包含多模态大模型预训练、后训练和强化学习等; 2. 负责VL模型的蒸馏方案设计、长时序视觉Token压缩方案设计、隐式COT推理能力和空间理解能力增强等落地交付; 3. 配合harness方案,进行视觉大模型实际训练和落地,配合自研马赫芯片保证全模态基座模型在端侧达到性能和速度要求; 4. 负责多模态记忆提取和检索方案建设。

任职要求

1. 负责原生全模态大模型基座架构设计和训练交付,包含多模态大模型预训练、后训练和强化学习等; 2. 负责VL模型的蒸馏方案设计、长时序视觉Token压缩方案设计、隐式COT推理能力和空间理解能力增强等落地交付; 3. 配合harness方案,进行视觉大模型实际训练和落地,配合自研马赫芯片保证全模态基座模型在端侧达到性能和速度要求; 4. 负责多模态记忆提取和检索方案建设。 职位要求 1. 硕士及以上学历,自动化、计算机等相关专业; 2. 必须有视觉VLM、VLA优化经验; 3. 优秀的代码技术功底,熟练掌握模型强化学习技术、多模态大模型模型蒸馏、视觉Token压缩、空间感知增强等技术中的一种。 具备以下条件优先: 1. 在NeurlPS/ICLR/ACL/EMNLP/CVPR/ICCV等会议或期刊上发表过论文者优先; 2. 获得过国际或国内重要赛事奖项者优先。 3. 在大模型领域有主导过有影响力项目或者核心技术发布者优先。 视觉大模型VLM、多模态强化学习后训练、视觉流建模、token压缩方向研发及实习经验为佳

理想汽车招聘实习生:【基座模型】全模态感知算法实习生岗位来自理想汽车招聘官网,具体内容以理想汽车招聘官网为准。