
智元|多模态理解算法实习生
岗位职责
岗位目标:让机器人“看懂场景、理解指令、做对回应”,提升交互与任务执行可靠性。
岗位职责
- 研发多模态理解模型:视觉-语言对齐、视频理解、场景语义/事件理解、指代消解
- 攻关应用场景难点:开放世界泛化、长尾物体、复杂指代(那个/旁边/刚才)
- 输出结构化语义表示:对象/属性/关系/事件/可操作性(affordance)等,便于规划调用
- 建立评测与数据策略:线上失败归因、难例回流、版本对比与回归测试
- 与Agent/规划/VLN协同,围绕任务成功率与稳定性闭环优化
任职要求
熟悉 Transformer 基础与多模态基本范式(对齐、融合、token/embedding、评测)
- 图文检索、grounding、VQA、视频理解、指代表达理解等任一方向科研背景
- 能使用 PyTorch 复现 VLM/Video Understanding 相关工作,具备数据处理与训练经验
加分项
- 具身语义/导航语义理解经验
- 数据合成、自动标注、弱监督经验
- 顶会论文/专利/高质量开源复现或贡献
智元招聘实习生:多模态理解算法实习生岗位来自智元招聘官网,具体内容以智元招聘官网为准。
