
中国电子信息产业集团有限公司|【2027】多模态算法工程师(北京)
岗位职责
1、负责具身智能多模态算法核心研发与迭代,聚焦机器人、智能设备场景下视觉、文本、激光雷达、IMU、语音等多传感器信息融合,主导具身感知、场景理解、智能交互、行为决策等核心模块的设计与开发;
2、负责具身多模态大模型的微调、对齐与适配优化,基于VLM、多模态基座模型实现机器人环境感知、指令理解、视觉定位、语义导航、操作预判等能力,解决真实物理场景下感知不准、指令理解偏差、环境泛化性弱等核心问题;
3、落地具身智能核心业务场景,包括但不限于家用/工业机器人交互、自主导航、智能操控、环境语义重构、人机协同作业、端侧具身智能推理等,完成算法从原型设计、仿真验证、真机调试到业务落地的全流程迭代;
4、搭建适配具身场景的多模态数据集,针对真实物理环境、复杂作业场景进行数据采集、清洗、标注、增强和合成,构建机器人专属的视觉-文本-行为多模态训练数据系,支撑模型迭代优化;
5、针对机器人端、嵌入式端设备进行算法工程优化,完成模型轻量化、量化、蒸馏、推理加速,适配端侧低算力、低延迟、高稳定性要求,解决真机部署中的算力受限、环境干扰、实时性不足等问题,保障设备常态化稳定运行;
任职要求
1、硕士、博士应届毕业生;
2、计算机科学、人工智能、机器人工程、模式识别、自动化、电子信息、数学等相关专业;
3、技能要求:
(1)基础能力:具备扎实的机器学习、深度学习、计算机视觉、概率论数理基础,熟悉机器人感知、定位、导航、控制基础原理,理解具身智能“感知-决策-执行”闭环逻辑;
(2)技术栈要求:熟练使用Python,精通PyTorch/TensorFlow主流深度学习框架,具备独立完成具身多模态模型训练、微调、评估、迭代的完整能力;精通Transformer架构,熟悉主流具身多模态模型及方案,包括LLaVA、Qwen-VL、Robo-VLM、视觉语言导航模型、具身世界模型等,掌握视觉-文本-动作跨模态对齐、多传感器融合核心技术;扎实掌握计算机视觉核心技术,包括图像检测、分割、特征匹配、深度估计、视觉定位,熟悉NLP指令理解、Prompt工程、LoRA/QLoRA高效微调方案;熟悉ROS/ROS2机器人开发框架,了解嵌入式端、端侧推理优化,掌握TensorRT、ONNX等部署工具,具备模型轻量化、推理加速实战经验优先。
(3)具备相关项目经验者优先
4、英语通过CET-6。
中国电子信息产业集团有限公司校园招聘:【2027】多模态算法工程师(北京)岗位来自中国电子信息产业集团有限公司招聘官网,具体内容以中国电子信息产业集团有限公司招聘官网为准。
