
千里科技|自动驾驶算法预研实习生(VLA/WM方向)
岗位职责
岗位方向
本岗位面向自动驾驶下一代端到端智能驾驶算法研究,重点探索 VLA、VLM、世界模型、视频生成模型、三维重建与场景理解等前沿技术在自动驾驶中的应用。实习生可根据个人背景和兴趣选择以下两个方向之一深入参与:
方向一:自动驾驶 VLA 算法研究
围绕主流 Vision-Language-Action 模型、自动驾驶 VLM/VLA、端到端规划模型开展调研、复现、改进与论文撰写工作。重点探索如何利用视觉语言模型的场景理解、交互推理、轨迹推理能力,提升自动驾驶在复杂长尾场景下的决策与规划表现。
方向二:自动驾驶世界模型研究
基于 JEPA、VGGT、Wan、视频生成模型、3D 重建模型等现有方案,探索构建可复用的自动驾驶世界模型。目标是实现一个能够服务于 VLM/VLA 的场景表征、未来预测、三维理解、动态建模,为下游自动驾驶感知、预测、规划和推理任务提供统一的世界表征。
岗位职责
1.跟踪自动驾驶 VLA、VLM、世界模型、视频生成、3D 视觉基础模型等前沿方向,完成高质量论文调研、技术路线分析和实验方案设计。
2.参与自动驾驶 VLA 方向的算法研发,包括但不限于多模态场景理解、语言条件规划、轨迹推理、行为决策、VLM Feature注入、AE设计等。
3.参与自动驾驶世界模型方向的算法研发,包括但不限于场景重建、未来帧/未来状态预测、动态场景建模、三维空间表征、视频生成式仿真、latent world model 等。
4.基于现有开源模型或主流方案进行复现、改造与创新,例如 JEPA、VGGT、Wan、Diffusion、Flow Matching、Transformer、VLM/VLA 等。
5.构建可复用的自动驾驶世界模型模块,使其能够为下游 VLM/VLA 提供场景 token、3D 表征、时序动态特征、未来预测特征。
6.参与实验设计、数据处理、模型训练、指标评测、消融实验和结果分析,推动算法在自动驾驶数据集或内部场景中的验证。
7.参与论文撰写、技术报告整理和实验结果可视化,支持高水平会议或期刊投稿。
任职要求
1.计算机、人工智能、自动化、机器人、车辆工程、电子信息、应用数学等相关专业,硕士或博士在读优先。
2.熟悉 Python,具备良好的 PyTorch 深度学习开发能力,能够独立完成模型训练、调试、复现和实验分析。
3.具备较好的深度学习基础,理解主流模型范式。
4.对自动驾驶、具身智能、VLA/VLM、世界模型、视频生成、三维重建、端到端规划等方向有浓厚兴趣。
5.具备较强的英文论文阅读能力,能够快速理解前沿论文,并总结其核心方法、创新点、实验设计和可改进空间。
6.具备较强的工程实现能力和自驱力,能够在不确定的研究方向中主动拆解问题、设计实验并推动结果落地。
7.每周可实习 4 天及以上,连续实习 3 个月以上;可实习 6 个月及以上者优先。
加分项
1.有自动驾驶、机器人、具身智能、多模态大模型、VLA/VLM、世界模型相关研究或项目经验。
2.熟悉 NAVSIM等自动驾驶数据集或方法。
3.有 CVPR、ICCV、ECCV、NeurIPS、ICLR、ICML、CoRL、ICRA、IROS 等会议论文投稿经验或高质量论文复现经验。
4.熟悉视频生成模型、三维重建模型或 3D 基础模型,如 Wan、Sora 类视频生成模型、VGGT、DUSt3R、MASt3R、3DGS、NeRF、Depth Anything 等。
5.熟悉 VLM/VLA 训练流程,包括多模态指令数据构建、视觉编码器、action head 设计、LoRA 微调等。
6.有较强的代码工程能力,熟悉分布式训练、混合精度训练、模型加速、数据缓存、实验管理等。
千里科技招聘实习生:自动驾驶算法预研实习生(VLA/WM方向)岗位来自千里科技招聘官网,具体内容以千里科技招聘官网为准。
