
智元|模型部署优化实习生
岗位职责
1. 参与 PC、端侧 AI 应用原型开发与验证,覆盖数据采集、标注、预处理、模型选型适配、分布式训练加速、训练策略调优、推理链路性能调优全流程;
2. 负责 PC 平台、Jetson 系列开发板(Nano、Orin、Thor 等)的模型训练、工程部署、训练与推理性能优化;
3. 开展大模型 / 视觉模型分布式训练实践,基于 DDP、FSDP、DeepSpeed、ZeRO 优化策略完成多卡训练提速、显存优化;运用混合精度、梯度检查点、梯度累积等技术降低显存开销,支持 LoRA/QLoRA 轻量化微调;
4. 开展训练链路瓶颈分析,利用 PyTorch Profiler、Nsight 等工具定位计算、通信、数据 IO 瓶颈,优化数据加载管线,提升训练吞吐与稳定性;
5. 落地模型压缩方案:量化、剪枝、知识蒸馏;依托 ONNX、TensorRT、TRT-LLM 完成模型转换、编译与端侧推理加速;
6. 参与 VLA 视觉语言动作模型、大语言模型部署落地,使用 CUDA、vLLM、llama.cpp 开展推理瓶颈定位与性能调优;
7. 持续优化训练收敛效果、推理延迟、显存占用,开展对比实验与方案验证;
8. 撰写技术文档:部署手册、性能测试报告、训练 / 推理优化方案、技术总结;
9. 定位解决训练、推理阶段各类软硬件问题,配合团队推进项目落地,完成其他 AI 模型开发相关任务。
任职要求
1. 在读本科及以上学历,计算机科学与技术、人工智能、电子信息、自动化等相关专业;
2. 扎实 Python 基础,具备 C/C++ 开发能力,熟练使用 Ubuntu Linux 开发环境;
3. 掌握深度学习基础理论,熟练使用 PyTorch 框架;
4. 了解分布式训练相关技术,包括 DDP、FSDP、DeepSpeed、ZeRO 优化、混合精度训练、梯度检查点、LoRA/QLoRA 微调等;能够使用 Profiler、Nsight 等工具剖析训练性能瓶颈,了解 NCCL 通信优化、多机多卡训练者优先;
5. 了解模型压缩技术:量化、剪枝、知识蒸馏;熟悉 ONNX、TensorRT 模型转换与推理优化工具;
6. 拥有 Jetson 端侧模型部署、性能调优实战经验优先;
7. 了解 VLA 视觉语言动作模型,掌握基础 CUDA 编程,接触过 vLLM、TRT-LLM、llama.cpp 大模型推理框架优先;
8. 具备较强问题排查、自主学习能力,良好的沟通与团队协作意识,工作主动负责;
9. 每周至少实习 4 天,可连续实习 3 个月及以上优先。
10. 以上提到的技术会一部分即可。
智元招聘实习生:模型部署优化实习生岗位来自智元招聘官网,具体内容以智元招聘官网为准。
