
蔚来|大模型推理框架工程师实习生
岗位职责
1、参与大模型推理引擎核心模块的设计、开发与测试,提升系统吞吐、降低推理延迟与成本;
2、探索并验证先进推理加速方案,如量化、KV Cache、PagedAttention、连续批处理、投机解码、分布式推理、算子优化等;
3、参与推理平台与云平台建设:基于 Kubernetes/K8s、Docker、Helm 等,实现模型部署、弹性扩缩容、灰度发布、多租户资源隔离、监控告警与 CI/CD;
4、参与 GPU/NPU 资源调度与集群利用率优化,提升推理服务稳定性与云平台资源管理效率;
5、跟踪开源社区(如 vLLM、TensorRT-LLM、SGLang、LMDeploy 等)前沿动态,完成技术调研、复现与验证;
6、与算法、业务和平台团队协作,优化端到端推理体验。
任职要求
1、本科及以上在读,计算机、AI、软件工程、电子信息、数学等相关专业;
2、熟悉 Python,了解大模型 Transformer 基本工作原理;
3、具备良好的工程习惯,熟悉 Linux、Git,学习能力强,能阅读英文技术资料;
4、了解或对 Kubernetes/K8s、Docker、云平台、云原生技术有浓厚兴趣;
5、乐于沟通协作,对 AI Infra、大模型推理方向有热情;
6、能保证稳定实习时间,有较强的自我驱动能力。
加分项(非必需)
有 vLLM、SGLang、TensorRT-LLM、LMDeploy 等推理框架使用或二次开发经验;
有 CUDA/Triton 算子编写经历;
有 Kubernetes、Docker、云平台、Ray、Volcano、Kueue、Prometheus/Grafana 等云原生或 MLOps/LLMOps 实践经验;
有 LLM 相关论文、开源项目、竞赛经历或高质量技术博客;
有模型部署、压测、性能分析、监控告警相关经验。
我们提供
资深大佬 1v1 带教,直接参与核心模块,拒绝边缘打杂;
真实业务场景 + 充足 GPU/NPU 资源,以及 K8s/云平台真实生产环境;
一群热爱技术的同龄人,一起把技术做深做透;
接触大模型推理与云原生 AI 基础设施前沿,支持技术分享、开源贡献与论文发表;
蔚来招聘实习生:大模型推理框架工程师实习生岗位来自蔚来招聘官网,具体内容以蔚来招聘官网为准。
