阿里巴巴|大模型Infra研发工程师(训练/推理)

阿里巴巴 · 阿里云 | Token Foundry · 北京/杭州/上海 · 更新时间:2026-08-06

岗位职责

1. 负责大模型全链路训练优化,攻克 Scaling Law 过程中的分布式性能瓶颈,提升 MFU(算力利用率)和训练稳定性,保障万亿级参数模型的交付; 2. 设计并研发领先的推理引擎,包括但不限于算子融合、动态图优化、量化压缩(FP8/INT4)、高效 CUDA 算子开发等,降低模型在线时延与计算成本; 3. 针对特定业务场景,进行软硬件联合优化,实现从预训练、SFT、RLHF 到模型部署的端到端技术突破。

任职要求

1. 本科及以上学历,计算机、人工智能、软件工程、数学相关专业优先; 2. 精通 C++/Python,具备卓越的工程实现能力;熟练掌握 PyTorch 或 TensorFlow,深入理解其内部机制及算子实现; 3. 熟悉 GPU 硬件架构及并行计算原理,掌握主流训练框架或推理框架; 4. 熟悉 Transformer 架构,对模型量化、蒸馏、剪枝或算子优化(CUDA/Triton)中的某一项有深入研究或实践经验。 5. 具备极佳的逻辑分析能力和数理基础,对前沿问题有持续热情,能适应快节奏的研发环境,具有跨学科协作意识。 【加分项】 1. 科研影响力: 在 NeurIPS, ICLR, ICML, ACL, OSDI, SOSP 等计算机顶会以第一作者发表过论文; 2. 深度参与过主流 MLSys 相关开源项目(如 vLLM, OpenRLHF, Megatron 等)的开发或在 ACM/ICPC、Kaggle 等竞赛中获得过顶尖名次。

阿里巴巴校园招聘:大模型Infra研发工程师(训练/推理)岗位来自阿里巴巴招聘官网,具体内容以阿里巴巴招聘官网为准。