中粮集团|优粮生计划-AI管理员

中粮集团 · 中粮悦享企业服务(雄安)有限公司 · 北京 · 更新时间:2026-09-30

岗位职责

1.GPU集群运维:负责GPU服务器(NVIDIA A/H系列)硬件巡检、故障定位与日常运维,覆盖CUDA/驱动/NCCL全栈排障,保障集群稳定运行; 2.国产算力卡信创环境运维:负责国产算力卡(华为昇腾、寒武纪、海光 DCU等)信创环境的适配、部署与运维,完成驱动/固件/生态栈的调优,支撑国产化替代落地; 3.集群监控与调度:维护DCGM/Prometheus等监控体系,管理Slurm/K8s+GPU Operator等调度系统,优化训练资源分配与算力利用率; 4.MLOps平台建设:建设并运营模型训练/推理平台(MLflow/Kubeflow/vLLM等),搭建 CI/CD for ML流水线,打通数据管道、训练任务与推理服务全链路; 5.平台组件开发:使用Python/Go开发平台工具与K8s operator等组件,提升平台自动化与自助服务能力; 6.网络与性能优化:维护InfiniBand/RDMA高性能网络,配合分布式训练进行网络与存储性能调优,保障大规模训练效率; 7.推理部署与优化:支撑大模型推理服务部署,开展量化/推理框架(vLLM/TGI/TensorRT-LLM)等性能优化; 8.文档与协同:编写运维手册、平台使用文档与故障分析报告,与算法、研发团队协作,推动平台标准化运营。

任职要求

1.有国产算力卡/信创环境实战经验者优先; 2.熟悉NVIDIA生态(CUDA/cuDNN/NCCL),具备GPU服务器故障定位与驱动调优能力;熟悉分布式训练与InfiniBand/RDMA网络; 3.具备国产算力卡信创环境适配经验,熟悉昇腾CANN、寒武纪Neuware、海光DCU等生态栈者优先; 4.熟悉Slurm/Kubernetes+GPU Operator等调度方案,掌握DCGM/Prometheus等监控体系; 5.熟悉MLflow/Kubeflow等工具链与vLLM/TGI等推理框架;熟练使用Python/Go,有K8s operator或平台组件开发经验; 6.精通Linux系统调优,能独立处理内核/驱动/性能问题;了解模型量化与推理优化者优先; 7.具备较强的责任心与应急响应意识,能适应突发故障处理;具备良好的沟通协作与文档能力,能与算法团队高效配合; 8.持有NVIDIA DLI、CKA/CKS或云厂商相关认证者优先; 9.有大模型推理优化(量化/蒸馏/KV Cache)实战经验者优先。 专业要求:计算机科学与技术、软件工程、人工智能、电子信息工程、通信工程或相关专业

中粮集团校园招聘:优粮生计划-AI管理员岗位来自中粮集团招聘官网,具体内容以中粮集团招聘官网为准。