
招商局集团|招商金科-AI算力工程师(J33326)
岗位职责
1、算力集群运维:负责GPU算力集群部署与运维,熟练运用Docker、Kubernetes容器化技术,实现算力资源高效调度与管理,保障集群稳定高可用。
2、网络搭建与监控:负责InfiniBand、RoCE等高性能网络搭建与优化,降低传输延迟、提升数据处理效率;依托Prometheus、Grafana搭建监控预警体系,实时监测设备运行状态,及时排查故障与性能瓶颈。
3、资源优化管理:依据项目优先级合理分配算力资源,制定资源调度策略,提升资源利用率;定期对算力基础设施进行软硬件调优、资源重组升级,持续优化算力性能,适配业务增长需求。
4、模型推理优化:针对Transformer、CNN等主流深度学习模型,运用算子融合、图优化、量化、剪枝等技术,优化模型推理效果,有效降低推理延迟、提升模型吞吐量。
5、性能评估调优:搭建完善的模型推理性能评估体系,围绕延迟、吞吐量、资源利用率等核心指标开展测试评估,输出性能报告;精准定位性能瓶颈,落地优化方案并验证效果,持续迭代提升模型性能。
任职要求
1、熟悉 GPU 硬件架构和编程模型,熟练掌握 Kubernetes、Docker 等容器化技术。
2、熟悉 InfiniBand、RoCE 等高性能网络技术,具备网络配置和调优能力,能够搭建低延迟、高带宽的网络环境。
3、掌握常用的监控和配置工具(如 Prometheus、Ansible 等),能够对算力基础设施进行全面的监控和管理。
4、熟悉常用的大模型推理框架(如 TensorRT - LLM、vLLM 等)的设计思路和使用方法,有相关框架的优化经验者优先。
5、责任心强,工作积极主动,具备出色沟通能力。
招商局集团校园招聘:招商金科-AI算力工程师(J33326)岗位来自招商局集团招聘官网,具体内容以招商局集团招聘官网为准。
