
腾讯|大规模资源调度技术研究实习
岗位职责
课题背景:
AI领域任务对异构算力的需求急剧增长,且常依赖跨地域分布的存储、数据等资源。传统的、局限于单个数据中心或单一硬件类型的集中式调度器,已难以满足调度此类复杂作业的需求。
本项目基于联邦集群架构,研究大规模 AI 场景下资源调度能力。通过刻画不同任务在不同卡型的计算能力、不同任务其他依赖其他资源(包括异地存储等资源),研究一体化联邦调度方案。最终实现资源利用率和用户任务执行效率最优。
课题挑战:
1、复杂约束下的跨域调度建模:AI任务调度决策不仅需考虑计算资源,还需统筹网络带宽(用于梯度同步)、跨地域数据访问延迟、存储I/O性能以及作业内部的亲和性约束。在联邦环境下,将这些异构、跨域的软硬件约束统一建模为一个可解的优化问题;
2, 多卡型算力的归一化与效能评估:不同型号卡在各类上的实际算力与能效比差异显著。难点在于建立一套精准、通用的“算力归一化”模型,将不同卡型的计算能力与业务特性精确匹配。
具体工作:
1、研究跨集群场景下,计算任务跨集群、跨卡型、跨地域调度;
2、解决超大规模调度场景下的规模、性能问题;
3、多卡型算力归一化。
任职要求
1、强烈的技术自驱力,能快速学习GPU/NPU新硬件架构及前沿论文技术;
2、熟悉Kubernetes核心组件(调度器/网络/存储)、容器运行时及CRD开发,具备大规模集群调优经验;
3、具备OpenMP/MPI/RDMA高性能计算开发经验;
4、熟悉主流AI框架及训练加速技术(算子优化/显存管理)。
加分项:
1、有万卡级GPU集群调度实战经验(如弹性任务抢占、跨集群资源池化);
2、熟悉分布式训练框架、大规模训练推理等技术;
3、在MLSys/ATC等顶会发表过资源调度相关论文。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:大规模资源调度技术研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
