
腾讯|面向AI集群业务的高性能网络实习
岗位职责
课题背景:
随着千亿/万亿级参数规模的LLM大模型不断涌现,以及语料库的爆炸式增长,训练算力需要万卡级GPU集群来支撑,训练时间也持续数周或更长,这对集群网络的性能和稳定性提出了非常高的要求。一方面,大规模GPU集群训练的性能瓶颈在于如何优化网络集合通信来让万卡GPU之间保持高效地传输同步;另一方面,GPU集群通常按训练时间计算成本,价格昂贵,网络频繁故障/中断会导致整个训练任务耗时大增。因此如何优化网络集合通信性能,保证网络运营的可靠,是GPU集群网络研发的重要内容。
课题挑战:
通过突破GPU间通信性能瓶颈,提升大模型训练效率与降低模型推理成本。
具体工作:
1、面向AI大模型的网络架构/协议设计、拓扑感知流量规划调度、集合通信性能优化、在网计算等GPU训练加速方案;
2、网卡-计算卸载,内存池、存储通信加速;
3、Tile-based 集合通信库研发。
任职要求
1、计算机、通信、网络空间安全、电子工程、高性能计算等相关专业;
2、有GPU集群通信相关经验,主导或参与过AI训练/推理平台的通信优化项目;有GPU通信库开发经验者优先;
3、加分项:发表过GPU通信、分布式计算领域的高质量论文或专利;具备GPU虚拟化、FPGA异构加速等跨领域经验。
腾讯招聘实习生:面向AI集群业务的高性能网络岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
