
腾讯|混元-大模型infra稳定性研究实习
岗位职责
课题背景:
当前大规模GPU训练推理任务仍然面临硬件软件故障的挑战,造成任务中断影响业务
课题挑战:
牵头框架、算力、网络、存储等跨模块技术协同,设计并落地全链路关键指标(metric)采集体系,构建覆盖训练全生命周期的可观测性平台,实现问题早发现、早定位。
主导智能化故障节点与慢节点检测平台研发,攻克大规模集群下节点异常识别、根因分析难题,建立自动化故障隔离与恢复机制,显著降低故障对训练任务的影响。
具体工作:
负责infra相关链路稳定性治理、规范建设;联动框架、算力、网络各模块完善关键metric采集,系统性构建故障节点、慢节点检测平台化能力;联合混元大模型一站式建设统一的任务自动续训能力
任职要求
1、包含但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程等相关专业的博士和优秀硕士;
2、有至少其中一项技能/知识:熟悉一种训练框架、GPU编程、高性能网络/分布式并行、编译器优化、大规模数据处理;
3、在AIInfra、强化学习、AIAgent等领域进行过深入调研和探索或者在CPU/GPU体系架构,高性能计算/CUDA,分布式训练系统相关领域经验者优先;
4、有好奇心,自驱力强,有较好的学习能力和沟通能力,编程能力强;
5、良好的沟通协作能力,能和团队一起探索新技术,推进技术进步。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元-大模型infra稳定性研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
