腾讯|混元-大模型infra稳定性研究实习

腾讯 · TEG · 工作地点:北京上海 · 更新时间:2026-06-01

岗位职责

课题背景: 当前大规模GPU训练推理任务仍然面临硬件软件故障的挑战,造成任务中断影响业务 课题挑战: 牵头框架、算力、网络、存储等跨模块技术协同,设计并落地全链路关键指标(metric)采集体系,构建覆盖训练全生命周期的可观测性平台,实现问题早发现、早定位。 主导智能化故障节点与慢节点检测平台研发,攻克大规模集群下节点异常识别、根因分析难题,建立自动化故障隔离与恢复机制,显著降低故障对训练任务的影响。 具体工作: 负责infra相关链路稳定性治理、规范建设;联动框架、算力、网络各模块完善关键metric采集,系统性构建故障节点、慢节点检测平台化能力;联合混元大模型一站式建设统一的任务自动续训能力

任职要求

1、包含但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程等相关专业的博士和优秀硕士; 2、有至少其中一项技能/知识:熟悉一种训练框架、GPU编程、高性能网络/分布式并行、编译器优化、大规模数据处理; 3、在AIInfra、强化学习、AIAgent等领域进行过深入调研和探索或者在CPU/GPU体系架构,高性能计算/CUDA,分布式训练系统相关领域经验者优先; 4、有好奇心,自驱力强,有较好的学习能力和沟通能力,编程能力强; 5、良好的沟通协作能力,能和团队一起探索新技术,推进技术进步。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:混元-大模型infra稳定性研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。