腾讯|算力统一运行时技术的研究实习

腾讯 · TEG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 人工智能、高性能计算等领域推动算力需求向异构化、规模化发展,GPU和异构算力等多种算力资源构建集群,运行时环境存在接口与标准不统一,应用适配成本高,并影响了资源的利用率。加之RL模式兴起,对运行时性能、稳定提出更高要求。 课题挑战: 1、稳定性挑战:算力统一运行时作为算力集群的基础能力,需具备高稳定性与高可靠性,能够从技术上实现提前发现-诊断解决异常的能力,应对算力资源故障、算力环境异常情况,确保服务稳定执行; 2、扩展性挑战:算力集群规模的扩大、算力类型的增加以及上层应用需求的升级,运行时系统需具备良好的可扩展性,能够灵活扩展功能模块(如池化、热迁、可视化和混部等),适配不同场景的算力需求,且扩展过程不影响系统的正常运行。 具体工作: 1、模块的设计开发:整合核心模块搭建系统原型,设计多场景测试用例;根据测试结果优化系统,形成可落地的技术方案; 2、技术文档与成果总结:总结研究成果,提炼创新点,分析应用价值,形成研究报告,为后续优化与落地提供支撑。

任职要求

1、深入了解GPU或者某异构硬件架构特性,具备算力容器化组件的开发能力,以及阅读前沿论文的能力; 2、熟悉NVIDIACUDA编程,具备GPU运行时技术经验优先(如算力虚拟化、热迁移、池化技术)。 加分项: 在顶会发表过混部、调度等相关论文。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:算力统一运行时技术的研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。