
腾讯|算力统一运行时技术的研究实习
岗位职责
课题背景:
人工智能、高性能计算等领域推动算力需求向异构化、规模化发展,GPU和异构算力等多种算力资源构建集群,运行时环境存在接口与标准不统一,应用适配成本高,并影响了资源的利用率。加之RL模式兴起,对运行时性能、稳定提出更高要求。
课题挑战:
1、稳定性挑战:算力统一运行时作为算力集群的基础能力,需具备高稳定性与高可靠性,能够从技术上实现提前发现-诊断解决异常的能力,应对算力资源故障、算力环境异常情况,确保服务稳定执行;
2、扩展性挑战:算力集群规模的扩大、算力类型的增加以及上层应用需求的升级,运行时系统需具备良好的可扩展性,能够灵活扩展功能模块(如池化、热迁、可视化和混部等),适配不同场景的算力需求,且扩展过程不影响系统的正常运行。
具体工作:
1、模块的设计开发:整合核心模块搭建系统原型,设计多场景测试用例;根据测试结果优化系统,形成可落地的技术方案;
2、技术文档与成果总结:总结研究成果,提炼创新点,分析应用价值,形成研究报告,为后续优化与落地提供支撑。
任职要求
1、深入了解GPU或者某异构硬件架构特性,具备算力容器化组件的开发能力,以及阅读前沿论文的能力;
2、熟悉NVIDIACUDA编程,具备GPU运行时技术经验优先(如算力虚拟化、热迁移、池化技术)。
加分项:
在顶会发表过混部、调度等相关论文。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:算力统一运行时技术的研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
