
腾讯|混元- LLM高性能推理框架调度及高性能算子优化研究实习
岗位职责
课题背景:
伴随大模型的规模持续增长,对推理框架的推理性能、耗时和成本控制都提出了更高的要求。本课题旨在持续探索大模型在长思维链模式下的推理性能优化路径及高性能算子性能优化,包括但不限于PD/AF分离、KV Cache、模型并行策略,通算融合技术、算子性能优化等,持续提升不同模型场景下的推理性能。
课题挑战:
1、生文场景思维链持续增加,需要持续控制成本增长和耗时;
2、针对生文场景探索模型并行策略和调度策略,并做到更好的算子/通信/CPU overlap;
3、算子的研发模式发生变化,算子需要更加充分的考虑通信的效率、通信/计算的掩盖等。本课题旨在针对面向大模型高性能计算算子优化领域,研发和探索能够高效进行算子优化、通算融合的调优技术,并在混元及头部常见开源模型上沉淀出高性能算子集合。
具体工作:
1、推理框架及并行策略优化:夯实LLM模型推理框架,完善多机/机内调度;
2、高性能算子优化:探索高效的通算融合算子优化和通信优化技术,在基础算子的基础上更好的做好通信的overlap;研发高性能算子,形成高效的工具库。
任职要求
1、包含但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程等相关专业的博士和优秀硕士;
2、有至少其中一项技能/知识:熟悉一种推理框架、GPU编程、高性能网络/分布式并行、编译器优化、大规模数据处理;
3、在AI Infra、推理优化、LLM Serving等领域进行过深入调研和探索或者在CPU/GPU体系架构,高性能计算/CUDA,分布式推理系统相关领域经验者优先;
4、有好奇心,自驱力强,有较好的学习能力和沟通能力,编程能力强;
5、良好的沟通协作能力,能和团队一起探索新技术,推进技术进步。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元- LLM高性能推理框架调度及高性能算子优化研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
