
腾讯|混元-LLM压缩算法(量化、投机采样、稀疏化)研究实习
岗位职责
课题背景:
设计和实现通用的LLM压缩算法,包括量化、投机解码、Sparse-Attn/KV-Cache压缩算法,通过算法创新和算法优化保持模型效果无损,并配合推理框架团队完成加速部署落地,持续降低大模型落地部署的成本。
课题挑战:
1、探索LLM更低bit的压缩算法且保持精度,并推进推理框架适配落地;
2、在LLM更大batch-size下的并行解码如果能获取到收益,需要更高的算法接受率并兼顾高效的并行解码kernel实现;
3、LLM模型Prefill/Decoding阶段的稀疏注意力、KV-Cache压缩,为长文加速提供有效手段。
具体工作:
通过LLM的量化、投机解码、稀疏注意力等,可以在保证模型效果的同时,大幅度降低模型的推理成本,降低首字耗时,提升解码速率,最终在节省成本的同时也能提升用户体验。
任职要求
1、包含但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程等相关专业的博士和优秀硕士;
2、有至少其中一项技能/知识:熟悉一种推理框架、GP、编程、高性能网络/分布式并行、编译器优化、大规模数据处理;
3、在AI Infra、推理优化、LLM Serving等领域进行过深入调研和探索或者在CPU/GPU体系架构,高性能计算/CUDA,分布式推理系统相关领域经验者优先;
4、有好奇心,自驱力强,有较好的学习能力和沟通能力,编程能力强;
5、良好的沟通协作能力,能和团队一起探索新技术,推、技术进步。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:混元-LLM压缩算法(量化、投机采样、稀疏化)研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
