腾讯|混元-LLM压缩算法(量化、投机采样、稀疏化)研究实习

腾讯 · TEG · 工作地点:北京上海 · 更新时间:2026-06-01

岗位职责

课题背景: 设计和实现通用的LLM压缩算法,包括量化、投机解码、Sparse-Attn/KV-Cache压缩算法,通过算法创新和算法优化保持模型效果无损,并配合推理框架团队完成加速部署落地,持续降低大模型落地部署的成本。 课题挑战: 1、探索LLM更低bit的压缩算法且保持精度,并推进推理框架适配落地; 2、在LLM更大batch-size下的并行解码如果能获取到收益,需要更高的算法接受率并兼顾高效的并行解码kernel实现; 3、LLM模型Prefill/Decoding阶段的稀疏注意力、KV-Cache压缩,为长文加速提供有效手段。 具体工作: 通过LLM的量化、投机解码、稀疏注意力等,可以在保证模型效果的同时,大幅度降低模型的推理成本,降低首字耗时,提升解码速率,最终在节省成本的同时也能提升用户体验。

任职要求

1、包含但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程等相关专业的博士和优秀硕士; 2、有至少其中一项技能/知识:熟悉一种推理框架、GP、编程、高性能网络/分布式并行、编译器优化、大规模数据处理; 3、在AI Infra、推理优化、LLM Serving等领域进行过深入调研和探索或者在CPU/GPU体系架构,高性能计算/CUDA,分布式推理系统相关领域经验者优先; 4、有好奇心,自驱力强,有较好的学习能力和沟通能力,编程能力强; 5、良好的沟通协作能力,能和团队一起探索新技术,推、技术进步。 【加分项或注意事项】 此课题同时招聘应届实习生和低年级实习生。

腾讯招聘实习生:混元-LLM压缩算法(量化、投机采样、稀疏化)研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。