
腾讯|元宝—大模型首token时延优化研究与工程实现(基于工程与算法双维度)实习
岗位职责
课题背景:
随着大语言模型(LLMs)在各类实际场景中的规模化应用,时延性能已成为影响用户体验、决定模型落地价值的核心指标之一,其中首token时延作为用户感知模型响应速度的首要触点,直接决定了用户对模型交互流畅度的评价。当前大模型在实际部署过程中,受dense system prompt冗余、prompt传输与解析效率不足、模型推理架构设计不合理等因素影响,首token输出时延普遍偏高,尤其在实时交互、智能客服、车载AI等对响应速度敏感的场景中,过高的首token时延严重制约了模型的落地效果。因此,本课题聚焦于从工程与算法双维度优化首token时延,核心目标是通过dense system prompt表示优化、prompt压缩、推理架构调整等技术手段,在不损失模型响应精度的前提下,显著降低首token输出时延,提升大模型实际部署的交互体验与可行性。
课题挑战:
1、dense system prompt优化:如何设计更高效的dense system prompt表示方式,在保留核心指令信息的基础上,减少冗余信息,降低prompt解析与处理的时间成本;
2、prompt压缩算法设计:如何研发轻量、高效的prompt压缩算法,实现对输入prompt的无损或近无损压缩,减少数据传输与存储开销,提升prompt加载与解析效率;
3、工程层面时延瓶颈突破:如何从工程部署角度,定位首token时延的核心瓶颈(如数据传输、模型推理初始化、缓存策略等),通过架构调整、并行计算优化等方式提升处理速度;
4、精度与时延的平衡:在进行时延优化过程中,如何确保模型首token输出的准确性、相关性不降低,避免因过度压缩或架构调整导致模型性能退化;
5、优化效果的量化评估:如何设计科学的评估指标与测试方案,精准量化首token时延的优化效果,同时兼顾模型响应精度、系统稳定性等关键指标。
具体工作:
你将参与大模型首token时延优化的全流程工作,聚焦工程与算法双维度,具体包括:参与dense system prompt的表示优化与冗余清理,设计并实现高效的prompt压缩算法;调研并分析首token时延的核心工程瓶颈,参与推理架构调整、缓存策略优化、数据传输效率提升等工程实现工作;搭建首token时延与模型精度的量化评估体系,验证优化方案的有效性;协同团队完成优化方案的迭代与落地,持续提升大模型首token响应速度,助力模型在各类实时交互场景中的高效部署。
任职要求
1、包含但不限于计算机、信息工程、模式识别、人工智能、自动化、软件工程、电子工程、统计学、应用数学、物理学/量子计算、信息安全、信号与信息处理等专业的博士和优秀硕士;
2、熟练掌握大模型、多模态相关的基本算法及应用,熟悉caffe、tensorflow,pytorch等至少一个深度学习框架;
3、较强的工程实现能力,熟练掌握 C/C++ 编程,熟悉 Shell/Python/Matlab 至少一种编程语言。
【加分项或注意事项】
此课题同时招聘应届实习生和低年级实习生。
腾讯招聘实习生:元宝—大模型首token时延优化研究与工程实现(基于工程与算法双维度)岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
