
腾讯|腾讯云—海量多模态小模型的Serverless 推理技术研究实习
岗位职责
课题背景:
在多模态数据处理与智能分析场景中,往往需要调用大量功能各异的专用小模型(SLM)完成视觉、语音、文本及跨模态推理任务。此类场景下模型数量繁多、调用模式呈现明显的长尾特征,传统的常驻式推理部署方式难以兼顾资源成本与弹性需求。为此,Serverless 推理服务成为支撑多模态小模型规模化部署的重要系统形态,但其在 GPU 资源利用率、模型切换与加载开销等方面仍面临较大挑战,亟需系统性的技术突破。
课题挑战:
1、冷启动开销优化:多模态小模型种类繁多,模型按需加载会引入显著的冷启动延迟,如何通过模型快照与运行时状态复用等技术手段有效降低启动成本,是核心挑战之一;
2、GPU 资源高效复用:长尾调用模式导致 GPU 资源利用率低、碎片化严重,如何实现多模型间的 GPU 快速切换与细粒度复用,以提升整体资源利用效率,是关键技术难点;
3、推理请求感知与调度:不同模态、不同优先级的推理请求在时延与吞吐需求上差异显著,如何设计请求感知的智能调度策略,在保障服务质量(SLO)的同时降低资源浪费,是重要的系统设计挑战;
4、高弹性服务体系构建:如何将上述技术有机整合,构建兼具低时延、高弹性、低资源浪费的 Serverless 推理服务体系,并在真实业务场景下验证其可靠性与可扩展性。
具体工作:
你将参与多模态小模型 Serverless 推理服务的核心技术研发,围绕模型快照机制设计、运行时状态复用策略、GPU 复用与快速切换方案,以及推理请求感知调度算法等方向开展深入研究与工程实践,降低模型冷启动成本,提升 GPU 利用效率,推动构建高弹性、低时延、低资源浪费的推理服务体系落地。
任职要求
1、包含但不限于计算机、软件工程、人工智能、电子信息、自动化、信号与信息处理等相关专业的博士及优秀硕士;
2、熟悉深度学习基本原理,熟练掌握 PyTorch、TensorFlow 等至少一个主流框架,了解模型推理流程与底层运行机制;
3、具备良好的AI Coding技巧,善用AI提效工具,熟悉操作系统、虚拟化等底层知识,有 CUDA/GPU 编程经验者优先;
4、了解 Serverless 或安全沙箱基本原理者优先;
5、动手能力强,能独立完成系统模块的设计、实现与性能调优,有顶会论文发表或复现经验者优先。
腾讯招聘实习生:腾讯云—海量多模态小模型的Serverless 推理技术研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
