商汤|推理优化实习生,高性能C++

商汤 · 上海/北京/杭州 · 更新时间:2026-09-03

岗位职责

我们正在构建全球最具性能密度的「AI 推理引擎」。不止追求单 GPU 峰值利用率,更着眼于在异构加速器上,为前沿大模型提供极致吞吐与最低延迟。 实习期间,你将参与以下方向 1. 分布式大模型推理框架的开发与优化,提升推理性能与吞吐量; 2. 针对不同场景的LLM请求特点,优化GPU计算流程,打造业内领先的高效LLM推理引擎; 3. 调研并引入前沿机器学习系统技术,推动系统架构的持续优化升级; 4. 与算法团队深度合作,探索算法-系统协同优化方案,提升整体推理效率。

任职要求

1. 在校学生:计算机、软件工程、人工智能、电子工程、数学等相关专业在读,每周可到岗 4 天及以上,实习时长不少于 4 个月。 2. 编程基础:熟练掌握 C++ 或 Python 中至少一门,具备扎实的计算机基础(操作系统、计算机体系结构、数据结构与算法)。 3. 大模型推理认知:理解 Transformer 计算图,了解 LLM 推理 Prefill / Decode 两阶段特性,使用过 vLLM / SGLang / TensorRT-LLM 中至少一个推理框架。 加分项 1. 写过 CUDA / Triton kernel,熟悉共享内存 tiling、warp-level primitive、异步 copy 等优化手段,能用 Nsight 做性能剖析。 2. 了解 NCCL / HCCL 内部机制,或接触过 RDMA 编程(libibverbs、GPUDirect RDMA 等)。 3. 阅读过 vLLM / TensorRT-LLM / SGLang / FlashAttention / Mooncake 等任一项目的源码,能讲清楚其某一核心机制(如 PagedAttention、Continuous Batching、PD 分离)的实现。 4. 向 vLLM、SGLang、FlashAttention、Mooncake、CUTLASS、Triton 等开源项目提交过 PR / Issue。 5. 有硬核技术输出:高质量技术博客、论文、或在 GitHub 上有被社区使用的性能工具 / Profiler。 6. 能连续实习6 个月以上优先。

商汤招聘实习生:推理优化实习生,高性能C++岗位来自商汤招聘官网,具体内容以商汤招聘官网为准。