腾讯|WXG-面向Repo-level理解的长文本架构研究实习

腾讯 · WXG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 随着软件开发复杂度的提升,开发者往往需要在包含数万个文件、百万行代码的项目中进行导航和逻辑追踪。现有的 LLMs 虽然在片段级代码生成上表现出色,但在处理跨文件调用、深层类继承体系以及复杂依赖关系时,常受限于上下文窗口长度。现有的 RAG(检索增强生成)方案虽然能缓解长度压力,但往往会丢失代码间的严密逻辑链条。因此,本课题聚焦于从架构底层实现“无限”上下文感知,使模型能够像资深架构师一样,在大规模代码库中实现全局最优的逻辑推理与代码重构。 课题挑战: 1、线性/亚线性复杂度架构演进: 如何突破 Transformer 的 $O(n^2)$ 计算瓶颈,引入如稀疏注意力或线性注意力机制,实现在极低计算开销下对百万级代码 Token 的原生支持。 2、代码特有的长文预训练策略: 如何构造跨文件的“逻辑连续型”预训练数据,使模型在预训练阶段就建立起对远端定义(Remote Definitions)和全局配置的敏感度,解决“Lost-in-the-Middle”问题。 3、动态代码记忆(Memory)管理: 模拟计算机的 Cache 机制,设计能够自动识别、压缩和淘汰陈旧代码片段的动态记忆模块,将关键架构设计模式永久保留在“热记忆”中。 4、长文一致性与“大海捞针”能力评估: 针对代码逻辑极其严密的特性,建立一套评估系统,测试模型在 128k 甚至 1M 长度下,是否能准确提取深层嵌套的接口协议或隐蔽的逻辑 Bug。 5、推理时训练(Test-Time Training, TTT)在代码侧的落地: 探索模型在读取新项目代码时,能否通过推理时的参数自适应更新,快速“学习”该项目的特定编码风格与私有 API 规范。 具体工作: 1、架构研发与优化: 参与设计并实现类似 Sparse Attention 或 TTT-Linear 的长文本基座架构,优化其在混合代码语料上的收敛性能。 2、长代码语料工程: 研发自动化流水线,将 GitHub 高星项目重构为具有超长上下文依赖的预训练样本,利用 Ring Attention 等技术实现超大规模长序列训练。 3、动态 KV Cache 压缩方案: 开发针对代码语法的感知压缩算法,识别并保留代码树(AST)中的关键节点信息,降低推理显存占用。 4、长文推理对齐(Alignment): 利用强化学习(RLHF)技术,设计针对长文本逻辑连贯性的奖励函数,提升模型在复杂项目文档与代码对齐任务中的表现。 5、Repo-level 评估基准建设: 参与构建如 RepoBench 增强版等评估集,量化模型在跨文件跳转、全局变量溯源等长距离依赖任务中的成功率。

任职要求

1、分布式训练与高性能算子开发 要求: 熟悉分布式并行训练策略(如 3D Parallelism: TP/PP/DP),深入理解 FlashAttention、Ring Attention 或 DeepSpeed/Megatron-LM 的底层实现。 加分项: 具备定制化 CUDA Kernel 开发经验,能够针对线性注意力(Linear Attention)或 稀疏注意力(如 DSA)编写高性能 Triton/CUDA 算子,优化超长序列下的显存占用。 2、高效缓存与存储管理(针对 KV Cache) 要求: 深入理解 LLM 推理后端的显存管理机制,熟悉 vLLM (PagedAttention) 的原理。 加分项: 有在大规模推理集群中优化 KV Cache 换入换出(Swapping) 或 分级存储(Tiered Storage) 的经验,能够解决长文本在多并发下的显存碎片化问题。 3、代码解析与结构化表示 要求: 熟悉 Tree-sitter 或 LSP (Language Server Protocol),能够对多语言项目进行静态分析,提取符号表、调用图(Call Graph)和依赖关系。 4、向量数据库与检索架构(RAG-Augmented Pre-training) 要求: 熟悉 Milvus/Pinecone/FAISS 等向量数据库的原理,能够设计高性能的检索与重排序(Rerank)流水线。 加分项: 了解 Long-context RAG 与 Long-context Pre-training 的权衡,能够设计“检索即内存(Retrieval-as-Memory)”的混合架构。 5、自动化 Benchmarking 与数据清洗工程 要求: 具备处理 TB 级 原始代码语料(如 Stack, GitHub Archive)的经验,能够编写高效的并行清洗脚本(Deduplication, Filtering)。 加分项: 能够设计自动化的 Repo-level 评估链路,利用容器化技术(Docker/Firecracker)实现代码生成后的自动构建、单测运行与 Coverage 分析。

腾讯招聘实习生:WXG-面向Repo-level理解的长文本架构研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。