哔哩哔哩|大模型训练数据工程师(数据算子与流水线方向)实习

哔哩哔哩 · 上海 · 更新时间:2026-09-17

岗位职责

工作职责: 【岗位定位】 负责大模型训练数据的端到端链路建设,从多模态数据的原始处理开始,直至生成直接供训练框架使用的高性能Dataloader,是连接数据与模型效果的关键桥梁。 【岗位职责】 端到端数据流水线设计:负责设计、构建与优化面向大模型训练的超大规模多模态数据端到端处理流水线,覆盖数据获取、清洗、标注、质量验证到最终训练集生成的全过程。 高性能数据算子库开发:抽象和封装多模态数据(文本、图像、视频、音频)的通用处理逻辑,设计并实现高性能、可复用的数据算子库(如:图像解帧、语音识别、文本分词、质量过滤、数据增强等)。 训练数据Dataloader研发:深入跟进模型训练阶段,基于处理好的高质量数据集,研发与优化与PyTorch等训练框架无缝集成的高性能Dataloader,确保训练过程中数据读取与加载的效率,解决I/O瓶颈,极大提升GPU利用率。 流水线编排与效率提升:研发灵活的配置化流水线引擎,支持原子算子的快速编排,并持续优化全链路的数据处理速度和资源效率,快速响应算法团队的数据需求。 数据质量与评估体系:建立数据质量监控与评估体系,确保输出数据集的洁净度、一致性与有效性,并能量化数据质量对最终模型效果的影响。

任职要求

【任职要求】 计算机科学、软件工程、大数据或相关专业本科及以上学历,有3年以上数据开发或算法工程经验。 精通Python,熟练使用Pandas、PyTorch等数据处理和深度学习框架,必须具备构建或优化训练数据Dataloader的实际经验。 深入理解多模态数据的特性及处理技术,具备丰富的数据建模和数据架构经验,能够设计统一、高效的数据处理抽象。 有使用Spark、Ray等分布式框架进行大规模数据处理的实战经验,理解其核心原理。 具备优秀的业务理解能力和跨团队(数据、算法、Infra)沟通协作精神,责任心强,有严谨的问题排查与优化意识。 【加分项】 熟悉大模型/多模态模型的训练全流程,有超过TB级训练数据集构建经验者优先。 有智能标注、数据合成、自动化质量评估等相关项目经验。 拥有自主开发的数据处理或训练加速相关的开源项目或组件。 对计算存储分离架构、高性能I/O有深入理解和实践经验。

哔哩哔哩招聘实习生:大模型训练数据工程师(数据算子与流水线方向)岗位来自哔哩哔哩招聘官网,具体内容以哔哩哔哩招聘官网为准。