
哔哩哔哩|【B-UP】强化学习训练算法工程师(实习)
岗位职责
工作职责:
1、参与强化学习核心算法的设计、实现与优化,探索 RL 在扩散模型去噪过程中的应用,包括但不限于 PPO、DPO、GRPO、DAPO、ReFL等内容;
2、参与强化学习训练框架建设,搭建并且持续优化 Agentic RL 链路;
3、参与奖励模型和偏好数据集的构建与迭代,设计针对多模态生成质量(美学、一致性、指令遵循)的细粒度评价信号;
任职要求
1、本科及以上学历,计算机、人工智能、数学、自动化等相关专业(硕士/博士优先);
2、了解自然语言处理、计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构;
3、熟悉至少 2 种主流强化学习算法原理,熟悉至少一种强化学习训练框架;
4、熟练使用 PyTorch 框架,有从零复现顶会 RL 论文代码的能力;
5、有 Diffusion Model(DDPM/DDIM/Flow Matching)或 LLM/VLM 的后训练(SFT/RLHF/DPO)项目经验者优先;
6、在 NeurIPS/ICML/ICLR/CVPR/ACL 等会议有投稿或发表经历者优先。网申须知 网申开始日期:2026-06-15 00:00 网申截止日期:2027-06-30 00:00仅限 2026-09 至 2030-06 毕业的大学生,快来
哔哩哔哩招聘实习生:【B-UP】强化学习训练算法工程师(实习)岗位来自哔哩哔哩招聘官网,具体内容以哔哩哔哩招聘官网为准。
