
哔哩哔哩|强化学习训练算法实习生
岗位职责
工作职责:
1、参与强化学习核心算法的设计、实现与优化,探索 RL 在扩散模型去噪过程中的应用,包括但不限于 PPO、DPO、GRPO、DAPO、ReFL等内容;
2、参与强化学习训练框架建设,搭建并且持续优化 Agentic RL 链路;
3、参与奖励模型和偏好数据集的构建与迭代,设计针对多模态生成质量(美学、一致性、指令遵循)的细粒度评价信号;
任职要求
1、本科及以上学历,计算机、人工智能、数学、自动化等相关专业;
2、了解自然语言处理、计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构;
3、熟悉至少 2 种主流强化学习算法原理,熟悉至少一种强化学习训练框架;
4、熟练使用 PyTorch 框架,有从零复现顶会 RL 论文代码的能力;
5、有 Diffusion Model(DDPM/DDIM/Flow Matching)或 LLM/VLM 的后训练(SFT/RLHF/DPO)项目经验者优先;
6、在 NeurIPS/ICML/ICLR/CVPR/ACL 等会议有投稿或发表经历者优先。
哔哩哔哩招聘实习生:强化学习训练算法实习生岗位来自哔哩哔哩招聘官网,具体内容以哔哩哔哩招聘官网为准。
