
阿里巴巴|多模态世界模型强化学习研究与应用-阿里星
岗位职责
1、跟进并研发多模态大模型的强化学习对齐技术,提升模型在多模态任务中的表现;
2、负责强化学习对齐技术研发,包括Reward Model训练、PPO/DPO/GRPO等策略优化算法的实现与优化;
3、通过强化学习提升世界模型智能和效果上限提升;
4、参与设计和开发高效的强化学习训练框架,支持大规模分布式RL训练、高效rollout采样、异步训练pipeline等基础设施建设。
任职要求
1、计算机、人工智能、自动化等相关专业;
2、在多模态大模型和生成式模型(扩散/自回归模型)上有资深背景,对前沿进展和领域问题有深入理解;
3、具有主流大模型的实战经验 (视频生成/VLM/LLM/LMM),有国际高影响力的项目成果;
4、对 AGI 有极强的热情,能够从第一性原理出发解决世界模型领域问题。
阿里巴巴校园招聘:多模态世界模型强化学习研究与应用-阿里星岗位来自阿里巴巴招聘官网,具体内容以阿里巴巴招聘官网为准。
