米哈游|多模态RL研究实习生(audio方向)

米哈游 · 程序&技术类 · 上海/北京 · 更新时间:2026-09-05

岗位职责

随着大语言模型向多模态演进,音频模态的理解与生成成为 Omni 模型的关键能力。然而,音频与 LLM 融合后面临生成幻觉、语义偏移、信息损失等挑战,强化学习通过对齐反馈信号为这些问题提供了有效的优化路径。 本岗位聚焦于 RL 在音频多模态场景中的研究与应用,参与 Omni 多模态框架中音频侧的强化学习体系构建。 核心职责 1. 参与面向音频模态的 RL 对齐算法研究,覆盖音频理解与生成两侧,探索如何通过 RL 抑制生成幻觉、提升事实性与一致性。结合音频多维度评价体系(如自然度、表现力、内容一致性等)设计 RL 奖励函数,构建面向音频场景的精细化对齐优化流程。 2. 在上述探索稳定模型基本能力的基础上,参与多模态 RL 训练框架的适配与优化工作,解决音频模态接入后的大规模训练稳定性、效率与可扩展性问题。 3. 参与构建音频多模态对齐反馈数据 pipeline,包括大规模音频-文本对齐数据的采集、质量控制,以及 RL 训练所需的偏好数据与评测数据集建设。 4. 跟踪音频自监督学习、语音语言模型、多模态 RL 等方向的前沿进展,提出并验证新的研究思路。

米哈游招聘实习生:多模态RL研究实习生(audio方向)岗位来自米哈游招聘官网,具体内容以米哈游招聘官网为准。