腾讯|腾讯金融科技-面向金融场景的长程交互 Agentic 强化学习训练稳定性研究实习

腾讯 · CDG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 随着金融 Agent 从单轮问答向多轮、自主规划与决策演进,训练范式正由监督微调(SFT)逐步转向 Agentic Reinforcement Learning(Agentic RL),以通过多轮环境交互学习复杂的推理、规划与工具使用能力。在真实金融场景中,Agent 往往需要在超长上下文窗口下完成任务:既要持续维护跨轮对话状态,又需整合长时间跨度的中间推理结果、工具返回和环境反馈。这使得 Agentic RL 不仅面临传统强化学习的稳定性问题,还叠加了长上下文建模与记忆干扰带来的新挑战,导致训练过程极易不稳定甚至崩溃。 具体而言,真实金融场景下的 Agentic RL 面临三类关键稳定性难题: 长上下文下的状态噪声累积与误导(Context Drift):Agent 在多轮交互中需持续保留历史 Observation 与中间推理,但其中大量信息对后续决策并非同等重要。无区分地保留上下文会引入噪声,干扰价值估计与策略判断,进一步放大 RL 训练的不稳定性。 长程任务中的信用分配失效(Long-horizon Credit Assignment):金融投研与决策任务通常涉及数十甚至上百步推理与工具调用,奖励信号高度稀疏。在长上下文条件下,早期决策对最终结果的影响被大量中间状态“淹没”,导致梯度估计方差急剧增大,策略更新震荡严重,训练难以收敛。 动态交互环境中的策略熵崩(Entropy Instability):在包含大量金融工具和异构反馈的环境中,单次错误调用(如 API 报错、返回空值)可能在长上下文中被反复放大,诱发策略分布异常扩散,出现策略熵急剧上升、输出退化为随机噪声的现象,训练过程难以恢复。 研究问题: 1、本项目旨在系统研究真实金融场景下、结合长上下文条件的 Agentic RL 训练稳定性问题,重点包括:面向长上下文的长程信用分配机制研究,探索分层 RL、轨迹级价值分解等方法,在稀疏奖励和超长序列下实现低方差、可解释的步进式信用分配。 2、长上下文交互环境下的策略稳健性与熵约束方法,研究在环境反馈剧烈波动和上下文噪声累积条件下的方差缩减与策略更新裁剪机制,防止策略熵崩并提升训练可持续性。 工作内容: 1、核心算法研发:负责金融垂直领域 Agent 模型的算法开发,深耕投资、理财、研究等业务场景,打造行业领先的智能体应用。 2、后训练全链路优化:主导大模型的 Post-training 流程,包括高质量数据合成(Data Synthesis)、指令微调(SFT)、强化学习(RL)及模型推理能力的针对性提升。 3、Agent 技能进化:负责 Agent 在工具调用(Tool-use)、复杂逻辑推理、多轮对话流及多模态信息处理能力的研发与迭代。 4、前沿技术转化:跟踪领域内顶级学术进展(如推理缩放定律、长文本理解等),将前沿技术快速落地于实际业务,提升产品竞争力和团队技术影响力。

任职要求

1、专业背景:计算机、AI、数学等相关专业硕士及以上学历; 2、核心功底:精通大规模语言模型(LLM)的训练机制,对强化学习(PPO/GRPO)有深度理解及实战经验; 3、工程能力:扎实的 Python 功底,熟悉 PyTorch/DeepSpeed/Megatron 等主流分布式训练框架,具备优秀的工程实现能力; 加分项: 1、在 ICLR, NeurIPS, ICML, CVPR 等顶会发表过高水平论文; 2、软素质:对金融领域有好奇心,具备优秀的逻辑分析能力和跨团队协作意识。

腾讯招聘实习生:腾讯金融科技-面向金融场景的长程交互 Agentic 强化学习训练稳定性研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。