同花顺|大模型后训练算法工程师(博士专项)-实习

同花顺 · 杭州 · 更新时间:2026-09-02

岗位职责

岗位方向 围绕金融大模型在专业场景中的可靠性、准确性、推理能力和用户体验,负责模型后训练、偏好对齐、奖励建模、强化学习、数据构造、评测体系和安全合规能力建设。 岗位职责 1.负责大模型后训练体系建设,包括 SFT、RLHF、DPO、RLAIF、RFT、GRPO、拒答策略、风格对齐、领域适配等。 2.构建金融领域高质量指令数据、偏好数据、评测数据和奖励信号,提升模型在金融专业任务上的表现。 3.设计面向金融问答、投研分析、合规审查、风控预警、数据解释、复杂推理等任务的后训练方案。 4.建设模型评测体系,包括金融知识、事实准确性、逻辑推理、时效性、幻觉率、安全合规、拒答边界、用户满意度等。 5.研究可验证奖励、自动评测、LLM-as-Judge、Reward Model、Process Reward Model 等技术。 6.与大模型、Agent、推荐、多模态、语音团队协作,提升整体 AI 产品的可靠性和业务效果。

任职要求

1.计算机、人工智能、机器学习、自然语言处理、强化学习等相关专业,博士优先。 2.熟悉大模型训练和后训练流程,理解 SFT、RLHF、DPO、PPO、GRPO、Reward Model、RLVR 等方法。 3.具备扎实的机器学习和强化学习基础,熟悉 PyTorch、Transformers、DeepSpeed、Megatron、TRL 等框架。 4.有数据构造、模型评测、实验分析和系统性优化能力。 5.对模型可靠性、幻觉控制、金融合规、领域专业性有较强意识。 加分项 •有大模型后训练、偏好对齐、Reward Model、强化学习、推理模型训练经验; •有金融、法律、医疗等高严谨性场景模型优化经验; •有推理模型、RLVR、可验证奖励相关研究或复现经验; •有顶会论文或开源项目经验。

同花顺招聘实习生:大模型后训练算法工程师(博士专项)-实习岗位来自同花顺招聘官网,具体内容以同花顺招聘官网为准。