
同花顺|大模型后训练算法工程师(博士专项)-实习
岗位职责
岗位方向
围绕金融大模型在专业场景中的可靠性、准确性、推理能力和用户体验,负责模型后训练、偏好对齐、奖励建模、强化学习、数据构造、评测体系和安全合规能力建设。
岗位职责
1.负责大模型后训练体系建设,包括 SFT、RLHF、DPO、RLAIF、RFT、GRPO、拒答策略、风格对齐、领域适配等。
2.构建金融领域高质量指令数据、偏好数据、评测数据和奖励信号,提升模型在金融专业任务上的表现。
3.设计面向金融问答、投研分析、合规审查、风控预警、数据解释、复杂推理等任务的后训练方案。
4.建设模型评测体系,包括金融知识、事实准确性、逻辑推理、时效性、幻觉率、安全合规、拒答边界、用户满意度等。
5.研究可验证奖励、自动评测、LLM-as-Judge、Reward Model、Process Reward Model 等技术。
6.与大模型、Agent、推荐、多模态、语音团队协作,提升整体 AI 产品的可靠性和业务效果。
任职要求
1.计算机、人工智能、机器学习、自然语言处理、强化学习等相关专业,博士优先。
2.熟悉大模型训练和后训练流程,理解 SFT、RLHF、DPO、PPO、GRPO、Reward Model、RLVR 等方法。
3.具备扎实的机器学习和强化学习基础,熟悉 PyTorch、Transformers、DeepSpeed、Megatron、TRL 等框架。
4.有数据构造、模型评测、实验分析和系统性优化能力。
5.对模型可靠性、幻觉控制、金融合规、领域专业性有较强意识。
加分项
•有大模型后训练、偏好对齐、Reward Model、强化学习、推理模型训练经验;
•有金融、法律、医疗等高严谨性场景模型优化经验;
•有推理模型、RLVR、可验证奖励相关研究或复现经验;
•有顶会论文或开源项目经验。
同花顺招聘实习生:大模型后训练算法工程师(博士专项)-实习岗位来自同花顺招聘官网,具体内容以同花顺招聘官网为准。
