腾讯|腾讯云安全—LLM & Agentic AI安全护栏研究实习

腾讯 · CSIG · 工作地点:深圳总部 · 更新时间:2026-06-01

岗位职责

课题背景: 随着大语言模型从“对话框”走向“智能体(Agent)”,其具备了调用 API、执行代码及操作数据库的自主能力。然而,这引入了全新的安全风险:Agent 可能被诱导执行破坏性指令(如删除线上数据)、滥用高额付费接口或泄露系统机密。传统的文本过滤已不足以应对物理世界的行为风险。本课题旨在构建 LLM & Agent 双重护栏,不仅监控输入输出的语义安全,更深层地对 Agent 的 Action(执行动作) 进行实时拦截、风险评估与权限管控,确保 Agent 在预设的安全沙盒内运行。 课题挑战: 1、Action 语义合规与意图对齐: 如何精准识别 Agent 生成的 Tool Call 是否背离了用户原始意图,防止“幻觉”导致的越狱执行或误操作;Agent 行为的语义对齐, 如何训练模型理解特定领域工具调用的深层风险(如在金融系统执行高频交易指令的潜在风险),建立 Action 到安全等级的精准映射; 2、高风险动作的动态判定: 针对删除、转账、敏感查询等高风险 Action,如何构建一套基于上下文的动态审批流(Human-in-the-loop)与自动阻断机制; 3、多工具调用的链式安全: 在复杂的 Agent 任务流中,如何防止通过一系列看似无害的组合动作(Chain of Thought)最终诱发的协同攻击; 4、执行环境的隔离与沙盒化: 如何在保障执行效率的同时,为 Code Interpreter 或 Bash Tool 提供极致的安全沙盒,防御针对宿主机的逃逸攻击; 5、实时防御与性能损耗: 在多步推理中,如何在每一跳(Hop)的 Action 触发前完成毫秒级的安全前置检查。 具体工作: 你将主导 LLM-Guard 领域模型的训练全流程。包括:构建行业级安全指令微调数据集;应用 SFT、DPO 或 PPO 算法进行模型安全对齐;探索基于特征解耦的 Agent 行为检测模型;优化在线推理侧的 Guard 模型,并持续迭代自动化评测体系。

任职要求

1、来自计算机、软件工程、人工智能、信息安全或数学等相关专业的硕士或博士同学;对大模型安全、对齐技术或智能体(Agent)有浓厚兴趣和基础了解; 2、熟悉 NLP 基础算法及 Transformer 架构,了解大模型微调(如 SFT、LoRA)的基本原理;熟练掌握 Python 编程,至少使用过 PyTorch 或 TensorFlow 其中一种深度学习框架; 3、了解常见的 Agent 机制(如 Function Calling)及基础的网络安全/内容合规概念者优先; 4、具备良好的逻辑思维与问题分析能力;沟通协作能力强,能够积极主动跟踪领域内的新技术;具备一定的工程实现能力,能将算法逻辑转化为实验代码。

腾讯招聘实习生:腾讯云安全—LLM & Agentic AI安全护栏研究岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。