
腾讯|混元-Code Agent 攻防研究与沙盒构建实习
岗位职责
课题背景:
现有的评测基准(如传统的 SWE-bench 或 HumanEval)极度脆弱,模型可以通过截获标准输出、劫持测试脚本等方式轻易“作弊”刷榜,导致评测分数虚高,完全掩盖了工业级部署中的级联错误与系统崩溃风险。因此,我们希望你系统性地研究如何LLM如何通过各种手段绕过沙盒限制,直接hack奖励,探索现有主流coding-bench的漏洞,同时研究如何防御住模型的hack,形成系统性的攻防体系。
课题挑战:
如何系统发现并复现模型的作弊与利用行为,如何区分正常修复和奖励攻击,如何构建既安全又不脱离真实开发场景的防篡改评测环境,以及如何建立能持续演进的攻防与审计机制。
具体工作:
1、发掘与复现代码智能体的欺骗与利用能力:
针对主流开源或商业大模型,研究并诱导模型执行高级欺骗行为,如:测试台沙盒逃逸、直接检索答案、测试日志的伪造、针对执行环节的依赖劫持等欺骗奖励系统的行为;
2、构建防篡改的评测容器与审计机制:零信任沙盒 + 轨迹异常检测。
任职要求
1、计算机科学、软件工程、人工智能或相关专业硕士及以上学历,具备大模型数据工程或Code LLM等实际项目经验;
2、深入理解 Transformer 架构及大语言模型训练原理,具备丰富的数据处理经验。能针对Code SFT、代码偏好对齐等后训练场景,设计高标准数据方案,有项目实战经验;
3、深入实践过 CodeAct、SWE-agent、LATS、AlphaCode等前沿代码推理与自动化框架者优先;
4、熟练掌握 Python,善于利用 Cursor、Claude Code 等 AI 辅助工具提升数据生产与自动化分析效率。熟悉至少一门其他主流编程语言(C++/Java/Go等),熟悉Docker优先;
5、在前沿会议有高质量论文发表,或在开源社区有高影响力贡献者优先;
6、具备强烈的数据敏感度、技术热情和自驱力,能够从繁杂的代码与报错日志中洞察模型能力的边界,拥有优秀的跨团队(模型、评测、平台)协作与沟通能力。
腾讯招聘实习生:混元-Code Agent 攻防研究与沙盒构建岗位来自腾讯招聘官网,具体内容以腾讯招聘官网为准。
