国产AI安全智能体Sangfor AI跻身全球前四,超越OpenAI和Anthropic
深信服自研的AI安全智能体Sangfor AI在CyberGym全球评测中取得1301/1507的成绩,整体成功率86.3%,排名国内第一、全球第四。它采用“智能体群体协同”与“证据管治”机制,在真实漏洞挖掘场景中展现出稳定实战能力,并已逐步应用于企业代码安全检测流程。
AI开始“组团挖漏洞”:从静态测试到真实场景的跨越
7月29日,深信服公布了其AI安全智能体Sangfor AI在CyberGym评测中的最新成绩。
CyberGym是目前全球含金量较高的代码安全大模型实战靶场。与传统静态理论测试不同,CyberGym的评测体系完全贴合工业真实场景——它以海量开源软件的历史高危漏洞作为考题,重点考核AI智能体自主分析源码、多阶段漏洞推演、漏洞复现与PoC验证的全链路能力,结果具有较高的行业参考价值。
在基于国产大模型GLM-5.2的固定配置下,Sangfor AI面对涵盖ARVO与OSS-Fuzz的1507项漏洞挑战任务,成功完成1301项,整体成功率达到86.3%。这一成绩使其跻身全球前四,位列国内参评团队第一,并超越OpenAI、Anthropic等海外AI巨头。
细分场景中,Sangfor AI表现均衡:ARVO相关任务成功率87.2%,OSS-Fuzz任务成功率77.7%,验证了国产大模型在复杂代码对抗场景下的稳定实战能力。



将模型能力转化为可验证的安全能力:四大核心运行逻辑
为了解决漏洞挖掘中长链路推理、多假设探索和持续验证等问题,Sangfor AI采用了“智能体群体(Agent Swarm)协同作战”架构,并引入“证据管治”机制。整套技术框架分为四大核心运行逻辑,确保每一步漏洞调查都清晰可信:
-
有界探索:围绕不同的安全假设分别开启独立、边界清晰的调查分支。多个可能的解释可以并行推进,避免互相污染,防止某个未经证实的假设悄悄演变为集体共识。
-
证据持久化:各调查分支之间通过“证据”而非完整对话历史来协同。已被验证的观察和已被证伪的路径都会被保留下来,避免同一条错误路径被反复重试。
-
动态假设裁决:一个协调层持续基于不断演化的证据状态,判断哪些假设仍然成立、哪些问题尚待解决、哪里值得继续投入。每一轮探索都是对搜索空间的有效收窄。
-
对抗式候选评审:当证据支持某个具体的触发方案时,系统会构造候选输入并提交“对抗式评审”——评审同时挑战“这次崩溃是否可复现”以及“这次崩溃是否真的对应目标漏洞”。未通过评审的候选会被打回,用于修正下一步探索方向。只有真正经受住检验的候选,才会成为系统最终提交的安全结论。
深信服技术团队将这套机制总结为“以假设拓展探索,以证据裁定结论”,以此保证AI大范围排查潜在风险的同时,通过多层校验压低误判概率。
创新成果如何落地:从SAST到安全Agent的升级
深信服表示,相关技术已逐步应用于企业代码安全场景,推动传统静态应用安全测试(SAST)向具备自主推理和业务理解能力的安全Agent升级。
相比传统规则匹配方式,新一代安全Agent不仅能识别SQL注入、命令执行等常见漏洞,还可分析复杂业务逻辑,发现越权访问、认证绕过等传统工具难以覆盖的安全风险。
这些能力已开始赋能深信服产品体系,为企业级用户带来切实的价值质变:
- 提升漏洞检出能力:有效攻克传统SAST盲区,全面识别业务逻辑漏洞、越权与认证绕过,大幅拓宽代码安全覆盖率。
- 降低人工审计成本:AI自动化完成代码理解、跨文件关联分析、攻击路径推理与风险验证,大幅解放安全专家的繁重重复劳动。
- 减少误报、提升效率:多阶段推理与严苛的证据验证机制压降误报率,研发人员能聚焦真正亟需修复的风险,告别无效整改。
- 缩短研发交付周期:将安全检测前移至研发编写与CI/CD流水线中,实现“代码提交即自动审计”,大幅降低后期返工成本,加速业务上线。
- 提升企业整体安全能力:帮助企业在更早阶段筑牢防线,遏制数据泄露、业务中断等合规与经济风险。
对于广大企业用户而言,AI安全Agent的核心价值远不止于“发现更多漏洞”,更在于以高准确率、低人工成本与快响应速度,实现研发效率与代码安全的同步跨越。