从修补漏洞到重构底线:蚂蚁AI安全双框架如何定义智能体行为边界?
信任危机后的范式转移:当AI开始“动手”
2026年的AI安全领域,正经历一场从被动防御向主动治理的深刻转型。近期,工信部NVDB平台发布风险预警,直指Claude Code存在的安全后门隐患——这一漏洞允许系统在用户毫无察觉的情况下收集敏感信息。与此同时,年初备受瞩目的OpenClaw也接连曝出高危漏洞,显示出Agent类产品在快速普及背后潜藏的结构性风险。
从横空出世到迅速占领市场,再到漏洞频发引发信任崩塌,这已成为当前AI Agent产品的典型发展轨迹。随着大模型能力的边界不断扩张,其角色已从单纯的信息提供者转变为具备工具调用、代码执行能力的行动者。这种转变使得安全风险呈现出“滚雪球”式的复杂特征:滥用工具、恶意代码生成、复杂提示注入等行为,早已超越了传统内容审核能覆盖的范畴。
面对这一现状,行业共识逐渐清晰:单靠事后修补漏洞(Patch)已是治标不治本。真正的解决方案在于重构底层的安全框架,从定义安全边界、应对未知风险以及适应动态规则变动出发,建立一套能在大模型“动手”之前即可精准识别并拦截风险的免疫系统。蚂蚁集团近期开源的SingGuard-NSFA与SingGuard两大框架,正是这一趋势下的代表性尝试。
行为与感知的双重防线:SingGuard-NSFA的深度解析
SingGuard-NSFA是面向智能体安全的双模推理护栏框架,其核心设计理念在于将安全检查前置。传统的安全机制往往关注模型“说了什么”,而在Agent场景下,必须同时关注模型“做了什么”。NSFA框架通过请求拦截和响应兜底两端设卡,试图在风险发生前将其扼杀。
该框架的理论底座源自经典的CIA三元组(机密性、完整性、可用性),并深度融合了OWASP大模型与智能体安全指南的实践经验。通过将潜在风险进行系统化拆解,NSFA构建了细粒度的风险分类体系。在技术实现上,它创新性地采用了生成式与判别式并行的双模推理架构:
- 生成式模式:适用于离线合规审计。模型逐条输出基于NSFA定义的链式推理分析,确保每一步判断都有据可查,提供高度的可解释性。
- 判别式模式:适用于高吞吐的实时在线拦截。每次前向传播直接输出各风险域的置信度,延迟被压缩至45~57ms,满足业务场景对实时性的严苛要求。
更为巧妙的是其可扩展性设计。骨干网络保持冻结,风险判断由外挂的轻量分类头完成。这意味着,当出现新型风险时,只需针对性地微调或补充一个小分类头,即可实现能力的原生扩展,而无需重新训练整个庞大模型。
测试数据显示,SingGuard-NSFA在用户请求安全、模型响应安全及跨数据集泛化三大基准上均取得SOTA表现。其中,最小的0.8B模型性能即可比肩8B规模的竞品,而9B模型在泛化能力上达到了91.29%的F1分数,实现了精度与召回率的卓越平衡。
动态规则与多模态融合:SingGuard的运行时革命
如果说SingGuard-NSFA解决了智能体行为的安全问题,那么面向多模态大模型的SingGuard框架则致力于解决感知层面的风险。多模态风险不仅限于文本,更隐藏在图像细节、图文组合以及模型自身的复杂响应中,且不同业务场景的安全红线存在巨大的动态差异性。
SingGuard的独特之处在于将安全规则转化为“运行时输入”。这意味着,不同业务域可以现场下发各自定制的合规红线,模型据此进行逐条判定。这种机制使得安全审核不再是一个固定的黑盒,而是一个可以根据业务需求灵活配置的动态过程。
在推理效率方面,SingGuard采用了“快慢分工”策略。“快思考”负责低延迟的秒级判断,“慢思考”则进行逐规则的深度推理。两者之间通过Early Exit机制自动切换,在效率与准确性之间寻找最佳平衡点。针对线上多条规则并行审核带来的性能瓶颈,蚂蚁提出了RI-Mask技术,使得共享的图文上下文只需编码一次,即可支持多条规则的并行判断,从而将多模态推理速度提升了5倍以上。
从漏洞挖掘到基础设施:蚂蚁安全体系的演进逻辑
回顾蚂蚁在AI安全领域的布局,可以发现一条清晰的演进脉络:从单点漏洞挖掘到场景化解决方案,再到通用底层框架的构建。
今年早些时候,在全网聚焦OpenClaw漏洞时,蚂蚁AI安全实验室便已敏锐发现多个高危漏洞并协助修复。随后,其与清华大学联合开源的ClawAegis项目,为智能体提供了覆盖产品全生命周期的安全方案。此次SingGuard系列框架的开源,标志着其安全能力正式上升为可复用的行业基础设施。
这种演进并非孤立事件。近期,蚂蚁智能体安全产品已通过信通院泰尔实验室的最高等级评级,这在工程落地层面证明了其技术成熟度与行业领先性。
Claude Code和OpenClaw暴露的问题,仅仅是AI Agent深入办公、开发及生活场景后所引发信任危机的序幕。随着Agent能力的进一步增强,如何建立一套能够持续适应风险变化的安全基础设施,将成为整个行业亟需解决的核心命题。
结语:重新定义AI时代的安全边界
SingGuard-NSFA与SingGuard的开源,其价值不仅在于性能指标的提升,更在于它开始尝试回答一个更底层的问题:在AI时代,安全边界究竟应如何定义?
这两个框架共同强调的两个特质——过程可解释性与新增风险可扩展性,正是应对未知风险的關鍵。审核与追溯必须拿出确凿理由,新增风险必须能通过轻量方式融入现有体系。这标志着AI安全正在从“打补丁”的被动应对,走向“建底座”的主动治理。
未来,随着智能体技术的进一步深化,安全将不再是附加属性,而是嵌入在模型运行逻辑中的核心基因。蚂蚁此次的技术开源,为行业提供了一份值得参考的蓝图:只有建立起坚实、灵活且可解释的安全基础设施,才能让AI技术在可信的轨道上,真正释放其生产力潜能。