AX-Ray:揭示两大通用模型中的因果泄漏缺陷

2 阅读

从能力到安全:AI评估的范式转变

在人工智能领域,我们习惯于用基准测试分数来衡量模型的优劣。然而,一个模型在问答、数学或代码生成上表现优异,并不意味着它在实际部署中就是安全的。能力与安全之间存在着一条鸿沟,而VIDRAFT的AX-Ray框架正是为了弥合这条鸿沟而设计的。

AX-Ray是一个安全诊断层,它超越了传统的能力评估,深入检查模型的计算路径、服务一致性和部署环境。其核心发现是:两个通用公共模型——Zyphra/Zamba2-1.2B和nvidia/Nemotron-H-8B-Base-8K——存在因果泄漏缺陷。这一发现并非普通的基准测试失败,而是结构性的正确性失败,可能影响模型在推理时的行为。

因果泄漏:隐藏的结构性缺陷

因果泄漏是指自回归语言模型在生成前缀时,其隐藏状态或logits依赖于未来不可见的token。这种依赖违反了因果约束,可能导致模型在推理时产生不一致或不可信的结果。

因果泄漏与幻觉、拒绝失败或提示注入不同,它涉及的是模型计算路径本身的正确性。这种缺陷可能影响前缀不变性、隐藏状态正确性、logits一致性、分块或混合序列处理、缓存和服务可靠性、长上下文可信度、评估有效性以及代理执行安全性。

AX-Ray将确认的因果泄漏视为部署阻塞缺陷。无论模型的整体能力分数如何,一旦确认泄漏,就会触发F门控机制。

为什么能力基准测试会漏掉这个问题

大多数公共排行榜衡量的是模型给出正确答案的频率。这虽然必要,但不够充分。一个模型可能正确回答许多问题,但其内部行为却存在不安全或不一致的地方。

因果泄漏在普通的问答、数学、编码或指令遵循基准测试中可能不可见,因为这些测试通常只观察最终答案。AX-Ray则检查更深层的属性:前缀是否保持不变,服务路径是否一致,以及关键失败是否应覆盖聚合分数。

核心原则很简单:高能力并不等于部署安全。

AX-Ray诊断结构

AX-Ray围绕三个诊断轴、十一个操作类别和一个包含117个诊断项目记录的公共目录进行组织。

三个诊断轴包括:

  • MODEL-SCAN:诊断模型级别的正确性、可靠性、鲁棒性、安全性、数据完整性、效率、内部结构和修复方向。
  • AX-SCAN:诊断服务、基础设施、安全、合规和运营部署风险。
  • AGENT-SCAN:诊断代理部署风险,包括工具权限、劫持、循环、记忆污染、删除行为和自主治理。

十一个类别涵盖了从因果安全、可靠性、鲁棒性、安全对齐、数据完整性、效率量化、白盒结构、修复处理,到服务基础设施、基础设施安全和监管合规的广泛范围。

公共117项目录

AX-Ray的公共目录包含117个命名记录,分布在MODEL-SCAN和AX-SCAN中。这些记录不仅仅是检查清单,每个项目都旨在将技术诊断问题与证据、严重性、检测方向、修复方向和治理背景联系起来。

例如,D1类别包括前缀不变性/因果泄漏、分块扫描和掩码一致性、批处理不变性/确定性、KV缓存路径一致性、填充不变性、跨实现一致性、数值精度、注意力汇聚和流式处理、分词器和聊天模板保真度、位置编码/RoPE完整性以及前缀缓存隔离/侧信道。

D2类别涵盖RAG/摘要忠实度、闭卷事实幻觉、长形式事实精度、黑盒一致性、语义熵不确定性、置信度校准、选择性预测/弃权、元认知/自我知识、奉承行为、对齐或推理过度自信以及引用捏造。

D3类别包括对抗性后缀、字符和单词扰动、提示格式脆弱性、MCQ选项顺序偏差、中间丢失/位置偏差、有效与声称上下文、潜在关联检索、指令遵循、释义不变性、逻辑/顺序一致性、分布外鲁棒性以及噪声或代码切换输入。

D4类别涵盖白盒越狱、黑盒自动越狱、多轮和多次越狱、权重级攻击、提示注入和泄露、代理工具使用/过度代理、护栏和审核效能、毒性生成、偏见和公平性、拒绝校准、自动红队覆盖以及标准和治理映射。

D5类别包括基准污染检测、成员推断、记忆/提取、版权复制、PII泄露/隐私、数据来源/开放性审计、构念效度、统计严谨性、信噪比/随机行为、LLM作为评判者的可靠性和偏见、排行榜完整性以及抗污染/动态评估。

D6类别涵盖量化敏感性/异常值、每语言量化退化、低位/imatrix校准、训练预算脆弱性精度、稀疏性敏感性、结构化或层剪枝归因、MoE/专家健康、蒸馏保真度/任务轴遗忘、有效容量/欠训练、服务效率、KV缓存压缩/长上下文扩展以及投机解码收益和陷阱。

D7类别包括层重要性/冗余、黄金层/相变、MoE路由健康、专家专业化/语义标签、注意力头分类、注意力汇聚和熵、激活异常值到量化脆弱性、表示健康、logits/调谐透镜、激活修补/因果追踪、知识定位和编辑以及电路追踪/稀疏自编码器。

D8类别涵盖黄金层定向LoRA、层引导合并、专家重新平衡/剪枝、异常值感知混合精度量化、知识编辑、元认知LoRA/弃权以及每token专家手术。

AX-A类别包括跨引擎服务漂移、生产中的量化退化、延迟/吞吐量/有效吞吐量、KV和前缀缓存跨租户隔离、负载下的服务确定性、投机解码无损性以及自动扩展/冷启动/OOM。

AX-B类别涵盖端点认证/LLMjacking、通过工具使用的SSRF、模型供应链完整性、服务栈RCE/依赖CVE、机密和容器加固、无界消耗/拒绝钱包以及PII、审计日志和保留合规性。

AX-C类别包括高影响AI义务、GenAI标记、水印和深度伪造通知、前沿或大规模AI安全、国内代表要求、ISMS-P技术控制、自动决策权利、欧盟AI法案合规性、金融AI治理、信用评分模型验证、GenAI安全规则、KCMVP/CC认证、N2SF国家网络安全、PIPC AI自我评估以及TTA性能和数据认证。

法律、监管、伦理和宗教法映射

AX-Ray作为诊断指南呈现,而非正式法律标准。其目的是将技术模型失败与部署责任联系起来。

117个公共项目记录映射到多个司法管辖区的治理背景,包括韩国、欧盟、美国、日本、中国、阿联酋和沙特阿拉伯。对于阿联酋和沙特阿拉伯,映射还包括相关的宗教法和伦理治理背景,如保护生命、保护智力、真实性、避免欺骗和防止伤害等原则。

AX-Ray不将这些视为装饰性注释。其目的是使安全诊断在真实部署环境中可理解,其中法律、公共伦理、宗教法推理、机构责任和运营风险相互作用。

完整的映射过于详细,无法在文章中呈现。每个项目级记录可以包括诊断重点、理由、检测方向、修复方向、严重性、自动化级别、证据基础以及特定司法管辖区的法律或伦理参考。读者应查阅数据集以获取完整的项目级映射。

AX-Ray如何处理Solar-Open2-250B

AX-Ray还记录了通过FP8 vLLM服务的upstage/Solar-Open2-250B的API审计结果。该条目被有意标记为与确认的因果泄漏案例不同。

Solar-Open2-250B运行显示在服务/API路径中存在可重复的prompt_logprobs评分异常。AX-Ray将此视为API或服务注意事项,而非确认的模型级因果泄漏。白盒D1/D7测试仍待进行,因此该行标记为official_dhs=falseAPI-audited / white-box pending

这一区别是AX-Ray方法论的核心。服务异常、API评分问题和确认的隐藏状态因果泄漏不是同一回事。

公共披露政策

AX-Ray披露排行榜行、模型级诊断摘要、高级类别分数、项目分类、司法管辖区映射结构、选定的公共报告以及确认的因果泄漏亮点。

AX-Ray不披露专有探针配方、阈值级实现细节、原始敏感提示、原始有害输出、索赔敏感的专利实现细节、内部评判提示或评分配方以及可利用的程序。

这种平衡是有意为之。安全诊断必须足够透明以支持问责,但不能详细到成为绕过模型或重现有害行为的操作手册。

为什么这很重要

AI社区已经非常擅长衡量能力。我们现在需要同样严肃地衡量安全性、因果正确性和部署就绪性。

在通用公共模型中发现因果泄漏缺陷表明,安全诊断可以揭示普通性能基准测试遗漏的失败。AX-Ray不是能力基准测试的替代品。它是一个第二层:一个面向部署的诊断框架,询问模型、其服务路径及其代理环境是否可以被信任。

AI系统正在进入公共服务、金融、医疗保健、研究自动化、工业运营和代理工作流。在这些环境中,高基准分数是不够的。

下一代AI评估必须回答一个更难的问题:模型是否安全部署、运营和治理?

AX-Ray是VIDRAFT朝着这一评估层迈出的第一步。