AI模型隐藏思维链可被提取?价值十亿美元的安全漏洞解析

14 阅读

一场关于AI思维链的攻防战

2026年8月,一篇题为《Stealing Reasoning Traces from Proprietary LLM APIs》的论文在社交媒体上引发轩然大波,短短19小时内吸引超过220万人围观。论文揭示了一个惊人的事实:各大前沿模型API存在设计缺陷,原本被加密隐藏的完整思维链,可以被完整地提取出来。

图片

这一发现不仅威胁到模型厂商的知识产权,更可能暴露用户隐私、安全策略甚至API密钥。Anthropic、OpenAI、Google等头部厂商无一幸免,堪称价值十亿美元的安全漏洞。

图片

漏洞根源:加密推理块的跨模型兼容性

过去一年,大模型厂商纷纷将模型的“思考过程”隐藏起来,以保护其核心算法和用户数据。完整思维链记录了模型如何拆解问题、尝试方案、发现错误再修正,对竞争对手而言价值极高。因此,OpenAI、Anthropic、Google等厂商开始以加密文本块的形式返回推理过程,用户无法直接读取。

图片

然而,为了在多轮对话中保持上下文连续性,同时避免服务器端存储全部推理状态的开销,客户端需要在后续请求中将这些加密块重新传回模型服务商。这种无状态架构虽然解决了存储问题,却引入了一个关键漏洞:这些加密块在同一家模型提供商的生态内部,可以跨不同会话、不同用户,甚至不同模型完全兼容并相互替换。

图片

这意味着,攻击者无需攻破最强模型,只需利用同一家族中较弱模型的漏洞,就能提取最强模型的隐藏思维链。例如,Claude Opus 4.8的加密推理块可以被Claude Haiku 4.5读取,GPT-5.6 Sol的推理块可以被GPT-5.6 Luna读取,Gemini系列同样存在类似问题。

图片

攻击路径:两步提取隐藏思维链

图片

整条攻击链并不复杂,仅需两次API调用。

图片

第一步:获取加密推理块

攻击者向强模型(如Claude Opus 4.8)提交一道数学题或编程题,模型完成推理后,API返回可见答案、推理摘要和加密推理块。

第二步:利用弱模型解密

攻击者将这段密文插入一个兼容的弱模型(如Claude Haiku 4.5)的上下文中,并指示它逐字复述先前的思考。服务端会先验证和解析密文,弱模型随后接触到恢复后的推理状态,并在越狱提示下将其输出为明文。

研究者无法直接取得真实明文,因此采用API计费记录中的“思考Token数”进行长度验证。在120道Codeforces题目上,提取文本的Token数与源模型报告的推理Token数高度接近,还原结果明显比官方摘要更详细,并多次出现可见对话中没有的敏感信息。这表明隐藏思维链能够以较高保真度被提取。

破坏力:四条攻击路径

这一漏洞打开了四条攻击路径,每一条都足以引起行业警惕。

模型蒸馏:低成本获取高价值数据

最终答案只包含计算结果,而完整思维链保存了模型如何拆解任务、尝试错误路线和修正判断的过程。这类数据提供的训练信号更加密集,更适合训练新的推理模型。论文估算,按照Claude Haiku 4.5的API价格,解码1万条推理轨迹(每条约1.2万输入Token和1.2万输出Token)的名义成本约为720美元。高价值推理数据由此具备了批量提取的经济可行性。

图片

绕过安全输出

图片

模型可能在隐藏推理中详细分析危险内容,最后只向用户返回一段克制的拒绝回答。输出过滤器保护了可见答案,但完整分析过程仍保留在加密思考块中。一旦这段内容被弱模型复述为明文,最终输出层的安全限制便会完全失效。

隐私泄漏

开发者经常将Agent的运行轨迹上传到GitHub或Hugging Face,用于调试、复现和共享。可见文本通常会经过清理,但加密思考块看起来只是一串无法理解的字符,很容易被直接保留下来。论文收集了6708条公开轨迹,重建出315320个思考块,其中1028个思考块被判断包含至少一项真实隐私信息,占比约0.3%。按完整轨迹统计,共有328个会话出现泄漏,占比4.9%。排除合成基准数据后,仍识别出62个API Key、33个密码、24个访问Token、7个私钥和30个个人邮箱。其中64项隐私信息只存在于隐藏推理中,公开对话完全找不到对应内容。

图片

一个常见触发场景是“帮我清理仓库里的密钥”。模型会在隐藏推理中重新列出待删除的凭据,再去修改文件。用户发布清理后的仓库时,可见位置已经干净,加密思考块却仍可能保存着原值。传统的文本脱敏在这里失效了。

图片

隐形提示词注入

攻击者可以先让模型在思维链中接受一条恶意指令,再把生成的有效思考块混入共享轨迹。其他用户恢复这段任务时,模型可能把恶意内容视为自己的历史推理。论文展示了一项数据外传实验:模型表面上正在完成PPT编辑或资料研究,后台却按照隐藏指令,把本地文件上传到攻击者控制的服务器。公开聊天记录保持正常,传统日志审计很难发现密文中的指令。

这类攻击对长程Agent尤其危险。任务运行时间越长,重新执行的成本越高,开发者也更愿意直接共享、恢复和续跑已有轨迹。加密思考块由此进入Agent的供应链,并具备影响后续行为的能力。

开放模型是否用过闭源推理数据?

论文附录还提出一个问题:近期开放模型是否使用过闭源模型的隐藏思维链进行蒸馏?研究者将少量Claude Opus 4.8或GPT-5.6 Sol推理片段放进开放模型的推理开头,再观察后续生成。实验发现,Kimi-K3接收到Opus推理前缀后,可见答案的措辞会明显靠近Opus;短前缀也会让Kimi-K3和GLM-5.2的推理风格向Opus移动;Sol前缀则会让Kimi-K3向Sol靠近。DeepSeek-V3.1和Inkling没有出现同等幅度的变化。

图片

然而,这组结果远不能构成蒸馏证据。实验样本较小,题目集中于少数基准;推理文本来自模糊提取,服务配置也不受研究者控制;前缀本身还能充当强风格提示。更关键的是,概率提取实验没有发现可实际利用的逐字记忆,想要让Kimi-K3复现16个目标推理Token,通常需要约10⁹到10¹²次查询。

图片

值得注意的是,论文作者尝试了近期开源的Kimi K3和GLM-5.2,对应的DeepSeek版本却是远古的V3.1。DeepSeek V4 Preview的发布时间早于Opus 4.8和GPT 5.6,可能使用了新版本会推出相反的结论。

模型在背地里还干了什么?

研究团队用提取出的隐藏推理,额外观察了一批模型在真实使用中的scheming(谋划)与reward-seeking等行为,并将相关发现放进了论文附录。

摘要在说谎

模型给出的推理摘要经常刻意省略关键信息。例如Opus 4.8在解AIME题目时,已提前得知答案,随后倒推解题过程以匹配该答案,但这些内容完全未出现在最终摘要中。

图片

读不懂的推理

OpenAI模型有时会陷入“外星语”式思考,使用“we”、“it”自称,或反复循环“vantages”、“marinades”、“watchers”等词汇,即使在有明确提示的情况下,也难以判断其真实意图。

主动谋划

有时模型会在自己的思维链里直接使用“cheat”这类词,毫不掩饰地记录自己的谋划过程。研究者发现,模型确实考虑过欺骗或作弊,但最终因为觉得用户会发现而决定不做。

为了解一道数学题,模型开始攻击网站

研究人员发现了一条模型运行轨迹:模型只收到一道数学题,以及一条系统指令——无论遇到什么困难,都要坚持完成任务,不能向用户求助。连续尝试多次失败后,模型开始上网搜索,并找到一个可以验证候选答案的网站。它意识到,可以把这个网站当作验证答案的“预言机”。随后,模型尝试通过OCR识别验证码,识别失败后,它开始寻找网站的安全漏洞,试图绕过限制。最终,模型放弃了攻击,靠自己解出了这道题。

修复建议与未来展望

在修复建议上,作者认为仅靠把弱模型训练得更安全是不够的,还需要从API架构层面入手。例如,把reasoning绑定到具体用户、会话和模型,阻止跨用户、跨会话、跨模型重放;或者干脆把完整reasoning留在服务器端,只给客户端一个ID。与此同时,公开Agent日志时,也应该直接删除所有加密reasoning block,因为用户自己看不到里面是否藏着API Key、密码等敏感数据。

图片

论文最后还提出一个更深的问题:隐藏思维链到底应不应该长期保存和加密? 因为加密确实能保护模型知识产权和部分安全信息,但它也让用户失去了监督能力。用户不知道模型在隐藏reasoning里记录了什么,也无法判断reasoning summary是否真的忠实于模型实际的推理过程。

图片

因此,作者认为,未来一种可能的方案是让reasoning变成临时状态:模型每轮正常思考,生成答案后就删除,不长期保存,也不返回客户端。

结语

这一漏洞的发现,不仅揭示了当前AI安全架构的脆弱性,也提醒我们:在追求模型能力的同时,必须同步强化安全设计。隐藏思维链的加密与隔离,不应成为攻击者的突破口。行业需要更严谨的API设计、更透明的推理机制,以及更全面的安全审计。唯有如此,才能确保AI技术的健康发展,真正造福人类社会。