[ INTEL_NODE_31567 ] · PRIORITY: 9.2/10

大模型“思维链”失守:研究揭示如何通过API重放窃取隐藏推理轨迹

  PUBLISHED: · SOURCE: Simon Willison Blog →
[ DATA_STREAM_START ]

近期研究发现,OpenAI、Anthropic及Google等主流厂商在API中返回的加密思维链(CoT)数据块存在严重安全漏洞,攻击者可通过跨模型重放技术,利用弱模型的越狱漏洞还原强模型的隐藏推理过程。

  • 加密不等于隔离: 厂商返回的加密推理令牌缺乏会话或模型的唯一性绑定,允许攻击者在不同会话甚至不同等级的模型间进行“重放”。
  • 同系模型“通感”风险: 攻击者将强模型(如Claude 3.5 Sonnet)的推理轨迹输入给同系列较弱且易被越狱的模型(如Haiku),即可绕过安全限制读取原本隐藏的逻辑。

八卦洞察

这一漏洞的核心在于大模型厂商试图通过“模糊化”而非真正的“密码学隔离”来保护其推理资产。由于同系列模型往往共享相似的潜在空间(Latent Space)和词表结构,强模型的加密推理包在弱模型眼中并非乱码,而是可理解的逻辑指令。这标志着“黑盒推理”安全神话的破灭:只要模型家族中存在一个安全薄弱点,整个家族的推理逻辑都可能面临泄露。这不仅是技术层面的信息泄露,更触及了AI厂商核心竞争力的护城河——推理逻辑的私密性。

行动建议

对于API供应商,必须立即实现推理令牌与特定请求ID及模型实例的强加密绑定,防止跨环境重放。对于企业开发者,在涉及高敏感决策场景时,应意识到当前的“隐藏思维链”并非绝对安全,需在应用层增加额外的审计机制,而非完全依赖厂商的黑盒保护。同时,安全团队应将“跨模型推理重放”纳入大模型风险评估框架。

[ DATA_STREAM_END ]
[ ORIGINAL_SOURCE ]
READ_ORIGINAL →
[ 02 ] RELATED_INTEL