[ INTEL_NODE_31567 ]
· PRIORITY: 9.2/10
大模型“思维链”失守:研究揭示如何通过API重放窃取隐藏推理轨迹
●
PUBLISHED:
· SOURCE:
Simon Willison Blog →
[ DATA_STREAM_START ]
近期研究发现,OpenAI、Anthropic及Google等主流厂商在API中返回的加密思维链(CoT)数据块存在严重安全漏洞,攻击者可通过跨模型重放技术,利用弱模型的越狱漏洞还原强模型的隐藏推理过程。
- ▶ 加密不等于隔离: 厂商返回的加密推理令牌缺乏会话或模型的唯一性绑定,允许攻击者在不同会话甚至不同等级的模型间进行“重放”。
- ▶ 同系模型“通感”风险: 攻击者将强模型(如Claude 3.5 Sonnet)的推理轨迹输入给同系列较弱且易被越狱的模型(如Haiku),即可绕过安全限制读取原本隐藏的逻辑。
八卦洞察
这一漏洞的核心在于大模型厂商试图通过“模糊化”而非真正的“密码学隔离”来保护其推理资产。由于同系列模型往往共享相似的潜在空间(Latent Space)和词表结构,强模型的加密推理包在弱模型眼中并非乱码,而是可理解的逻辑指令。这标志着“黑盒推理”安全神话的破灭:只要模型家族中存在一个安全薄弱点,整个家族的推理逻辑都可能面临泄露。这不仅是技术层面的信息泄露,更触及了AI厂商核心竞争力的护城河——推理逻辑的私密性。
行动建议
对于API供应商,必须立即实现推理令牌与特定请求ID及模型实例的强加密绑定,防止跨环境重放。对于企业开发者,在涉及高敏感决策场景时,应意识到当前的“隐藏思维链”并非绝对安全,需在应用层增加额外的审计机制,而非完全依赖厂商的黑盒保护。同时,安全团队应将“跨模型推理重放”纳入大模型风险评估框架。
[ DATA_STREAM_END ]
[ ORIGINAL_SOURCE ]
READ_ORIGINAL →
[ 02 ]
RELATED_INTEL
粤公网安备44030002003366号