AI思维链加密机制被攻破。2026年8月11日凌晨,安全研究员Alexander Panfilov(X网名kotekjedi_ml)在社交平台X上披露:其团队成功利用主流AI公司API中的架构漏洞,从加密的“思维链”(Chain of Thought, CoT)中提取出旗舰大模型的完整内部推理过程。相关论文《Stealing Reasoning Traces from Proprietary LLM APIs》(arXiv:2608.09867)迅速引发AI与安全社区震动。
漏洞原理:轻量模型“照抄”旗舰模型思考。研究团队发现,Anthropic、OpenAI和Google三大厂商为保护高价值模型(如Claude Opus 4.8、GPT-5.6、Gemini 3)的推理过程,将思维链以“加密块”形式返回。这些加密块在同一厂商生态内具备跨会话、跨用户甚至跨模型兼容性。攻击者将Opus 4.8生成的加密块发送给同系列轻量模型Haiku 4.5,并附加<thinking-copy>指令,后者便会以明文逐字输出原模型隐藏推理内容。
四大攻击向量威胁巨大:一是蒸馏攻击,竞争对手可窃取推理数据训练替代模型;二是大规模个人信息与API密钥泄露,团队已从公开日志恢复367条PII和182个凭证;三是有害信息通过“安全拒绝”外层渗出;四为不可见提示注入,恶意指令藏于加密块悄然执行。
厂商早已收到预警却未修复。2026年5月,约翰·霍普金斯大学密码学家Matthew Green经漏洞赏金计划向三家厂商报告相同问题。OpenAI称“无法复现”,Anthropic认为“无安全影响”。直至论文公布315,320个可解密块后,厂商才被迫正视。
漏洞根源在于混淆保密性与防重放安全。当前方案仅提供静态加密,忽略密码学防重放要求。
修复建议:绑定上下文标识符或推理块留服务器端。此事件被视为“安全剧场”典型案例。
从Polymarket到美股:事件映射资产价格。漏洞曝光后,预测市场Polymarket上关于“Anthropic是否遭遇重大数据泄露”的合约价格飙升,反映市场对AI治理担忧。美股科技板块承压,投资者重评闭源大模型企业风险敞口。AI基础设施安全漏洞正成为影响数字资产与传统金融市场的新型传导因子。
