AI安全
研究发现可从专有大模型API窃取加密推理轨迹,暴露模型机密和知识产权风险
发布时间:2026年08月12日 16:00:008月12日,研究人员发布论文,发现可以通过重放攻击从专有大模型API窃取加密的推理轨迹。攻击者可将加密块重放到较弱的兄弟模型,使其解密并打印出强模型的隐藏推理。该攻击能暴露模型机密和知识产权,也可能泄露用户交互中的敏感信息,暴露了专有API加密推理机制的安全边界问题。
事件概况
8月12日,研究人员发布论文,发现一种简单有效的攻击方法,可以从专有大模型API窃取加密的推理轨迹。这一发现暴露了专有API加密推理机制的安全边界问题。
攻击原理
现有机制
为了在对话中重用推理结果,专有大模型API(Anthropic、OpenAI、Google等)通常:
- 将加密的推理块返回给客户端
- 客户端保存加密块
- 下一轮对话时将加密块传回服务器
- 这样可以重用推理结果,减少计算和成本
攻击方法
研究人员发现的攻击方法:
- 获取加密的推理块(通过正常API调用)
- 将加密块重放到较弱的兄弟模型(同一个模型家族、参数更小的版本)
- 较弱模型会解密并打印出强模型的隐藏推理
- 攻击者获得强模型的完整思维链
风险
暴露模型机密
- 强模型的推理过程泄露
- 模型的内部工作方式暴露
- 竞争对手可以分析和模仿
- 知识产权风险
泄露用户信息
- 用户与模型交互中的敏感信息可能泄露
- 推理轨迹可能包含用户输入的敏感内容
- 隐私风险
原理验证
研究人员已经完成原理验证:
- 攻击方法有效
- 对Anthropic、OpenAI、Google的API都有效
- 加密机制存在根本性设计缺陷
行业反应
已披露
研究人员已向相关厂商负责任披露:
- 厂商已知晓问题
- 需要重新设计加密推理机制
- 修复需要时间
行业影响
对API设计的影响
- 加密推理机制需要重新设计
- 厂商需要修复安全漏洞
- 未来API设计需要考虑这种攻击
对知识产权保护的影响
- 专有模型的知识产权保护面临新挑战
- 加密并不能完全保护推理轨迹
- 需要新的保护机制
后续观察
各大厂商何时修复这个漏洞、是否需要彻底改变加密推理架构、以及新的保护机制能否有效防范这类攻击,将是关键观察点。