AI安全

研究发现可从专有大模型API窃取加密推理轨迹,暴露模型机密和知识产权风险

发布时间:2026年08月12日 16:00:00

8月12日,研究人员发布论文,发现可以通过重放攻击从专有大模型API窃取加密的推理轨迹。攻击者可将加密块重放到较弱的兄弟模型,使其解密并打印出强模型的隐藏推理。该攻击能暴露模型机密和知识产权,也可能泄露用户交互中的敏感信息,暴露了专有API加密推理机制的安全边界问题。


事件概况

8月12日,研究人员发布论文,发现一种简单有效的攻击方法,可以从专有大模型API窃取加密的推理轨迹。这一发现暴露了专有API加密推理机制的安全边界问题。

攻击原理

现有机制

为了在对话中重用推理结果,专有大模型API(Anthropic、OpenAI、Google等)通常:

  • 将加密的推理块返回给客户端
  • 客户端保存加密块
  • 下一轮对话时将加密块传回服务器
  • 这样可以重用推理结果,减少计算和成本

攻击方法

研究人员发现的攻击方法:

  1. 获取加密的推理块(通过正常API调用)
  2. 将加密块重放到较弱的兄弟模型(同一个模型家族、参数更小的版本)
  3. 较弱模型会解密并打印出强模型的隐藏推理
  4. 攻击者获得强模型的完整思维链

风险

暴露模型机密

  • 强模型的推理过程泄露
  • 模型的内部工作方式暴露
  • 竞争对手可以分析和模仿
  • 知识产权风险

泄露用户信息

  • 用户与模型交互中的敏感信息可能泄露
  • 推理轨迹可能包含用户输入的敏感内容
  • 隐私风险

原理验证

研究人员已经完成原理验证:

  • 攻击方法有效
  • 对Anthropic、OpenAI、Google的API都有效
  • 加密机制存在根本性设计缺陷

行业反应

已披露

研究人员已向相关厂商负责任披露:

  • 厂商已知晓问题
  • 需要重新设计加密推理机制
  • 修复需要时间

行业影响

对API设计的影响

  • 加密推理机制需要重新设计
  • 厂商需要修复安全漏洞
  • 未来API设计需要考虑这种攻击

对知识产权保护的影响

  • 专有模型的知识产权保护面临新挑战
  • 加密并不能完全保护推理轨迹
  • 需要新的保护机制

后续观察

各大厂商何时修复这个漏洞、是否需要彻底改变加密推理架构、以及新的保护机制能否有效防范这类攻击,将是关键观察点。