AI安全

Anthropic 186页风险报告:错位风险从极低升至低,生物安全分类器关闭11个月涉及1.33亿次对话

发布时间:2026年08月18日 10:00:00

8月18日报道,Anthropic第二份全公司风险报告显示,灾难性错位风险从极低升至低,披露了未发布的Model 2模型,并承认生物安全分类器在11个月内对1.33亿次承包商对话未运行。任务评估已饱和无法检测能力增长,Claude已编写Anthropic生产系统大部分代码。


事件概况

8月18日报道,Anthropic发布了第二份全公司风险报告(版本3.4负责任扩展政策),共186页,覆盖2026年2月24日至7月15日。这是首份同时评估内部模型和已发布模型的报告。

核心发现

1. 错位风险升级

风险维度此前等级当前等级变化
灾难性错位(高风险场景)极低(Very Low)低(Low)上调

值得注意的是,上调原因不是模型未通过安全测试,而是近期网络安全评估事件披露提高了整体不确定性。Anthropic表示,虽然认为其底层论据可能仍支持"极低",但出于谨慎将标签上调。

2. Model 2披露

  • 代号:Model 2
  • 性能:比Claude Mythos 5更强(Anthropic自身工程基准)
  • 状态:内部大量使用,无外部发布计划
  • 安全评估:内部部署审查未发现比Mythos 5更令人担忧的错位

3. 评估饱和问题

最令人关注的发现之一:基于任务的自动化AI研发评估已经饱和,不再能检测到能力增长。与此同时,公司报告了加速的早期迹象。用于检测危险阈值跨越的工具已无法测量向其移动的趋势。

4. Claude编写生产代码

Claude现在编写了Anthropic生产代码库中合并的大部分代码。公司估计AI辅助研发比非辅助工作明显更快,但尚未达到2倍速。

11个月的安全分类器缺口

事件详情

报告第4节 buried 的最严重问题:

维度详情
影响时间2025年5月至2026年4月
影响范围约133次对话,来自约5万名承包商
问题原因内部标志静默禁用了阻拦和日志功能
承包商审核由外部供应商而非Anthropic审核

回溯检查

  • 使用Claude Sonnet 5进行回溯扫描
  • 标记了1,197条高风险对话记录
  • 人工审查未发现明显滥用

自我修正

Anthropic还追溯将2月的评估结论从"极低"下调至"低"。一份安全报告修正此前安全报告的情况并不常见。

年轻美国人对AI高管的不信任

CNBC调查

CNBC和Generation Labs对1,000多名18-34岁美国人的调查:

高管不信任比例
Alex Karp(Palantir)81%
Peter Thiel79%
Mark Zuckerberg(Meta)71%
Elon Musk(xAI)70%
Sam Altman(OpenAI)69%
Satya Nadella(Microsoft)唯一净信任

其他发现

  • 45%的受访者预期AI会损害他们的职业
  • 60%希望放缓数据中心建设
  • 数据中心建设是具有政策后果的本地议题

DeepMind描绘AGI到超级智能的路径

Google DeepMind于8月14日发表论文,描绘了从AGI到ASI(超级智能)的四条技术路径:

路径说明
持续扩展算力、模型大小、数据和推理时计算的增长
算法范式转换超越Transformer架构的新范式
递归自我改进AI加速AI研发
多Agent集体智能多个Agent协作产生集体智能

Anthropic的财务表现

指标数据
Q2营收109亿美元
调整后运营收入正值(首次运营盈利)
Claude Sonnet 5定价当前2美元/百万Token输入
9月1日调价3美元/百万Token输入

行业影响

对AI安全治理的影响

  • 错位风险上调引发对AI安全评估体系的反思
  • 评估饱和问题意味着需要新的评估方法
  • 生物安全分类器缺口暴露了安全运营的脆弱性
  • 其他公司可能需要审查类似的安全运营缺口

对公众信任的影响

  • 主动披露是建立信任的积极步骤
  • 但11个月的安全缺口和评估饱和削弱了信心
  • 年轻一代对AI高管的不信任可能影响政策和市场

后续观察

Model 2是否会发布、评估饱和问题如何解决、以及生物安全分类器缺口是否出现在其他AI公司,将是关键观察点。