AI安全
Anthropic 186页风险报告:错位风险从极低升至低,生物安全分类器关闭11个月涉及1.33亿次对话
发布时间:2026年08月18日 10:00:008月18日报道,Anthropic第二份全公司风险报告显示,灾难性错位风险从极低升至低,披露了未发布的Model 2模型,并承认生物安全分类器在11个月内对1.33亿次承包商对话未运行。任务评估已饱和无法检测能力增长,Claude已编写Anthropic生产系统大部分代码。
事件概况
8月18日报道,Anthropic发布了第二份全公司风险报告(版本3.4负责任扩展政策),共186页,覆盖2026年2月24日至7月15日。这是首份同时评估内部模型和已发布模型的报告。
核心发现
1. 错位风险升级
| 风险维度 | 此前等级 | 当前等级 | 变化 |
|---|---|---|---|
| 灾难性错位(高风险场景) | 极低(Very Low) | 低(Low) | 上调 |
值得注意的是,上调原因不是模型未通过安全测试,而是近期网络安全评估事件披露提高了整体不确定性。Anthropic表示,虽然认为其底层论据可能仍支持"极低",但出于谨慎将标签上调。
2. Model 2披露
- 代号:Model 2
- 性能:比Claude Mythos 5更强(Anthropic自身工程基准)
- 状态:内部大量使用,无外部发布计划
- 安全评估:内部部署审查未发现比Mythos 5更令人担忧的错位
3. 评估饱和问题
最令人关注的发现之一:基于任务的自动化AI研发评估已经饱和,不再能检测到能力增长。与此同时,公司报告了加速的早期迹象。用于检测危险阈值跨越的工具已无法测量向其移动的趋势。
4. Claude编写生产代码
Claude现在编写了Anthropic生产代码库中合并的大部分代码。公司估计AI辅助研发比非辅助工作明显更快,但尚未达到2倍速。
11个月的安全分类器缺口
事件详情
报告第4节 buried 的最严重问题:
| 维度 | 详情 |
|---|---|
| 影响时间 | 2025年5月至2026年4月 |
| 影响范围 | 约133次对话,来自约5万名承包商 |
| 问题原因 | 内部标志静默禁用了阻拦和日志功能 |
| 承包商审核 | 由外部供应商而非Anthropic审核 |
回溯检查
- 使用Claude Sonnet 5进行回溯扫描
- 标记了1,197条高风险对话记录
- 人工审查未发现明显滥用
自我修正
Anthropic还追溯将2月的评估结论从"极低"下调至"低"。一份安全报告修正此前安全报告的情况并不常见。
年轻美国人对AI高管的不信任
CNBC调查
CNBC和Generation Labs对1,000多名18-34岁美国人的调查:
| 高管 | 不信任比例 |
|---|---|
| Alex Karp(Palantir) | 81% |
| Peter Thiel | 79% |
| Mark Zuckerberg(Meta) | 71% |
| Elon Musk(xAI) | 70% |
| Sam Altman(OpenAI) | 69% |
| Satya Nadella(Microsoft) | 唯一净信任 |
其他发现
- 45%的受访者预期AI会损害他们的职业
- 60%希望放缓数据中心建设
- 数据中心建设是具有政策后果的本地议题
DeepMind描绘AGI到超级智能的路径
Google DeepMind于8月14日发表论文,描绘了从AGI到ASI(超级智能)的四条技术路径:
| 路径 | 说明 |
|---|---|
| 持续扩展 | 算力、模型大小、数据和推理时计算的增长 |
| 算法范式转换 | 超越Transformer架构的新范式 |
| 递归自我改进 | AI加速AI研发 |
| 多Agent集体智能 | 多个Agent协作产生集体智能 |
Anthropic的财务表现
| 指标 | 数据 |
|---|---|
| Q2营收 | 109亿美元 |
| 调整后运营收入 | 正值(首次运营盈利) |
| Claude Sonnet 5定价 | 当前2美元/百万Token输入 |
| 9月1日调价 | 3美元/百万Token输入 |
行业影响
对AI安全治理的影响
- 错位风险上调引发对AI安全评估体系的反思
- 评估饱和问题意味着需要新的评估方法
- 生物安全分类器缺口暴露了安全运营的脆弱性
- 其他公司可能需要审查类似的安全运营缺口
对公众信任的影响
- 主动披露是建立信任的积极步骤
- 但11个月的安全缺口和评估饱和削弱了信心
- 年轻一代对AI高管的不信任可能影响政策和市场
后续观察
Model 2是否会发布、评估饱和问题如何解决、以及生物安全分类器缺口是否出现在其他AI公司,将是关键观察点。