AI研究
NVIDIA AVO Agent系统ARC-AGI-3公开集100%通关,Claude Opus 5助力
发布时间:2026年08月21日 11:00:008月21日NVIDIA宣布,其AVO Agent系统在ARC-AGI-3公开测试集上以100%分数通过全部183关,创下该数据集公开最好成绩。配合Claude Opus 5模型在25个环境中稳定完成长周期自主智能体任务,标志前沿通用架构在长时自主Agent方向上取得重要突破,距离人类智能的通用能力又近一步。
事件概况
8月21日NVIDIA在开发者博客正式宣布,其AVO(Autonomous Vehicle Operation,自主运行操作)Agent系统在ARC-AGI-3公开测试集上以100%满分通关全部183关。系统配合Claude Opus 5大模型,在25个环境中稳定完成长周期自主智能体任务,创下该数据集公开最好成绩。
ARC-AGI-3测试集
背景
| 维度 | 详情 |
|---|---|
| 全称 | Abstraction and Reasoning Corpus - AGI Level 3 |
| 设计者 | François Chollet等 |
| 难度 | 通用智能测试集第三级,目前公开最难版本 |
| 核心测试 | 抽象推理、类比、模式归纳、长时规划 |
| 设计初衷 | 测试"真正理解"而非刷题 |
通关成绩对比
| 系统 | 通关率 | 环境数 |
|---|---|---|
| NVIDIA AVO + Claude Opus 5 | 100%(183/183) | 25个 |
| 此前公开最好成绩 | ~85-90% | - |
| GPT-5.6 Sol | ~90% | - |
| Claude Mythos 5 | ~90% | - |
AVO系统架构
核心设计
| 组件 | 作用 |
|---|---|
| AVO Harness | Agent运行框架,管理任务生命周期 |
| NVIDIA安全运行时 | 最小权限+临时凭证+网络限制 |
| Claude Opus 5 | 核心模型,负责推理决策 |
| 工具系统 | 25个环境的接口封装 |
| 长期记忆模块 | 跨任务、跨天记忆保留 |
| 失败恢复 | 自动重试、降级与回滚 |
NVIDIA安全团队同日拆解智能体栈
NVIDIA安全团队8月21日在技术博客中同步拆解智能体系统:
| 层级 | 组件 | 安全要求 |
|---|---|---|
| 模型层 | 大模型 | 提示词安全 |
| Harness层 | Agent封装框架 | 权限控制与流程编排 |
| 安全运行时 | 独立运行环境 | 强制隔离,Agent无法自改 |
| 推理基础设施 | GPU/服务端 | 网络和数据访问控制 |
核心判断:如果安全控制只是AI可以选择调用的工具,就不是可靠边界。更稳妥的设计,是在启动时建立隔离环境,用最小权限、临时凭证、网络限制和日志来约束工具及MCP进程。重要权限必须由智能体无法自行修改的下层强制执行。
为什么这一突破重要
| 维度 | 说明 |
|---|---|
| 长时推理 | 完成长周期任务而非单步问答 |
| 跨环境泛化 | 25个环境均100%通过 |
| 抽象推理 | 真正的类人抽象理解而非记忆 |
| 自主执行 | 无需人工干预完成全流程 |
与DeepMind同日长期智能体研究的呼应
Google DeepMind 8月21日同样介绍了与Fenris Creations及EVE系列游戏的长期智能体研究合作,重点方向:
| 能力 | 研究重点 |
|---|---|
| 持续学习 | Agent在长期运行中累积能力 |
| 长期记忆 | 跨会话、跨任务状态保留 |
| 长周期规划 | 数天/数周级任务规划 |
| 多智能体 | 复杂多智能体互动 |
研究策略:先使用真实玩家隔离的EVE Online离线实例验证,能力成熟后才探索玩家环境。企业智能体的道理一样:任务跨天后要记住状态,权限变化后不能越界,工具失败后能够恢复。
行业意义
从单次答对到长期可靠执行
| 阶段 | 核心能力 | 代表 |
|---|---|---|
| 1.0 | 单次问答答对 | GPT-4/Claude 3时代 |
| 2.0 | 多步任务规划 | Agent初代,2025年 |
| 3.0 | 长时环境中稳定可靠 | NVIDIA AVO、ARC-AGI-3通关 |
对企业部署的意义
| 要求 | 如何满足 |
|---|---|
| 可靠性 | 100%通过测试集意味着可控 |
| 安全 | 独立安全运行时而非提示词层控制 |
| 可审计 | NVIDIA架构强制日志和追溯 |
| 边界清晰 | 权限由下层强制执行 |
后续观察
AVO系统是否开放商用授权、安全运行时是否会成为行业标准,以及ARC-AGI-3私榜的最终成绩,将是关键观察点。