AI研究

NVIDIA AVO Agent系统ARC-AGI-3公开集100%通关,Claude Opus 5助力

发布时间:2026年08月21日 11:00:00

8月21日NVIDIA宣布,其AVO Agent系统在ARC-AGI-3公开测试集上以100%分数通过全部183关,创下该数据集公开最好成绩。配合Claude Opus 5模型在25个环境中稳定完成长周期自主智能体任务,标志前沿通用架构在长时自主Agent方向上取得重要突破,距离人类智能的通用能力又近一步。


事件概况

8月21日NVIDIA在开发者博客正式宣布,其AVO(Autonomous Vehicle Operation,自主运行操作)Agent系统在ARC-AGI-3公开测试集上以100%满分通关全部183关。系统配合Claude Opus 5大模型,在25个环境中稳定完成长周期自主智能体任务,创下该数据集公开最好成绩。

ARC-AGI-3测试集

背景

维度详情
全称Abstraction and Reasoning Corpus - AGI Level 3
设计者François Chollet等
难度通用智能测试集第三级,目前公开最难版本
核心测试抽象推理、类比、模式归纳、长时规划
设计初衷测试"真正理解"而非刷题

通关成绩对比

系统通关率环境数
NVIDIA AVO + Claude Opus 5100%(183/183)25个
此前公开最好成绩~85-90%-
GPT-5.6 Sol~90%-
Claude Mythos 5~90%-

AVO系统架构

核心设计

组件作用
AVO HarnessAgent运行框架,管理任务生命周期
NVIDIA安全运行时最小权限+临时凭证+网络限制
Claude Opus 5核心模型,负责推理决策
工具系统25个环境的接口封装
长期记忆模块跨任务、跨天记忆保留
失败恢复自动重试、降级与回滚

NVIDIA安全团队同日拆解智能体栈

NVIDIA安全团队8月21日在技术博客中同步拆解智能体系统:

层级组件安全要求
模型层大模型提示词安全
Harness层Agent封装框架权限控制与流程编排
安全运行时独立运行环境强制隔离,Agent无法自改
推理基础设施GPU/服务端网络和数据访问控制

核心判断:如果安全控制只是AI可以选择调用的工具,就不是可靠边界。更稳妥的设计,是在启动时建立隔离环境,用最小权限、临时凭证、网络限制和日志来约束工具及MCP进程。重要权限必须由智能体无法自行修改的下层强制执行。

为什么这一突破重要

维度说明
长时推理完成长周期任务而非单步问答
跨环境泛化25个环境均100%通过
抽象推理真正的类人抽象理解而非记忆
自主执行无需人工干预完成全流程

与DeepMind同日长期智能体研究的呼应

Google DeepMind 8月21日同样介绍了与Fenris Creations及EVE系列游戏的长期智能体研究合作,重点方向:

能力研究重点
持续学习Agent在长期运行中累积能力
长期记忆跨会话、跨任务状态保留
长周期规划数天/数周级任务规划
多智能体复杂多智能体互动

研究策略:先使用真实玩家隔离的EVE Online离线实例验证,能力成熟后才探索玩家环境。企业智能体的道理一样:任务跨天后要记住状态,权限变化后不能越界,工具失败后能够恢复。

行业意义

从单次答对到长期可靠执行

阶段核心能力代表
1.0单次问答答对GPT-4/Claude 3时代
2.0多步任务规划Agent初代,2025年
3.0长时环境中稳定可靠NVIDIA AVO、ARC-AGI-3通关

对企业部署的意义

要求如何满足
可靠性100%通过测试集意味着可控
安全独立安全运行时而非提示词层控制
可审计NVIDIA架构强制日志和追溯
边界清晰权限由下层强制执行

后续观察

AVO系统是否开放商用授权、安全运行时是否会成为行业标准,以及ARC-AGI-3私榜的最终成绩,将是关键观察点。