大模型
xAI发布Grok 4.6:长时Agent能力比肩GPT-5.6 Sol,马斯克预告4.7数周内到来
发布时间:2026年08月13日 11:00:008月13日,xAI正式发布Grok 4.6,围绕长时运行Agent和复杂任务设计。Artificial Analysis将其智能指数与GPT-5.6 Sol并列,Agent表现接近Claude Fable 5。通过Cursor、Grok Build、API、OpenRouter等渠道可用。马斯克同时预告Grok 4.7已开始补充训练SpaceX数据,3-4周内 ready。模型发布节奏加速,Agent耐力成为新竞争维度。
发布概况
8月13日,xAI正式发布Grok 4.6,定位于长时运行Agent、编码、研究和交互式构建工作。模型通过多个渠道同步上线:Cursor、Grok Build、API、OpenRouter、Vercel和Cloudflare。
性能表现
智能指数
Artificial Analysis评测结果:
- 智能指数:与OpenAI GPT-5.6 Sol并列
- 成本性能:位于成本-性能前沿线
- Agent任务成本:在Agent评测中,单任务成本低于1美元
- 整体表现:与GPT-5.6 Sol持平
Agent能力
Grok 4.6的Agent表现接近Anthropic Claude Fable 5:
- 在智能指数上较Grok 4.5提升5分
- Agent结果接近Claude Fable 5
- 核心优势:使用更少的轮次和更低的Token成本完成Agent任务
核心设计:长时Agent
Agent耐力
Grok 4.6的设计围绕多小时执行能力:
- 将产品想法转化为可运行的版本
- 修复安全漏洞
- 进行深度研究而不超预算
- 在数十个步骤中保持计划连贯
竞争维度转变
Grok 4.6的发布标志着AI模型竞争从"哪个模型回答最好"转向"哪个模型在第50次工具调用后还能做有用的工作":
- 长时任务惩罚游走、重复和大量上下文回收的模型
- Agent耐力成为新的核心评判标准
- 模型需要跨数十步保持计划连贯
Cursor贡献
Grok 4.6的发布融合了Cursor的重要贡献:
- SpaceX正在收购编码公司Cursor
- Cursor的软件Agent专业知识融入Grok 4.6
- 编码Agent能力得到强化
Grok 4.7预告
马斯克在同日预告Grok 4.7:
- 初始训练已完成
- “显著好于"4.6
- 正在补充训练大量SpaceX公司数据
- 预计3-4周内ready
SpaceX数据的意义
- SpaceX拥有大量工程和制造数据
- 这些数据可能提升模型在工程、物理和制造领域的能力
- 这是首次将SpaceX专有数据用于模型训练
行业影响
对Agent竞争的影响
- Grok 4.6为长时Agent任务提供了新的可信选项
- 在完成成本与峰值质量同样重要的场景中具有竞争力
- 推动Agent耐力成为行业标配评测维度
对模型发布节奏的影响
- Grok 4.6发布后4.7已在路上,发布节奏加速
- 模型迭代速度从季度缩短到周级别
- 行业竞争进入"快速迭代+持续优化"阶段
后续观察
Grok 4.6在实际长时Agent任务中的表现、4.7是否能如期发布、以及SpaceX数据对模型能力的实际提升,将是关键观察点。