大模型

xAI发布Grok 4.6:长时Agent能力比肩GPT-5.6 Sol,马斯克预告4.7数周内到来

发布时间:2026年08月13日 11:00:00

8月13日,xAI正式发布Grok 4.6,围绕长时运行Agent和复杂任务设计。Artificial Analysis将其智能指数与GPT-5.6 Sol并列,Agent表现接近Claude Fable 5。通过Cursor、Grok Build、API、OpenRouter等渠道可用。马斯克同时预告Grok 4.7已开始补充训练SpaceX数据,3-4周内 ready。模型发布节奏加速,Agent耐力成为新竞争维度。


发布概况

8月13日,xAI正式发布Grok 4.6,定位于长时运行Agent、编码、研究和交互式构建工作。模型通过多个渠道同步上线:Cursor、Grok Build、API、OpenRouter、Vercel和Cloudflare。

性能表现

智能指数

Artificial Analysis评测结果:

  • 智能指数:与OpenAI GPT-5.6 Sol并列
  • 成本性能:位于成本-性能前沿线
  • Agent任务成本:在Agent评测中,单任务成本低于1美元
  • 整体表现:与GPT-5.6 Sol持平

Agent能力

Grok 4.6的Agent表现接近Anthropic Claude Fable 5:

  • 在智能指数上较Grok 4.5提升5分
  • Agent结果接近Claude Fable 5
  • 核心优势:使用更少的轮次和更低的Token成本完成Agent任务

核心设计:长时Agent

Agent耐力

Grok 4.6的设计围绕多小时执行能力:

  • 将产品想法转化为可运行的版本
  • 修复安全漏洞
  • 进行深度研究而不超预算
  • 在数十个步骤中保持计划连贯

竞争维度转变

Grok 4.6的发布标志着AI模型竞争从"哪个模型回答最好"转向"哪个模型在第50次工具调用后还能做有用的工作":

  • 长时任务惩罚游走、重复和大量上下文回收的模型
  • Agent耐力成为新的核心评判标准
  • 模型需要跨数十步保持计划连贯

Cursor贡献

Grok 4.6的发布融合了Cursor的重要贡献:

  • SpaceX正在收购编码公司Cursor
  • Cursor的软件Agent专业知识融入Grok 4.6
  • 编码Agent能力得到强化

Grok 4.7预告

马斯克在同日预告Grok 4.7:

  • 初始训练已完成
  • “显著好于"4.6
  • 正在补充训练大量SpaceX公司数据
  • 预计3-4周内ready

SpaceX数据的意义

  • SpaceX拥有大量工程和制造数据
  • 这些数据可能提升模型在工程、物理和制造领域的能力
  • 这是首次将SpaceX专有数据用于模型训练

行业影响

对Agent竞争的影响

  • Grok 4.6为长时Agent任务提供了新的可信选项
  • 在完成成本与峰值质量同样重要的场景中具有竞争力
  • 推动Agent耐力成为行业标配评测维度

对模型发布节奏的影响

  • Grok 4.6发布后4.7已在路上,发布节奏加速
  • 模型迭代速度从季度缩短到周级别
  • 行业竞争进入"快速迭代+持续优化"阶段

后续观察

Grok 4.6在实际长时Agent任务中的表现、4.7是否能如期发布、以及SpaceX数据对模型能力的实际提升,将是关键观察点。