AI资讯

神秘模型Ox Alpha空降OpenRouter登顶:1M上下文免费开放,4万亿Token被消耗,开发者指纹追踪指向智谱GLM

发布时间:2026年08月24日 11:00:00

概述8月20日一个名为Ox Alpha的匿名推理模型悄然出现在OpenRouter平台,拥有100万token上下文窗口、支持文本、图像、视频输入,免费开放。数日内攀升至OpenRouter使用量榜首,累计消耗超4万亿token。社区技术指纹分析显示其tokenizer和视频编码器行为与智谱AI的GLM系列高度一致,推测为744B总参、40B活跃的MoE架构。Patrick Collison称其非常出色。


神秘模型Ox Alpha空降OpenRouter登顶:1M上下文免费开放,4万亿Token被消耗,开发者指纹追踪指向智谱GLM

8 月 20 日,一个名为 Ox Alpha 的匿名推理模型悄然出现在 OpenRouter 平台上,标识符为 stealth/ox-alpha。它拥有 1,048,576 token(即 100 万)的上下文窗口、支持文本 / 图像 / 视频多模态输入、最大输出 131,072 token,并且完全免费开放。短短数日内,Ox Alpha 攀升至 OpenRouter 使用量榜首并创下平台单日使用记录。截至 8 月 24 日 AIBase 报道时,仅 Hermes Agent、Claude Code、DeepSeek Harness、omp、pi 五大应用就累计消耗了超过 4 万亿 token。社区技术指纹分析显示,其 tokenizer 与视频编码器行为与智谱 AI 的 GLM 系列高度一致,推测为 744B 总参 / 40B 活跃的 MoE 架构。Stripe 创始人 Patrick Collison 评价其为「非常出色」。

Ox Alpha 的核心参数:1M 上下文 + 多模态 + 免费

根据 OpenRouter 页面与社区测试整理的关键参数:

项目内容
平台标识符stealth/ox-alpha
上下文窗口1,048,576 token(约 100 万)
最大输出131,072 token
输入模态文本、图像、视频
能力支持工具调用、结构化输出
定价免费开放约一周
提供方声明OpenRouter 仅声明为路由方,非开发者 / 所有者 / 提供者
推测架构744B 总参 / 40B 活跃 MoE
推理速度约 49–78 tok/s
工具调用错误率约 1.99%
缓存命中率约 83%

1M 上下文 + 视频输入 + 免费开放,这三个标签组合在一起,在当前商用大模型市场上几乎没有第二家能做到。这也是 Ox Alpha 一上线就引爆开发者社区的根本原因。

OpenRouter 的身份声明:只是路由方

Ox Alpha 上线后,OpenRouter 在模型页面明确声明:OpenRouter 只是路由方,不是该模型的开发者、所有者或提供者。这一声明既是合规免责,也意味着:

  1. 模型真实身份不公开:OpenRouter 不承担披露模型背后厂商的义务,模型页面不展示训练数据、参数规模、许可协议等常规信息;
  2. 使用风险由用户自担:由于没有明确的许可协议与数据政策,企业用户在生产环境使用 Ox Alpha 存在合规风险;
  3. 「stealth」前缀的含义:OpenRouter 用 stealth/ 前缀标识匿名发布模型,这一命名惯例已成为社区识别「大厂匿名测试模型」的信号。

这种「匿名发布 + 免费开放 + 路由方免责」的组合,实际上是大厂在不正式官宣的情况下进行大规模真实负载压力测试的标准操作。

使用量爆炸:4 万亿 token 与五大消耗者

AIBase 8 月 24 日报道指出,Ox Alpha 已攀升至 OpenRouter 使用量榜首,并创下平台单日使用记录。具体消耗分布:

应用角色消耗量级
Hermes AgentAgent 框架主要消耗者之一
Claude Code代码生成主要消耗者之一
DeepSeek Harness测试与评估主要消耗者之一
omp命令行工具主要消耗者之一
pi推理应用主要消耗者之一
合计超 4 万亿 token

4 万亿 token 是什么概念?作为参考,GPT-4 在 2023 年全年的总消耗量约为 1.6 万亿 token。Ox Alpha 在数天内就达到了 GPT-4 全年消耗的 2.5 倍以上。这一方面反映了免费策略带来的使用爆炸,另一方面也说明 1M 上下文 + 视频输入的组合,确实打开了全新的应用场景——长视频理解、代码库级分析、超长文档处理等过去受上下文限制无法实现的工作负载,现在可以一次性塞进去。

技术指纹分析:指向智谱 GLM

Ox Alpha 上线后,开发者社区迅速展开了技术指纹分析,试图通过模型的行为特征反推其真实身份。主要发现如下:

Tokenizer 指纹

在 25 种提示词测试中,Ox Alpha 的 tokenizer 行为与智谱 GLM-5.3 高度一致,唯一差异是存在一个固定的 +75 token 偏移。这种固定偏移通常意味着两个模型共享同一套 tokenizer 词表,但在 BOS(beginning of sequence)或系统提示前缀的拼接方式上有细微差异——这是同一团队不同版本模型的典型特征。

视频编码器指纹

Ox Alpha 的视频编码器行为与智谱 GLM-5V-Turbo 一致,包括帧采样策略、视频 token 化粒度、跨模态对齐方式等。这进一步缩小了候选范围——目前能在视频输入上做到这一行为的模型家族非常有限。

架构推测

综合 token 消耗速度、推理延迟与上下文窗口规模,社区推测 Ox Alpha 为 744B 总参 / 40B 活跃的 MoE(混合专家)架构。这一规模与智谱此前发布的 GLM 系列旗舰版本参数量级吻合,也解释了为什么能在免费的情况下仍保持 49–78 tok/s 的推理速度——MoE 架构每次推理只激活约 5.4% 的参数。

此前匿名模型先例

Ox Alpha 并非首个通过 OpenRouter 匿名发布的大厂模型。此前已有多个先例:

匿名模型揭幕后真实身份
Pony Alpha智谱 GLM-5
Hunter Alpha小米 MiMo-V2-Pro
Elephant Alpha蚂蚁灵犀
Owl Alpha美团 LongCat-2.0

这一惯例已成为中国 AI 厂商在海外进行真实负载测试的标准路径:先在 OpenRouter 匿名发布,观察真实应用场景下的表现与失败模式,再正式官宣。

Patrick Collison 的背书

Stripe 创始人 Patrick Collison 在社交平台上评价 Ox Alpha 为「非常出色」。这一评价的分量在于:

  1. Stripe 刚在五天前以 80 亿美元收购 OpenRouter,Patrick Collison 作为 OpenRouter 的新所有者,其评价意味着 OpenRouter 平台对 Ox Alpha 的质量背书;
  2. Stripe 的支付视角:Stripe 收购 OpenRouter 的逻辑是支付 + AI 模型路由,Patrick 的正面评价意味着 Ox Alpha 这类高质量匿名模型,正是 OpenRouter 想要吸引的流量来源;
  3. 开发者社区的信号效应:Patrick 的评价通常会带动一批高净值开发者试用,进一步放大 Ox Alpha 的使用量。

Ox Alpha 的战略含义

如果 Ox Alpha 真的是智谱 GLM 系列的新版本,那么这一匿名发布策略包含多层战略意图:

对智谱

  • 真实负载压力测试:1M 上下文 + 视频输入是 GLM 系列此前未大规模验证的能力组合,通过 OpenRouter 的海量真实应用,能在正式发布前发现边缘 case;
  • 海外社区口碑积累:匿名发布让模型本身而非品牌成为评价对象,如果质量过硬,正式发布时口碑已经建立;
  • 对标信号:4 万亿 token 的消耗量本身就是一个市场信号——告诉行业智谱的下一代模型已经有真实大规模使用,而非只是跑分漂亮。

对 OpenRouter

  • 流量与使用记录的双重收获:Ox Alpha 带来的流量与 token 消耗刷新了 OpenRouter 的历史记录,这对刚被 Stripe 收购的 OpenRouter 是一次价值证明;
  • 匿名模型枢纽地位强化:OpenRouter 进一步巩固了其作为「大厂匿名测试模型首选发布平台」的位置,这一角色难以被其他平台替代。

对 OpenAI / Anthropic / Google

  • 免费 + 1M 上下文的冲击:Ox Alpha 的免费开放,让 OpenAI 与 Anthropic 的高价长上下文模型(如 GPT-5.5 Long、Claude Fable 5)面临「为什么付费」的质疑;
  • 中国模型的隐形出海:通过 OpenRouter 匿名发布,中国厂商正在绕过品牌偏见,直接用产品质量在海外开发者社区建立口碑。

性能与局限:并非完美

Ox Alpha 并非没有短板:

  • 工具调用错误率约 1.99%:在工具调用场景下,错误率仍高于 GPT-5.5 与 Claude Opus 5 的水平,意味着在 Agent 场景中仍有可靠性差距;
  • 缓存命中率 83%:这一数字说明大量请求存在重复前缀(如系统提示、长文档),缓存机制有效,但也意味着真实新颖请求的占比有限;
  • 合规风险:匿名身份意味着没有明确的数据政策与许可协议,企业生产环境使用存在法律不确定性。

对 AI 模型市场的连锁影响

  • 对定价体系:1M 上下文 + 视频 + 免费的组合,会倒逼 OpenAI、Anthropic、Google 重新评估自家长上下文模型的定价策略;
  • 对匿名发布惯例:Ox Alpha 的成功会鼓励更多大厂通过 OpenRouter 匿名发布测试模型,OpenRouter 的「stealth」生态会进一步壮大;
  • 对中国 AI 出海:如果 Ox Alpha 最终被证实为智谱 GLM,这将是中国 AI 模型在海外开发者社区影响力最大的一次匿名亮相——4 万亿 token 的真实使用量,比任何跑分都更有说服力。

一句话总结:Ox Alpha 用 1M 上下文、视频输入、免费开放与 4 万亿 token 的消耗量,证明了高质量匿名模型可以在不官宣的情况下征服开发者社区——而它背后大概率站着的,是智谱 GLM。