Z.ai 发布 Ox Alpha:智谱 AI 隐秘模型,1M 上下文窗口,多项编码任务超越 GPT-5.6

智谱 AI(Z.ai)在 Bloomberg 2026 年 8 月 26 日的报道中正式确认,其发布的隐身模型 "Ox Alpha" 是 GLM 系列的新成员。这款模型此前以匿名身份在 LiveBench 等基准测试中亮相,社区一度猜测其来源。确认身份后,智谱 AI 表示将公开模型权重。

模型规格

Ox Alpha 定位为前沿推理模型,核心参数如下:

社区基准测试表现

Ox Alpha 官网展示了 10 项真实编码任务的独立基准测试结果。在这项测试中,Ox Alpha 解决了 8 项,领先于同期参与对比的所有前沿模型:

测试包含 10 项编码任务,如 anko-typed-variable-bindingsarktype-json-schema-refsfastapi-deprecation-headers 等,均为实际工程场景。Ox Alpha 在一项所有参考模型都仅取得 1/4 通过率的任务上成功解决。

不过 LiveBench 独立基准测试尚未收录 Ox Alpha。目前 LiveBench 排行榜(2026-06-25 版本)前五名为:Claude Fable 5 Max(83.0)、GPT-5.6 Sol Max(81.0)、GPT-5.5 Thinking xHigh(80.2)、Claude 5 Opus Thinking Max(80.1)、Kimi K3(79.2)。Ox Alpha 的 LiveBench 分数仍有待公布。

"小模型,大能力"的定位

Hacker News 社区对 Ox Alpha 的讨论集中在几个方向:

有用户指出 Ox Alpha 可能是一个"小模型,大幅提升能力"的典型案例——在简单基准测试上出错较多,但能自主修复所有错误。这意味着它通过更多 tokens、更多轮次、更多工具调用来达成与 GPT-5.6 Sol 相同的最终结果。

也有用户发现 LiveBench 上 Ox Alpha 的分数低于 GPT-5.4 Nano,但在其官网基准测试中超越了 Fable 5。这种差异可能源于测试集不同——官网的 10 项编码任务针对性更强,而 LiveBench 是 23 项跨类别的综合测试。

智谱 AI 的开源承诺

Bloomberg 报道称,智谱 AI 已承诺将公开 Ox Alpha 的模型权重。这延续了中国 AI 公司近期的开源趋势——DeepSeek、Qwen、Moonshot(Kimi)等厂商纷纷开源其旗舰模型。如果 Ox Alpha 权重最终开源,将为开源社区增添一个具有 100 万上下文窗口的推理模型选项。

体验方式

Ox Alpha 目前可通过 oxalpha.com 免费试用,无需注册、无需订阅。界面简洁:输入问题或提示,模型实时推理并输出结果。支持移动端浏览器访问。

智谱 AI 的 API 平台(open.bigmodel.cn)目前尚未列出 Ox Alpha 模型,这表明它可能仍处于独立测试阶段,API 接入通道尚未开放。