概述

8 月 26 日,两家中国 AI 公司几乎同时发布了重量级开源模型。智谱 AI(Z.ai)开源了 GLM-5.3-Flash,这是目前参数量最大的开源 MoE 模型之一;阿里巴巴通义团队同步发布了 Qwen3.8-Flash-Next,作为 Qwen4 架构的早期预览。两款模型都走 MoE 路线,都声称大幅降低训练成本,都在 Hacker News 上引发热议。

GLM-5.3-Flash:320B 参数,18B 激活

智谱 AI 在其官方博客宣布了 GLM-5.3-Flash。模型采用混合专家架构,总参数 320B,每个 token 激活 18B 参数。上下文窗口 1M tokens,支持文本和图像输入,文本输出。

性能与定价

Artificial Analysis 的评测显示,GLM-5.3-Flash 在智能指数上排名第 3(共 110 个模型),得分 57,远超同级别模型的中位数 28。速度方面,输出约 50 tokens/秒,略低于平均值 65。

API 定价相当有竞争力:

项目价格 (USD)价格 (CNY)
输入$0.15/1M tokens≈¥1.10/1M tokens
输出$0.50/1M tokens≈¥3.65/1M tokens
缓存输入$0.03/1M tokens≈¥0.22/1M tokens

模型以 MIT 许可证开源,权重已上传至 HuggingFace(zai-org/GLM-5.3-Flash)。

Ox Alpha 之谜揭晓

这个模型其实有个更有趣的故事。8 月中旬,一个名为 Ox Alpha 的神秘模型出现在 OpenRouter 排行榜上,性能不俗但身份不明。安全研究员通过 prompt 注入提取了系统提示词,发现其被要求自称"未公开组织开发的 ox-alpha"。随后,gzip-NCD 压缩分析(一种基于文本压缩率的模型归类方法)将 Ox Alpha 与 GLM-5.3 的输出模式高度匹配。Bloomberg 的报道最终确认:Ox Alpha 就是 GLM-5.3-Flash。

HN 上的讨论提到,这个模型在 livebench.ai 上的表现不如 GPT-5.4 Nano,但在某些任务上又超越了它。有用户推测这是一个小模型在测试集上表现突出,但在真实场景中表现一般。

Qwen3.8-Flash-Next:Qwen4 架构预览

阿里巴巴通义团队几乎同一天发布了 Qwen3.8-Flash-Next。这不是常规的模型迭代,而是 Qwen4 架构的早期预览。官方将其比作 Qwen3-Next 对 Qwen3.5 的角色:先发布架构变更,让社区在完整 Qwen4 家族发布前先行检验。

架构创新

Qwen3.8-Flash-Next 在四个维度做了升级:

规模与性能

模型规模为 125B 主参数 + 51B N-gram 嵌入,每个 token 激活 6B 参数。官方称训练成本仅为 Qwen3.7-Plus 的 1/9,但在编码和办公任务上全面超越后者。

HN 上有评论指出这是"小模型以小搏大"的典型案例。Unsloth 已经发布了 GGUF 量化版本,方便本地部署。

两款模型的对比

项目GLM-5.3-FlashQwen3.8-Flash-Next
发布方智谱 AI (Z.ai)阿里巴巴通义
总参数320B125B + 51B 嵌入
激活参数18B6B
上下文窗口1M tokens未明确公布
多模态文本+图像输入文本+图像输入
许可证MIT未明确
训练成本未公布Qwen3.7-Plus 的 1/9

对开源生态的影响

这两款模型的发布让开源社区的 Pareto 前沿被中国公司主导。Artificial Analysis 的评论指出,开源模型的性能-成本曲线现在基本由中国模型定义。GLM-5.3-Flash 的 MIT 许可证尤其值得关注,这意味着商用没有限制。

不过也有隐忧。GLM-5.3-Flash 的 320B 参数意味着即使是 Q4 量化也需要超过 256GB 显存,个人用户很难跑起来。Qwen3.8-Flash-Next 的 6B 激活参数更友好,但其 N-gram 嵌入层(51B)需要额外的内存支持。

开源模型的迭代速度在加快。从 Qwen3.5 到 Qwen3.8 只用了不到一年,GLM 系列也在快速追赶。这个节奏意味着,任何基于特定模型的工具和工作流都可能需要频繁更新。