概述
8 月 26 日,两家中国 AI 公司几乎同时发布了重量级开源模型。智谱 AI(Z.ai)开源了 GLM-5.3-Flash,这是目前参数量最大的开源 MoE 模型之一;阿里巴巴通义团队同步发布了 Qwen3.8-Flash-Next,作为 Qwen4 架构的早期预览。两款模型都走 MoE 路线,都声称大幅降低训练成本,都在 Hacker News 上引发热议。
GLM-5.3-Flash:320B 参数,18B 激活
智谱 AI 在其官方博客宣布了 GLM-5.3-Flash。模型采用混合专家架构,总参数 320B,每个 token 激活 18B 参数。上下文窗口 1M tokens,支持文本和图像输入,文本输出。
性能与定价
Artificial Analysis 的评测显示,GLM-5.3-Flash 在智能指数上排名第 3(共 110 个模型),得分 57,远超同级别模型的中位数 28。速度方面,输出约 50 tokens/秒,略低于平均值 65。
API 定价相当有竞争力:
| 项目 | 价格 (USD) | 价格 (CNY) |
|---|---|---|
| 输入 | $0.15/1M tokens | ≈¥1.10/1M tokens |
| 输出 | $0.50/1M tokens | ≈¥3.65/1M tokens |
| 缓存输入 | $0.03/1M tokens | ≈¥0.22/1M tokens |
模型以 MIT 许可证开源,权重已上传至 HuggingFace(zai-org/GLM-5.3-Flash)。
Ox Alpha 之谜揭晓
这个模型其实有个更有趣的故事。8 月中旬,一个名为 Ox Alpha 的神秘模型出现在 OpenRouter 排行榜上,性能不俗但身份不明。安全研究员通过 prompt 注入提取了系统提示词,发现其被要求自称"未公开组织开发的 ox-alpha"。随后,gzip-NCD 压缩分析(一种基于文本压缩率的模型归类方法)将 Ox Alpha 与 GLM-5.3 的输出模式高度匹配。Bloomberg 的报道最终确认:Ox Alpha 就是 GLM-5.3-Flash。
HN 上的讨论提到,这个模型在 livebench.ai 上的表现不如 GPT-5.4 Nano,但在某些任务上又超越了它。有用户推测这是一个小模型在测试集上表现突出,但在真实场景中表现一般。
Qwen3.8-Flash-Next:Qwen4 架构预览
阿里巴巴通义团队几乎同一天发布了 Qwen3.8-Flash-Next。这不是常规的模型迭代,而是 Qwen4 架构的早期预览。官方将其比作 Qwen3-Next 对 Qwen3.5 的角色:先发布架构变更,让社区在完整 Qwen4 家族发布前先行检验。
架构创新
Qwen3.8-Flash-Next 在四个维度做了升级:
- 注意力机制:Gated DeltaNet(GDN)+ Qwen Sparse Attention(QSA)混合架构。GDN 压缩历史信息,QSA 用轻量级索引器在微块粒度选择重要上下文,降低长序列的注意力计算成本
- 残差连接:Gated Residual(GR)将残差流扩展为 4 个分支,用动态门控读写,增强跨层信息流动
- 嵌入层:N-gram Embedding 通过查表放大模型容量,额外计算开销很小
- 优化器:采用 Muon 优化器,在正交化精度、Muon 与 AdamW 的分工、融合参数拆分等方面做了优化
规模与性能
模型规模为 125B 主参数 + 51B N-gram 嵌入,每个 token 激活 6B 参数。官方称训练成本仅为 Qwen3.7-Plus 的 1/9,但在编码和办公任务上全面超越后者。
HN 上有评论指出这是"小模型以小搏大"的典型案例。Unsloth 已经发布了 GGUF 量化版本,方便本地部署。
两款模型的对比
| 项目 | GLM-5.3-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| 发布方 | 智谱 AI (Z.ai) | 阿里巴巴通义 |
| 总参数 | 320B | 125B + 51B 嵌入 |
| 激活参数 | 18B | 6B |
| 上下文窗口 | 1M tokens | 未明确公布 |
| 多模态 | 文本+图像输入 | 文本+图像输入 |
| 许可证 | MIT | 未明确 |
| 训练成本 | 未公布 | Qwen3.7-Plus 的 1/9 |
对开源生态的影响
这两款模型的发布让开源社区的 Pareto 前沿被中国公司主导。Artificial Analysis 的评论指出,开源模型的性能-成本曲线现在基本由中国模型定义。GLM-5.3-Flash 的 MIT 许可证尤其值得关注,这意味着商用没有限制。
不过也有隐忧。GLM-5.3-Flash 的 320B 参数意味着即使是 Q4 量化也需要超过 256GB 显存,个人用户很难跑起来。Qwen3.8-Flash-Next 的 6B 激活参数更友好,但其 N-gram 嵌入层(51B)需要额外的内存支持。
开源模型的迭代速度在加快。从 Qwen3.5 到 Qwen3.8 只用了不到一年,GLM 系列也在快速追赶。这个节奏意味着,任何基于特定模型的工具和工作流都可能需要频繁更新。




