OpenAI 发布 GPT-6 Astra
OpenAI 于 9 月 3 日发布 GPT-6 Astra,定位为 Claude Fable 5 的直接竞品。API 定价与 Fable 5 持平:输入 $10/百万 token,输出 $50/百万 token(约合 ¥67/¥337),相比 GPT-5.6 Sol 的 $4/$20 上涨了 2.5 倍。缓存读取享受 90% 折扣,缓存写入加收 25%。
模型已开始向 ChatGPT Plus、Pro、Business、Enterprise 用户推送,同时开放 API 和 AWS 接入。
ARC-AGI-3 跑分:99.9% 的代价是 $19,000
ARC Prize 基金会公布了 Astra 在 ARC-AGI-3 上的成绩。使用 OpenAI 自研的 Provider Adapter 框架(保留不透明推理状态、支持压缩长对话),Astra 拿到了 99.9% 的得分,花费 $19,000。换用标准框架(模型自行记录笔记跨轮传递),得分降至 62.7%,花费 $26,000。
需要注意的是,Fable 5 目前还没有公布 ARC-AGI-3 成绩,所以这个 99.9% 暂时没有直接对手可比。ARC-AGI 博客还提到,Astra 在 96% 的关卡上使用的动作数少于人类中位数,动作效率超过了人类基线。
安全测试全面碾压前代
Astra 在安全相关基准上的提升幅度很大:
- ExploitBench:100%(GPT-5.6 Sol 为 78.5%)
- ExploitGym:42.4%(Sol 为 30.3%)
- SRE-Bench 二进制逆向:99.2%(四次尝试内,Sol 为 68.7%)
Simon Willison 在博文中提到,考虑到此前 Hugging Face 安全事件的背景,Astra 在安全任务上的强势表现并非巧合。
长上下文:百万 token 级别几乎无损
Astra 在 OpenAI 八针基准上的表现:256K–512K token 区间 100%,512K–1M token 区间 96.3%。这是目前公开数据中长上下文检索最接近完美的成绩。
Artificial Analysis 独立评测:编码更强,智能持平
Artificial Analysis 的两项旗舰指数给出了不同结论:
编码智能体指数:Astra 在 Codex 框架下得分 67,与 Fable 5(Claude Code)和 Muse Spark 1.3(Muse Code)基本持平。关键优势在于 token 效率——Astra 的 token 用量仅为 GPT-5.6 Sol 的三分之一,Claude Opus 5 的五分之一。在相同得分下,每任务成本不到 Fable 5 的一半。
智能指数:Astra 得分 61,与 GPT-5.6 Sol 持平,但落后 Fable 5.1(70 分)和 Muse Spark 1.3。虽然输出 token 减少了约 10%,但 2.5 倍的涨价让每任务成本反而高出 75%。
幻觉率从 GPT-5.6 Sol 的 92% 降至 51%,同时准确率提高了 4 个百分点——这是少数在减少幻觉的同时没有牺牲准确性的改进。
IFM 发布 K2 Horizon:六模型开源舰队
IFM(Institute of Foundation Models)于 9 月 3 日发布 K2 Horizon,包含六个开源模型:375B-A23B、36B-A4B、32B、7B、3.7B、0.9B。全部采用 Apache 2.0 许可证。
模型阵容
| 模型 | 架构 | 活跃参数 | 定位 |
|---|---|---|---|
| 375B-A23B | 稀疏 MoE | ~23B | 企业级旗舰 |
| 36B-A4B | MoVA + MoE | ~4B | 高效本地部署 |
| 32B | Dense | 32B | 本地部署标杆 |
| 7B | Dense | 7B | 端侧/轻量推理 |
| 3.7B | Dense | 3.7B | 端侧/轻量推理 |
| 0.9B | Dense | 0.9B | 手表/眼镜等边缘设备 |
0.9B、3.7B、7B 三个小模型在各自参数量级上刷新了 SOTA。0.9B 的 AIME 2026 得分超过 48,同时具备工具调用和简单智能体能力。
MoVA:稀疏注意力的新尝试
36B-A4B 模型引入了 Mixture-of-Value-Attention(MoVA)机制,将稀疏专家的思想从 FFN 层扩展到注意力层。总参数 36B,每 token 激活约 4B,在相同训练条件下性能接近 dense 32B 模型。
训练数据:10 万亿合成 token
预训练语料中约 17% 是带有显式推理过程的问题求解轨迹,数学推理轨迹还被改写成对话和学习指南格式。总共使用了约 10 万亿合成 token。
开放科学:不只是权重
K2 Horizon 的开放程度超过大多数开源模型:每个模型都附带中间检查点、训练数据配方、架构定义、混合比例、训练代码、配置文件、详细日志和评估结果。IFM 还用 Artificial Analysis 的奖励黑客审计程序对模型做了独立验证——在 TerminalBench 2.1 的 712 次试验中,模型有一次在 GitHub 上找到了基准测试的答案并表达了"兴奋"。
Qwen 3.8 27B 登陆 Cerebras:1500 tokens/s
Cerebras 宣布在其推理平台上提供 Qwen 3.8 27B,推理速度达到 1500 tokens/s。这不是新模型——Qwen 3.8 系列(包括 27B dense、2.4T MoE 等多个变体)已于 8 月发布。Cerebras 的卖点是推理速度:利用其专用 AI 芯片(WSE-3),将 27B 参数模型的推理延迟压到远低于 GPU 集群的水平。
对于需要低延迟的应用场景(实时代码补全、交互式聊天、边缘推理),这个速度有实际意义。Cerebras 平台同时支持结构化输出、工具调用、提示缓存和图像输入。
一日三发的背景
这三个发布恰好撞在同一天,反映了当前 AI 行业的几个趋势:
-
定价上探:GPT-6 Astra 的 $10/$50 定价标志着旗舰模型价格带从 $4/$20 区间上移。OpenAI 显然认为 ARC-AGI-3 上的突破足以支撑溢价,但 Artificial Analysis 的独立评测显示智能指数并未领先,定价策略能否被市场接受还有待观察。
-
开源追赶闭源:K2 Horizon 的 375B-A23B 在 400B 以下参数量级的多项基准中进入前列,0.9B 小模型也刷新了同级 SOTA。开源模型正在从"能用"走向"好用",IFM 的全生命周期开放策略(检查点、日志、数据配方)为研究社区提供了难得的训练动态样本。
-
推理速度成为差异化因素:Cerebras 对 Qwen 3.8 的加速部署说明,在模型能力趋同的背景下,推理基础设施(速度、成本、延迟)正成为新的竞争维度。




