DeepSeek V4 Flash 0731 ARC-AGI 成绩公开:89% 通过 ARC-AGI-1,61.4% 通过 ARC-AGI-2
8 月 7 日,ARC Prize 在官网公布了 DeepSeek V4 Flash 0731 的 ARC-AGI 验证成绩。帖子当天在 Hacker News 冲到 763 分,评论区关注点集中在价格上:这个分数是用每任务两美分到四美分换来的。
ARC-AGI 成绩单
在 ARC Prize 的 Semi-Private 测试集上,max effort 推理档位的成绩:
| 测试集 | 通过率 | 单任务成本 |
|---|---|---|
| ARC-AGI-1 | 89.0% | $0.02(约合 ¥0.15) |
| ARC-AGI-2 | 61.4% | $0.04(约合 ¥0.29) |
模型按推理强度分 Max、High、Low 三档。Max 档在 ARC-AGI-1 上 89.0%、ARC-AGI-2 上 61.4%;High 档分别降到 87.0% 和 56.0%;Low 档是 84.0% 和 46.0%。推理预算压缩一半,分数只掉几个点。
ARC-AGI-2 比第一代难不少,多数模型在这里的得分都很难看。61.4% 的成绩把 V4 Flash 放到了和 GPT-5.6 Luna 相近的位置。HN 上有人直接对比:"结果和 GPT-5.6 Luna 相当,但更便宜",还有人说每任务成本比 Luna 便宜约两倍。一条获赞很多的评论算了一笔账:一个月前 Kimi K3 还是大家讨论的焦点,现在同样的性能只要它 1/20 的价格。
0731 更新了什么
DeepSeek 在 7 月 31 日把 V4 Flash 的 0731 版本 API 推进 public beta,调用方式不变,模型名仍是 deepseek-v4-flash。官方 changelog 写明:0731 与 Preview 版同架构、同参数量,只重新做了 post-training,侧重点在 agent 能力上。
官方公布的 agent benchmark 成绩:
| 基准 | 分数 |
|---|---|
| Terminal Bench 2.1 | 82.7 |
| NL2Repo | 54.2 |
| Cybergym | 76.7 |
| DeepSWE | 54.4 |
| Toolathlon (verified) | 70.3 |
| Agent Last Exam | 25.2 |
| Automation Bench (Public) | 25.1 |
| DSBench-FullStack | 68.7 |
| DSBench-Hard | 59.6 |
官方称这些成绩"远超 V4-Pro-Preview"。模型原生支持 Responses API,做了 Codex 适配,开源权重同步发布在 Hugging Face。
定价与使用
API 定价:输入 $0.14/百万 token(约合 ¥1.02),输出 $0.28/百万 token(约合 ¥2.04),上下文 1049K。权重开源后,304B 参数的检查点可以完整塞进单张 AMD MI300X(192GB HBM),不量化不卸载,单流解码约 168 tok/s,此前已有开发者验证过。
8 月 6 日,DeepSeek 在平台公告里提示:"近期将整体上调 API 价格,涨幅会比较大,具体方案以官方通知为准。"社区讨论里,多数人猜测涨价会落在 cache 命中价格上,也有人认为是 V4 Pro 正式版发布的前兆。趁着现在价格还没动,把用量提前规划好,或者干脆自托管开源权重,是两种常见的应对方式。
一点看法
DeepSeek 这轮把"能力"和"成本"绑得更紧了。ARC-AGI-2 上 61.4% 的通过率配 $0.04 的单任务成本,让"便宜模型只能跑跑简单任务"的说法站不住脚。接下来值得盯两件事:V4 Pro 正式版什么时候发,涨价之后这个价格优势还能维持多久。





