DeepSeek V4 Flash 0731 ARC-AGI 成绩公开:89% 通过 ARC-AGI-1,61.4% 通过 ARC-AGI-2

8 月 7 日,ARC Prize 在官网公布了 DeepSeek V4 Flash 0731 的 ARC-AGI 验证成绩。帖子当天在 Hacker News 冲到 763 分,评论区关注点集中在价格上:这个分数是用每任务两美分到四美分换来的。

ARC-AGI 成绩单

在 ARC Prize 的 Semi-Private 测试集上,max effort 推理档位的成绩:

测试集通过率单任务成本
ARC-AGI-189.0%$0.02(约合 ¥0.15)
ARC-AGI-261.4%$0.04(约合 ¥0.29)

模型按推理强度分 Max、High、Low 三档。Max 档在 ARC-AGI-1 上 89.0%、ARC-AGI-2 上 61.4%;High 档分别降到 87.0% 和 56.0%;Low 档是 84.0% 和 46.0%。推理预算压缩一半,分数只掉几个点。

ARC-AGI-2 比第一代难不少,多数模型在这里的得分都很难看。61.4% 的成绩把 V4 Flash 放到了和 GPT-5.6 Luna 相近的位置。HN 上有人直接对比:"结果和 GPT-5.6 Luna 相当,但更便宜",还有人说每任务成本比 Luna 便宜约两倍。一条获赞很多的评论算了一笔账:一个月前 Kimi K3 还是大家讨论的焦点,现在同样的性能只要它 1/20 的价格。

0731 更新了什么

DeepSeek 在 7 月 31 日把 V4 Flash 的 0731 版本 API 推进 public beta,调用方式不变,模型名仍是 deepseek-v4-flash。官方 changelog 写明:0731 与 Preview 版同架构、同参数量,只重新做了 post-training,侧重点在 agent 能力上。

官方公布的 agent benchmark 成绩:

基准分数
Terminal Bench 2.182.7
NL2Repo54.2
Cybergym76.7
DeepSWE54.4
Toolathlon (verified)70.3
Agent Last Exam25.2
Automation Bench (Public)25.1
DSBench-FullStack68.7
DSBench-Hard59.6

官方称这些成绩"远超 V4-Pro-Preview"。模型原生支持 Responses API,做了 Codex 适配,开源权重同步发布在 Hugging Face。

定价与使用

API 定价:输入 $0.14/百万 token(约合 ¥1.02),输出 $0.28/百万 token(约合 ¥2.04),上下文 1049K。权重开源后,304B 参数的检查点可以完整塞进单张 AMD MI300X(192GB HBM),不量化不卸载,单流解码约 168 tok/s,此前已有开发者验证过。

8 月 6 日,DeepSeek 在平台公告里提示:"近期将整体上调 API 价格,涨幅会比较大,具体方案以官方通知为准。"社区讨论里,多数人猜测涨价会落在 cache 命中价格上,也有人认为是 V4 Pro 正式版发布的前兆。趁着现在价格还没动,把用量提前规划好,或者干脆自托管开源权重,是两种常见的应对方式。

一点看法

DeepSeek 这轮把"能力"和"成本"绑得更紧了。ARC-AGI-2 上 61.4% 的通过率配 $0.04 的单任务成本,让"便宜模型只能跑跑简单任务"的说法站不住脚。接下来值得盯两件事:V4 Pro 正式版什么时候发,涨价之后这个价格优势还能维持多久。