DeepSeek V4 Flash 0731:把 agent 能力又往上顶了一截

7 月 31 日,DeepSeek 在官方更新日志里宣布 DeepSeek-V4-Flash API 进入公开测试。模型名不变,还是 deepseek-v4-flash,调用方式也没变。

这次的 0731 版本和之前的 Preview 架构、规模完全相同,只做了重新后训练。但能力提升幅度不小。官方给出的一组 agent 基准里,Terminal Bench 2.1 从 56.9 涨到 82.7,Toolathlon verified 从 51.8 涨到 70.3。其他几项:Cybergym 76.7、NL2Repo 54.2、DeepSWE 54.4、Agent Last Exam 25.2、DSBench-FullStack 68.7。

拿这些数字和 GPT-5.6 Terra 比:Terminal Bench 82.7 对 78.4,Toolathlon 70.3 对 53.1,DeepSWE 54.4 对 69.6。互有胜负,但一个 284B 总参数(13B 活跃)的 MoE 模型能和旗舰档比划,本身就说明问题。

HN 上这个帖子拿了 670 分,评论区普遍觉得被低估了。有人指出 V4-Flash-0731 跑在单张 B300 上没问题,本地推理的想象空间很大;也有人拿它和 GLM-5.2、Claude Opus 4.8 比,认为已经摸到那个量级。

价格没动:输入 $0.14/百万 token(缓存未命中)、输出 $0.28/百万 token(约合 ¥2/百万),缓存命中输入只要 $0.0028。上下文 1M,最大输出 384K。原生支持 Responses API,官方专门做了 Codex 适配。

官方说 V4-Pro 的正式版也会很快跟进。这次升级只影响 Flash API,App 和网页端的 V4-Pro 不受影响。

MiniMax H3:视频模型开始讲全模态了

同一天,MiniMax 发布了 H3,官方定位是「通用全模态生成模型」。它能同时理解文本、图像、视频、音频四种输入,生成最高 2K 分辨率、15 秒长、带原生立体声的视频。

和 Hailuo 01/02 那种按任务拆模型的路线不同,H3 把文生图、文生视频、文生音频以及各类参考和编辑任务统一进了一个模型。官方博客给了一个例子:输入「参考视频 1 的希区柯克式运镜、让图 2 里的人物唱歌、人声匹配音频 3」,H3 直接理解多模态上下文并生成对应视频。准确的文字和品牌呈现、V2V 动作迁移,是它强调的强项。

定价上,官方说法是 2K 分辨率下每秒价格不到主流模型的 1/3,768p 下不到主流 720p 的一半。技术层面,H3 重做了 tokenizer(H3-VAE),有效序列长度提升 4 倍;2K 输出靠的是「In-Context Regeneration」——让模型基于原有多模态上下文把自己的低分辨率输出重新生成一遍,而不是外挂超分模块。

更值得注意的一条:MiniMax 计划在数天内开源 H3 权重,前提是符合法律法规。视频生成领域一直以闭源为主,如果权重真放出来,这个生态会热闹不少。

简评

一天两个发布,方向不一样。DeepSeek 在把 agent 能力做深,价格压得死死的;MiniMax 在把视频生成往全模态和开源方向推。共同点是中国厂商在能力追近的同时,继续在价格和开放性上施加压力。