DeepSeek V4 Flash 单卡跑通 AMD MI300X:304B 参数无需量化
8 月 4 日,开发者 ryanzhou 在 GitHub 开源了把 DeepSeek-V4-Flash-0731 完整部署到单张 AMD MI300X 上的配置与补丁集合,帖子当天在 Hacker News 冲到 365 分。这个 304B 参数的检查点不量化、不卸载权重,直接装进一张卡的 192GB HBM 里跑生产。
一张卡装下 304B
MI300X 有 192GB HBM3 和 5.3TB/s 显存带宽,容量是 H100 SXM5 的 2.4 倍,清单价大约只有后者一半。模型权重占 156.67 GiB HBM,剩余空间还能放 20GB 的 GPU KV 池和 96GiB 的 CPU 层,用于存放被逐出的前缀缓存条目。一张卡能扛 2-8 路常规并发流,突发 64 路也不会 OOM。
实测性能
作者给出的数据来自固定的 vLLM ROCm nightly 版本(0.26.1rc1.dev229 + AITER 0.1.19):
- 单流解码中位数 168.6 tok/s
- 8 路并发聚合 542 tok/s(单流中位 90.3 tok/s)
- 64 路突发聚合 830 tok/s,无 OOM、无引擎错误
- 调优内核后预填充约 7.9-8.5K tok/s
- 上下文实测 256K,架构本身支持 1M
补丁修了什么
官方 vLLM 配方主要面向 NVIDIA 和新款 AMD 硬件,MI300X 上要跑稳得修几处:FP8 格式差异(MI300X 的 CDNA3 实现 AMD/Graphcore 的 fnuz 变体 E4M3,MI325X 及更新型号用 OCP 标准 FP8,按 OCP 语义写的内核在 scale 域会差两倍)、高并发下的 MoE 路由、sparse MLA 解码的 HIP-graph 竞态、CPU-KV 同步,以及若干未调优的 kernel shape。仓库把这些修复整理成对上游的 reference diffs,并固定了版本。
这个项目的前置工作来自 Fergus Finn 的 MI300X worklog 和 Doubleword 的配套仓库(HN 上 120 分),后者先发现了 FP8 不兼容和 AITER fast path 缺失等问题。
背景
DeepSeek-V4-Flash-0731 是 DeepSeek 7 月 31 日更新的 Flash 系列检查点,HuggingFace 上已有约 43 万下载。单卡 192GB 显存跑 304B 模型的意义在于把这类大模型的推理成本从多卡集群拉低到单卡级别,对自建推理和边缘部署是实际可用的选项。




