OpenAI Jalapeño:自研推理芯片亮相 Hot Chips

OpenAI 在 8 月 25 日的 Hot Chips 2026 大会上正式发布了自研推理芯片 Jalapeño。这款芯片与 Broadcom 联合开发,从团队组建到流片只用了 16 个月。

核心规格

项目数据
功耗700W(单芯片)
内存216GB HBM4
内存带宽15.4 TB/s
4-bit 算力13.4 PFLOPS
每机架芯片数128 枚
机架总算力1.7 EFLOPS(4-bit)
机架内存27.5TB HBM4
机架带宽近 2PB/s

性能实测

SemiAnalysis 的 InferenceX 基准测试结果显示:

值得注意的是,Jalapeño 没有用多 token 预测(MTP)优化,而对比的 Nvidia/AMD 芯片都开了 MTP。也就是说,在「裸跑」状态下 Jalapeño 已经赢了。

不是特化芯片,是通用推理平台

外界普遍认为 OpenAI 的芯片只跑自家模型,但 SemiAnalysis 实测后纠正了这个说法。Jalapeño 是一款通用推理芯片,能运行各类模型和负载。OpenAI 甚至用 Codex 把 Doom 移植到了 Jalapeño 上作为演示。

芯片采用 HBM4 显存,规格与 Nvidia/AMD 旗舰 GPU 相当。OpenAI 硬件副总裁 Richard Ho 表示,设计目标是最小化数据搬运,把 KV cache 等模型状态尽量留在片上。

时间线与定位

OpenAI 明确表示 Jalapeño 不会取代 Nvidia 和 AMD——训练仍然需要 GPU 的可编程性。Jalapeño 只做推理,和 Nvidia/AMD 的训练+推理混合芯片走不同的路。

Qwen 3.8-Flash-Next:Qwen4 架构预览

阿里通义团队在 HuggingFace 上架了 Qwen3.8-Flash-Next 的模型页面,标注为「Upcoming release」。截至发稿,已有 1532 人点击了「等待发布」按钮。

已知参数

125B 总参数、6B 激活,这个比例说明 MoE 路由做得相当激进。对比同系列的 Qwen3.8-2.4T-A95B(2.4T 总参数、95B 激活),Flash-Next 用少得多的激活参数追求更快的推理速度。

Qwen3.8 系列当前表现

已在 8 月 13 日开源的 Qwen3.8-2.4T-A95B 在多项基准测试中表现突出:

基准Qwen3.8-MaxOpus 4.8Fable 5GPT 5.6 Sol
PaperBench93.080.388.890.5
Terminal Bench 2.186.684.684.688.8
SWE-bench Pro67.769.280.064.6
FrontierSWE73.570.088.8--
Agents' Last Exam52.445.1--53.6

Qwen3.8-Max 在 PaperBench(93.0)和 Agents' Last Exam(52.4)上接近或超过 GPT 5.6 Sol。但在 SWE-bench Pro(67.7 vs 80.0)和 FrontierSWE(73.5 vs 88.8)上和 Fable 5 有明显差距。

Flash-Next 作为更轻量的版本,能否在保持编码能力的同时大幅降低推理成本,是接下来几周最值得关注的问题。

影响

两件事指向同一个方向:AI 推理正在从「买 Nvidia 显卡」走向「自研芯片 + 高效模型架构」的组合。OpenAI 用 Jalapeño 证明自研推理芯片可以在能效比上赢过 Nvidia,阿里用 MoE 架构证明可以用 6% 的参数量完成大模型的工作。如果这两条路线都走通,推理成本下降的速度可能比多数人预期的更快。