OpenAI Jalapeño:自研推理芯片亮相 Hot Chips
OpenAI 在 8 月 25 日的 Hot Chips 2026 大会上正式发布了自研推理芯片 Jalapeño。这款芯片与 Broadcom 联合开发,从团队组建到流片只用了 16 个月。
核心规格
| 项目 | 数据 |
|---|---|
| 功耗 | 700W(单芯片) |
| 内存 | 216GB HBM4 |
| 内存带宽 | 15.4 TB/s |
| 4-bit 算力 | 13.4 PFLOPS |
| 每机架芯片数 | 128 枚 |
| 机架总算力 | 1.7 EFLOPS(4-bit) |
| 机架内存 | 27.5TB HBM4 |
| 机架带宽 | 近 2PB/s |
性能实测
SemiAnalysis 的 InferenceX 基准测试结果显示:
- 峰值吞吐量:比 Nvidia Blackwell(GB200/GB300 NVL72)高 1.5x 到 1.9x
- 端到端延迟:低 1.7x 到 3.6x
- 超低延迟场景:快 2.1x 到 4.1x
- 测试模型:GPT-OSS-120B、DeepSeek R1、Kimi K2.5
值得注意的是,Jalapeño 没有用多 token 预测(MTP)优化,而对比的 Nvidia/AMD 芯片都开了 MTP。也就是说,在「裸跑」状态下 Jalapeño 已经赢了。
不是特化芯片,是通用推理平台
外界普遍认为 OpenAI 的芯片只跑自家模型,但 SemiAnalysis 实测后纠正了这个说法。Jalapeño 是一款通用推理芯片,能运行各类模型和负载。OpenAI 甚至用 Codex 把 Doom 移植到了 Jalapeño 上作为演示。
芯片采用 HBM4 显存,规格与 Nvidia/AMD 旗舰 GPU 相当。OpenAI 硬件副总裁 Richard Ho 表示,设计目标是最小化数据搬运,把 KV cache 等模型状态尽量留在片上。
时间线与定位
- 2024 年中:启动芯片项目
- 2026 年 8 月:Hot Chips 首次公开
- 2026 年底:小批量出货
- 2027 年:量产
OpenAI 明确表示 Jalapeño 不会取代 Nvidia 和 AMD——训练仍然需要 GPU 的可编程性。Jalapeño 只做推理,和 Nvidia/AMD 的训练+推理混合芯片走不同的路。
Qwen 3.8-Flash-Next:Qwen4 架构预览
阿里通义团队在 HuggingFace 上架了 Qwen3.8-Flash-Next 的模型页面,标注为「Upcoming release」。截至发稿,已有 1532 人点击了「等待发布」按钮。
已知参数
- 总参数量:125B
- 激活参数量:6B(MoE 架构)
- 发布时间:预计 2026 年 8 月 26 日
- 定位:Qwen4 架构的技术预览
125B 总参数、6B 激活,这个比例说明 MoE 路由做得相当激进。对比同系列的 Qwen3.8-2.4T-A95B(2.4T 总参数、95B 激活),Flash-Next 用少得多的激活参数追求更快的推理速度。
Qwen3.8 系列当前表现
已在 8 月 13 日开源的 Qwen3.8-2.4T-A95B 在多项基准测试中表现突出:
| 基准 | Qwen3.8-Max | Opus 4.8 | Fable 5 | GPT 5.6 Sol |
|---|---|---|---|---|
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 |
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 |
| FrontierSWE | 73.5 | 70.0 | 88.8 | -- |
| Agents' Last Exam | 52.4 | 45.1 | -- | 53.6 |
Qwen3.8-Max 在 PaperBench(93.0)和 Agents' Last Exam(52.4)上接近或超过 GPT 5.6 Sol。但在 SWE-bench Pro(67.7 vs 80.0)和 FrontierSWE(73.5 vs 88.8)上和 Fable 5 有明显差距。
Flash-Next 作为更轻量的版本,能否在保持编码能力的同时大幅降低推理成本,是接下来几周最值得关注的问题。
影响
两件事指向同一个方向:AI 推理正在从「买 Nvidia 显卡」走向「自研芯片 + 高效模型架构」的组合。OpenAI 用 Jalapeño 证明自研推理芯片可以在能效比上赢过 Nvidia,阿里用 MoE 架构证明可以用 6% 的参数量完成大模型的工作。如果这两条路线都走通,推理成本下降的速度可能比多数人预期的更快。



