事件概述

2026 年 8 月 25 日,OpenAI 在官方新闻中公布了其首款自研推理芯片 Jalapeño 的初步测试结果。结果显示,该芯片在 AI 推理任务中实现了行业领先的速度与能效:在同等功耗下可以完成更多 AI 工作,同时响应延迟更低。Jalapeño 以单一架构同时实现了高吞吐量和低延迟,而现有硬件系统通常需要在两者之间做出取舍。

OpenAI 表示,Jalapeño 的成果将帮助客户获得更快的响应、更灵敏的 Agent,以及在高需求下更可靠的服务。其使命是让 AGI 惠及全人类,而这些性能提升将有助于让日益强大的 AI 变得更加可负担和普及。

关键技术点

性能测试方式:以“匹配用户体验”为基准

OpenAI 采用了一种以匹配用户体验为核心的评估方法:在满足客户和交互式 Agent 所要求的延迟条件下,测量每个系统每单位功耗能够完成多少有用的 AI 工作。这种方式对 Agent 尤为重要,因为 Agent 需要顺序执行多个步骤,任何延迟都会在整个任务中被放大。

测试使用 SemiAnalysis 的公开基准 InferenceX,对不同负载场景(从高吞吐服务到高交互、低延迟使用)进行了比较。OpenAI 认为,更有用的性能标准是每单位功耗的性能,而非单芯片的绝对性能。

核心测试结果

  • 在 GPT‑OSS 120B、DeepSeek R1 670B(原文中也有提及 1T 版本,测试模型为 670B)和 Kimi K2.5 1T 三个公开模型上,Jalapeño 均展现出更优的每瓦性能与延迟组合,处于 Pareto 前沿。
  • 相比对比系统,Jalapeño 在峰值吞吐下每瓦特可完成的 AI 工作量为后者的 1.5 到 1.9 倍。
  • 端到端延迟降低了 1.7 到 3.6 倍。
  • 对高度交互的工作负载,性能(原文为“higher performance”,未明确具体指标)为对比系统的 2.1 到 4.1 倍。
  • 在最大的公开测试模型 Kimi K2.5 1T 上,Jalapeño 的峰值每瓦性能约为对比系统的 1.5 倍,端到端延迟降低了 3.4 倍。

芯片设计与功耗数据

Jalapeño 的额定功耗为 700 瓦,但在测试负载中实测持续功耗保持在 550 瓦或以下(原文未说明具体测试条件)。

架构设计:为真实语言模型负载而生的全栈协同设计

Jalapeño 从设计之初就围绕一个核心问题展开:如果硬件的主要任务是服务现代和未来的语言模型,尤其是交互式 Agent,那么应该构建什么样的硬件?

语言模型推理包含多个不同瓶颈的阶段:

  • Prefill(预填充):处理提示词,属于计算密集型。
  • Decode(解码):逐 token 生成响应,受内存带宽限制。
  • 通信:数据在核间和芯片间移动时会产生额外延迟,造成计算单元空等。

Jalapeño 的设计目标是最小化数据移动和通信延迟。模型状态(包括 KV 缓存)可以显式放置并保持本地化,系统根据不同推理阶段动态调度计算、内存和网络资源。其大型网络域使整个工作负载可以保持在一个互联系统中,减少数据移动,确保请求从开始到结束都保持快速高效。

这种设计造就了一个“平衡且可通用”(原文为 “balanced and fungible”)的加速器,既能适应不断变化的模型架构,也能同时优化 prefill 和 decode,并随 agentic 工作负载的相位变化动态调整。

AI 辅助芯片设计与编程

AI 在 Jalapeño 的开发中扮演了直接角色:

  • 团队从初始设计到 tapeout(流片)仅用了 9 个月,AI 帮助探索实现方案、缩短设计验证循环,并基于模型负载持续迭代。
  • AI 帮助优化了芯片的算术电路,使团队能够在计划内塞入更多计算性能。
  • Jalapeño 被设计为对人和 AI 都清晰的编程目标:工程师通过本地张量、显式通信和可预测同步来描述工作,AI 则负责优化映射、放置、调度和协调。

为了验证灵活性,团队使用 Codex 配合 GPT‑Astra,在 两个月内 将三个不在原始生产计划中的开源模型调优到高性能。这表明了架构的灵活性和 AI 辅助编程的速度。

在选定的 GPT‑OSS attention 和 mixture-of-experts 模块上,AI 生成的实现比现有的人类专家实现快 1.5 到 1.8 倍。原文明确说明这些数据仅适用于选定模块而非完整模型,但指向了一个强大的新开发循环。

对数据科学和 AI Agent 落地的意义

Jalapeño 的发布对 AI 推理基础设施具有标志性意义:

  1. 降低推理成本:更高的每瓦性能意味着在相同功耗下可以服务更多请求,直接降低每次成功交付的成本。这有助于 AI 服务更广泛地普及。
  2. 改善 Agent 体验:Agent 任务通常需要串行完成多个步骤,延迟会累积放大。Jalapeño 显著降低端到端延迟,使得交互式 Agent 的响应更快、更流畅,有利于 Agent 在真实业务场景中的大规模部署。
  3. 全栈协同优化范式:OpenAI 可以从模型、产品、服务软件、芯片、内存、网络和系统层面协同设计,利用真实工作负载反馈改进每一层。这种“芯片为模型而生、模型为芯片而调”的闭环,可能成为 AI 基础设施的新方向。
  4. AI 设计芯片、芯片服务 AI:Jalapeño 展示了 AI 辅助硬件设计的可行性,以及为 AI 设计的可预测编程模型如何降低并行编程门槛。这对未来专用 AI 硬件的发展有重要启示。

我的技术点评

Jalapeño 的亮点不在于单点指标的绝对领先,而在于它同时改善了吞吐量、能效和延迟这三个通常互斥的目标。从数据科学角度看,推理成本是 AI 规模化落地的关键瓶颈之一。Jalapeño 通过“每瓦有用工作”这个更务实的指标来引导设计,说明 OpenAI 真正在关注业务层面的杠杆效应。

值得注意的是,OpenAI 刻意选择了公开模型(GPT‑OSS、DeepSeek、Kimi)作为测试对象,这有助于外部验证和横向对比。不过,文中提到“内部测试中,Jalapeño 在 OpenAI 前沿模型上的优势更大”,这一数据未公开细节,需要谨慎看待。

另一个有趣的点是 AI 辅助芯片开发:9 个月流片、AI 生成 kernel 超过人类专家版,这些都预示着硬件设计/软件适配的范式正在被 AI 重塑。当然,文中也坦诚地说明了某些性能提升只针对特定模块,并没有夸大整体效果,这种透明度值得赞赏。

最后,Jalapeño 额定 700W、实测 550W 的情况值得关注:这是否意味着存在更大的超频空间,或者仅表明片内设计余量较大?原文未说明,期待后续的深度评测。

总体而言,Jalapeño 是一个扎实的全栈工程成果,其架构思路对 AI 推理芯片设计有很强的参考价值。随着它后续的规模部署,我们可能会看到 AI 服务成本进一步下降,Agent 的实时响应能力迈上一个新台阶。

原文链接

📄 Jalapeño’s first results show industry-leading speed and efficiency in AI inference