短短9个月,OpenAI自研ASIC芯片已超越英伟达Blackwell?
- 核心观点:OpenAI首颗自研AI推理芯片Jalapeño实测性能超越英伟达Blackwell及Rubin,其革命性在于使用AI工具辅助设计,将流片周期压缩至16个月,标志着AI重塑芯片设计范式并对CUDA生态构成实质性挑战。
- 关键要素:
- 【性能碾压】在GPT-OSS 120B模型上,Jalapeño每秒输出1459个Token,是GB200(535个)的2.7倍;端到端延迟1.65秒,较GB300的6秒快3.6倍;每瓦性能击败此前测试过的所有英伟达、AMD及谷歌芯片。
- 【能效优势】每兆瓦每秒输出Token数达5300万,是GB200 NVL72(1000万)的5倍以上;每芯片每小时总拥有成本约1.56美元,与H100持平,而英伟达Vera Rubin高达3.61美元。
- 【AI设计飞轮】GPT-Astra与Codex深度参与研发,使SIMD单元面积缩减8%、矩阵引擎面积缩减10%;AI生成内核代码在注意力机制和MoE模块上比人类工程师快1.5至1.8倍。
- 【架构创新】采用HBM4内存实现15.4TB/s带宽,每瓦HBM带宽22(英伟达Rubin为11.1);计算核心与HBM切片直接绑定并采用乱序执行核心,消除固定延迟。
- 【颠覆性结论】SemiAnalysis指出CUDA护城河可能已死——Rubin流片早于Jalapeño却未开放第三方测试,反映软件成熟度差距;OpenAI两周内将吞吐量提升超2倍,8天内将张量并行从TP8扩展至TP32。
- 【保留意见】测试模型非前沿模型(未完成AgentX多轮长上下文测试);公平对比对象应为同用HBM4的Vera Rubin而非Blackwell;Jalapeño仍处工程样片阶段,量产要到2027年爬坡。
- 【战略版图】B0步进已入厂,每瓦性能再提升25%;OpenAI与Broadcom签署10GW定制加速器协议(相当于十座核电机组满发功率),下一里程碑为100MW部署规模。
原文作者:董静
原文來源:華爾街見聞
OpenAI 首顆自研晶片 Jalapeño 橫空出世,以令人咋舌的速度顛覆了 AI 晶片行業的既有格局——這不僅是一次產品發佈,更是一個訊號:AI 正在重塑晶片本身的設計方式。
據華爾街見聞文章報導,據彭博 8 月 25 日報導,OpenAI 表示,Jalapeño 在單位功耗可處理的 AI 工作量和響應速度兩項關鍵指標上均領先英偉達 GB300。該晶片由 OpenAI 與 Broadcom 合作開發,專為 AI 推理階段設計,最快將於今年晚些時候投入實際使用。OpenAI 晶片負責人 Richard Ho 表示,Jalapeño 在 700 瓦低功耗下即可實現強勁性能,有助於大幅降低數據中心電力成本。

據半導體研究機構 SemiAnalysis 披露,這顆晶片從設計啟動到完成流片僅歷時約 16 個月,而其中關鍵的 CoWoS 封裝流片節點完成於 2025 年 11 月,距今不過 9 個月,遠低於行業慣常的 18 至 36 個月週期。

SemiAnalysis 研究人員親赴 OpenAI 實驗室,使用其自研基準測試套件 InferenceX 對 Jalapeño 進行了實測,結論直接:該晶片在每瓦性能(perf/W)指標上擊敗了他們此前測試過的所有英偉達、AMD 及谷歌晶片。
更值得關注的是,這一成績是在 Jalapeño 尚未啟用投機解碼、未做預填充與解碼分離部署等優化手段的情況下取得的,而參與對比的其他晶片均已開啟各自最優配置。
難怪就連著名半導體分析師 Dylan Patel 也直言,「被掀翻的不只是 Blackwell,就連英偉達 Rubin 晶片也被超越了」!

分析認為,這一結果對英偉達的市場地位構成直接挑戰,也令市場重新審視 AI 晶片競爭格局。
實測數據:Jalapeño 在多項關鍵指標上碾壓 Blackwell
SemiAnalysis 的測試結果顯示,Jalapeño 在推理效率上的優勢相當顯著。
在GPT-OSS 120B 模型上,Jalapeño 每秒可輸出約 1459 個 Token,而英偉達 GB200 僅為 535 個;端到端延遲方面,Jalapeño 完成一個任務僅需 1.65 秒,GB300 則需接近 6 秒,差距達 3.6 倍。在高交互場景下,當 GB300 被推至其最快解碼速度(每秒 169 個 Token)時,Jalapeño 的吞吐量是其 104.3 倍。

在每兆瓦每秒輸出 Token 數這一衡量數據中心能效的核心指標上,Jalapeño 在GPT-OSS 模型上達到約 5300 萬個 Token/MW/s,而 GB200 NVL72 僅約 1000 萬。

SemiAnalysis 指出,這一指標本質上等同於每焦耳產出的 Token 數,直接決定了數據中心的收入天花板——在算力受電力約束的當下,這一維度的優勢尤為關鍵。
從系統級成本來看,據 SemiAnalysis 將供電、散熱、網路全部納入計算後,Jalapeño 每晶片每小時總擁有成本約為 1.56 美元,與 H100 的 1.55 美元幾乎持平,而英偉達 Vera Rubin 則高達 3.61 美元。

值得注意的是,SemiAnalysis 同時提出了若干重要保留意見。
其一,測試所用模型並非當前最前沿的模型,英偉達和 AMD 已在更大規模模型(如 DeepSeek V4 Pro、Kimi K3)上發佈了基於 AgentX 套件的成績,而 Jalapeño 尚未完成 AgentX 測試——該套件更能反映多輪、長上下文等真實生產場景的性能表現。
其二,更公平的比較對象應是同樣採用 HBM4 的英偉達 Vera Rubin,而非 Blackwell;Vera Rubin 的每瓦性能較 GB200 NVL72 提升約 5.4 倍,與 Jalapeño 相比,兩者在每 Token 總擁有成本(TCO)上幾乎持平。
其三,Jalapeño 目前仍處於工程樣片階段,量產預計要到 2027 年才逐步爬坡。
AI 設計晶片:GPT-Astra 與 Codex 的「飛輪效應」
Jalapeño 之所以能以如此驚人的速度完成開發,AI 工具的深度介入是核心原因之一。據 SemiAnalysis 披露,OpenAI 在晶片設計過程中大量使用了內部 AI 模型,其中包括被外界廣泛關注的 GPT-Astra。
社交平台 X 用戶 Andrew Curran 援引 OpenAI 資訊指出,GPT-Astra 深度參與了 Jalapeño 的研發全程:
「團隊借助 Codex 與 GPT-Astra,在兩個月內將三個原本不在 Jalapeño 量產計劃內的开源模型調優至高性能狀態。」

這意味著,AI 不僅在加速晶片設計本身,還在快速擴展晶片所能支援的模型範圍。
SemiAnalysis 的數據進一步量化了這一貢獻:
AI 輔助設計使 SIMD 單元面積縮減 8%,矩陣引擎面積縮減 10%,同時在時序和功耗表現上均優於初始版本。

在軟體層面,OpenAI 使用內部擴展版 Codex 編寫 Jalapeño 內核,部分內核代碼長達約 3000 行;在最吃性能的注意力機制和 MoE 模組上,AI 生成的代碼比人類頂尖工程師的實現快出 1.5 至 1.8 倍。
SemiAnalysis 對此評價頗為犀利:跑在英偉達 GPU 上的 OpenAI 模型(如 GPT-5.6 Sol),正被用來設計一顆對 CUDA 護城河構成真實威脅的晶片——「英偉達自己的 GPU 正在實時催生自己潛在的接班人」。

架構解析:為何「通用」反而更快?
外界普遍預設 Jalapeño 是一顆專為 OpenAI 自家模型深度定製的晶片,但 SemiAnalysis 的結論恰恰相反:Jalapeño 是一顆面向 AI 推理的通用晶片,能夠運行各類模型和工作負載,甚至包括用 Codex 移植的《毀滅戰士》遊戲。
在架構層面,Jalapeño 的核心設計哲學是「消除固定延遲」。與 GPU 依賴複雜記憶體層級不同,Jalapeño 將計算核心與 HBM 切片直接綁定,核心間透過專用高頻寬集合網路同步,大幅降低了記憶體訪問延遲。
此外,Jalapeño 採用亂序執行(OoO)核心搭配 L1 快取,而非其他加速器普遍使用的軟體管理暫存器,這使其在小批量、低延遲場景下能夠更接近硬體理論峰值。
在記憶體頻寬方面,Jalapeño 採用 HBM4,實現了 15.4TB/s 的單封裝記憶體頻寬,每瓦 HBM 頻寬達 22,而英偉達 Rubin 為 11.1,GB300 僅為 5.71。

SemiAnalysis 指出,Jalapeño 的 HBM4 引腳速度達 10Gbps,略高於英偉達 Rubin 的 9.6Gbps,HBM 供應商可能為三星。
值得一提的是,Jalapeño 選擇不做預填充與解碼分離部署(PDD)。SemiAnalysis 對此給出了詳細解釋:
在真實生產環境中,輸入輸出比例、並發量、快取命中率等參數持續變化,固定分池會導致全局利用率下降;而同構資源池可以靈活響應流量變化,在延遲敏感型請求和高吞吐批次處理之間動態調配。
CUDA 護城河:裂縫已現?
SemiAnalysis 在報告中拋出了一個頗具分量的判斷:CUDA 的護城河可能已經死了。
其依據在於軟體起步速度的對比。英偉達 Rubin 的 CoWoS 流片比 Jalapeño 早一個月完成,但迄今為止,外界能看到的 Rubin 公開基準數據僅來自 CoreWeave 的工程樣片,英偉達並未像 OpenAI 那樣開放第三方進入實驗室自由測試。SemiAnalysis 認為,這反映的不是硬體本身的差距,而是軟體成熟度的差距。
從零開始構建軟體棧,反而讓 OpenAI 得以擺脫歷史包袱,做出更乾淨的架構決策。OpenAI 使用自研內核程式語言 Gluon(基於 Triton 構建)以及內部推理引擎「Teacup」,並借助 Codex 快速完成內核調優。SemiAnalysis 觀察到,在不到兩週的時間內,Jalapeño 在特定交互速度下的吞吐量提升超過 2 倍;在 8 天內,團隊將張量並行從 TP8 擴展至 TP32,實現了跨機架的全機櫃規模部署。
不過,SemiAnalysis 也明確指出,目前的測試僅覆蓋 8k1k 這一相對簡單的工作負載,尚未完成 AgentX 多輪長上下文測試。在更複雜的智慧體工作負載下,路由器、前綴快取等元件的表現將成為新的考驗。
下一步:B0 已入廠,10GW 版圖徐徐展開
Jalapeño 的故事遠未結束。
據 SemiAnalysis 披露,目前公開測試所用的均為 A0 步進樣片,而 B0 步進已進入晶圓廠,預計在每瓦性能上較 A0 再提升約 25%——B0 單顆計算 die 的 MXFP4 算力將達 13.4 PFLOPs,TDP 維持在 700W。
在系統層面,OpenAI 與 Celestica 合作設計了完整的機架方案:每個 ASIC 機櫃包含 128 顆 Jalapeño 晶片,雙機櫃系統總功耗約 160kW,與英偉達 GB300 雙寬機櫃相當。

規模化部署方面,單一擴展網路域最多可連接 2048 顆 Jalapeño XPU,覆蓋 16 個機架。量產方面,SemiAnalysis 預計將於 2027 年逐步爬坡,下一個里程碑目標是 100MW 部署規模。
更大的戰略圖景是,OpenAI 與 Broadcom 已簽署 10GW 定製加速器合作協議,這一量級大致相當於十座核電機組的滿發功率。
華爾街見聞文章寫道,OpenAI 晶片負責人 Richard Ho 表示,公司已達到能夠切實降低基礎設施成本的功耗和成本水平,「這只是第一步」。他同時強調,英偉達仍是重要合作夥伴,OpenAI 對算力的需求極為龐大,短期內不會放棄現有供應商。
分析人士指出,Jalapeño 的意義或許不在於它今天能替代多少英偉達晶片,而在於它證明了一件此前被普遍質疑的事:一家 AI 公司,用 AI 工具,在創紀錄的時間內,造出了一顆真正具備競爭力的晶片。這個飛輪,已經開始轉動。


