短短9个月,OpenAI自研ASIC芯片已超越英伟达Blackwell?
- 核心观点:OpenAI首颗自研AI推理芯片Jalapeño实测性能超越英伟达Blackwell及Rubin,其革命性在于使用AI工具辅助设计,将流片周期压缩至16个月,标志着AI重塑芯片设计范式并对CUDA生态构成实质性挑战。
- 关键要素:
- 【性能碾压】在GPT-OSS 120B模型上,Jalapeño每秒输出1459个Token,是GB200(535个)的2.7倍;端到端延迟1.65秒,较GB300的6秒快3.6倍;每瓦性能击败此前测试过的所有英伟达、AMD及谷歌芯片。
- 【能效优势】每兆瓦每秒输出Token数达5300万,是GB200 NVL72(1000万)的5倍以上;每芯片每小时总拥有成本约1.56美元,与H100持平,而英伟达Vera Rubin高达3.61美元。
- 【AI设计飞轮】GPT-Astra与Codex深度参与研发,使SIMD单元面积缩减8%、矩阵引擎面积缩减10%;AI生成内核代码在注意力机制和MoE模块上比人类工程师快1.5至1.8倍。
- 【架构创新】采用HBM4内存实现15.4TB/s带宽,每瓦HBM带宽22(英伟达Rubin为11.1);计算核心与HBM切片直接绑定并采用乱序执行核心,消除固定延迟。
- 【颠覆性结论】SemiAnalysis指出CUDA护城河可能已死——Rubin流片早于Jalapeño却未开放第三方测试,反映软件成熟度差距;OpenAI两周内将吞吐量提升超2倍,8天内将张量并行从TP8扩展至TP32。
- 【保留意见】测试模型非前沿模型(未完成AgentX多轮长上下文测试);公平对比对象应为同用HBM4的Vera Rubin而非Blackwell;Jalapeño仍处工程样片阶段,量产要到2027年爬坡。
- 【战略版图】B0步进已入厂,每瓦性能再提升25%;OpenAI与Broadcom签署10GW定制加速器协议(相当于十座核电机组满发功率),下一里程碑为100MW部署规模。
原作者:董静
原文来源:华尔街见闻
Con chip tự nghiên cứu đầu tiên mang tên Jalapeño, OpenAI đã làm chấn động cục diện ngành chip AI vốn đã ổn định với tốc độ đáng kinh ngạc — đây không chỉ là một sự ra mắt sản phẩm, mà còn là một tín hiệu: AI đang định hình lại chính cách thiết kế chip.
Theo bài viết của Wall Street CN, dựa trên báo cáo của Bloomberg ngày 25/8, OpenAI cho biết Jalapeño vượt trội hơn NVIDIA GB300 ở hai chỉ số then chốt: khối lượng công việc AI xử lý được trên mỗi đơn vị điện năng tiêu thụ và tốc độ phản hồi. Con chip này do OpenAI hợp tác phát triển cùng Broadcom, được thiết kế riêng cho giai đoạn suy luận AI và dự kiến sẽ được đưa vào sử dụng thực tế vào cuối năm nay. Richard Ho, người phụ trách mảng chip của OpenAI, cho biết Jalapeño có thể đạt hiệu suất mạnh mẽ ở mức công suất thấp chỉ 700 watt, giúp giảm đáng kể chi phí điện năng cho các trung tâm dữ liệu.

Theo tiết lộ của tổ chức nghiên cứu bán dẫn SemiAnalysis, con chip này chỉ mất khoảng 16 tháng từ khi bắt đầu thiết kế đến khi hoàn tất quá trình đổ khuôn (tape-out), trong đó mốc đổ khuôn đóng gói CoWoS quan trọng được hoàn thành vào tháng 11/2025, tức chỉ mới 9 tháng trước, thấp hơn nhiều so với chu kỳ thông thường 18 đến 36 tháng của ngành.

Các nhà nghiên cứu của SemiAnalysis đã trực tiếp đến phòng thí nghiệm của OpenAI và sử dụng bộ benchmark tự phát triển mang tên InferenceX để kiểm tra thực tế Jalapeño. Kết luận rất rõ ràng: Con chip này đánh bại tất cả các chip NVIDIA, AMD và Google mà họ từng thử nghiệm trước đây về chỉ số hiệu suất trên mỗi watt (perf/W).
Đáng chú ý hơn, thành tích này đạt được khi Jalapeño chưa kích hoạt giải mã suy đoán (speculative decoding), chưa tách riêng giai đoạn prefill và decode trong triển khai, trong khi các chip đối thủ đều đã được cấu hình tối ưu nhất.
Không ngạc nhiên khi nhà phân tích bán dẫn nổi tiếng Dylan Patel cũng thẳng thắn nhận xét: "Không chỉ Blackwell bị vượt qua, ngay cả chip Rubin của NVIDIA cũng bị bỏ lại phía sau"!

Giới phân tích cho rằng kết quả này đặt ra thách thức trực tiếp đối với vị thế thị trường của NVIDIA và khiến thị trường phải đánh giá lại cục diện cạnh tranh trong lĩnh vực chip AI.
Dữ liệu thực tế: Jalapeño vượt trội Blackwell ở nhiều chỉ số quan trọng
Kết quả kiểm tra của SemiAnalysis cho thấy lợi thế về hiệu quả suy luận của Jalapeño là rất đáng kể.
Trên mô hình GPT-OSS 120B, Jalapeño có thể xuất ra khoảng 1459 Token mỗi giây, trong khi NVIDIA GB200 chỉ đạt 535; về độ trễ đầu cuối, Jalapeño chỉ mất 1,65 giây để hoàn thành một tác vụ, trong khi GB300 cần gần 6 giây, chênh lệch gấp 3,6 lần. Trong các kịch bản tương tác cao, khi GB300 bị đẩy lên tốc độ giải mã nhanh nhất (169 Token/giây), thông lượng của Jalapeño gấp 104,3 lần.

Ở chỉ số số Token xuất ra trên mỗi megawatt mỗi giây - thước đo cốt lõi về hiệu quả năng lượng của trung tâm dữ liệu - Jalapeño đạt khoảng 53 triệu Token/MW/s trên mô hình GPT-OSS, trong khi GB200 NVL72 chỉ đạt khoảng 10 triệu.

SemiAnalysis chỉ ra rằng chỉ số này về bản chất tương đương với số Token sinh ra trên mỗi joule năng lượng, quyết định trực tiếp trần doanh thu của trung tâm dữ liệu — trong bối cảnh sức mạnh tính toán đang bị giới hạn bởi nguồn điện, lợi thế ở chiều này càng trở nên quan trọng.
Xét về chi phí cấp hệ thống, theo tính toán của SemiAnalysis khi bao gồm cả nguồn điện, làm mát và mạng lưới, tổng chi phí sở hữu (TCO) trên mỗi chip mỗi giờ của Jalapeño là khoảng 1,56 USD, gần như ngang bằng với mức 1,55 USD của H100, trong khi NVIDIA Vera Rubin lên tới 3,61 USD.

Đáng chú ý, SemiAnalysis đồng thời đưa ra một số bảo lưu quan trọng.
Thứ nhất, mô hình dùng trong bài kiểm tra không phải là mô hình tiên tiến nhất hiện tại. NVIDIA và AMD đã công bố kết quả dựa trên bộ công cụ AgentX trên các mô hình lớn hơn (như DeepSeek V4 Pro, Kimi K3), trong khi Jalapeño chưa hoàn thành bài kiểm tra AgentX — bộ công cụ này phản ánh tốt hơn hiệu năng trong các kịch bản sản xuất thực tế như hội thoại nhiều vòng và ngữ cảnh dài.
Thứ hai, đối tượng so sánh công bằng hơn phải là NVIDIA Vera Rubin (cũng sử dụng HBM4) thay vì Blackwell; hiệu suất trên mỗi watt của Vera Rubin cao hơn GB200 NVL72 khoảng 5,4 lần, và khi so với Jalapeño, tổng chi phí sở hữu trên mỗi Token (TCO) của hai bên gần như ngang nhau.
Thứ ba, Jalapeño hiện vẫn đang ở giai đoạn mẫu kỹ thuật (engineering sample), sản xuất hàng loạt dự kiến phải đến năm 2027 mới dần tăng công suất.
AI thiết kế chip: "Hiệu ứng bánh đà" của GPT-Astra và Codex
Một trong những lý do cốt lõi giúp Jalapeño được phát triển với tốc độ đáng kinh ngạc như vậy là sự tham gia sâu của các công cụ AI. Theo tiết lộ của SemiAnalysis, OpenAI đã sử dụng rộng rãi các mô hình AI nội bộ trong quá trình thiết kế chip, bao gồm GPT-Astra - mô hình đang được giới bên ngoài đặc biệt quan tâm.
Người dùng Andrew Curran trên nền tảng X dẫn thông tin từ OpenAI cho biết GPT-Astra đã tham gia sâu vào toàn bộ quá trình phát triển Jalapeño:
"Nhóm nghiên cứu đã sử dụng Codex và GPT-Astra để tinh chỉnh ba mô hình mã nguồn mở vốn không nằm trong kế hoạch sản xuất hàng loạt của Jalapeño lên trạng thái hiệu suất cao chỉ trong hai tháng."

Điều này có nghĩa là AI không chỉ đang tăng tốc quá trình thiết kế chip mà còn đang nhanh chóng mở rộng phạm vi mô hình mà con chip có thể hỗ trợ.
Dữ liệu từ SemiAnalysis định lượng rõ hơn đóng góp này:
Thiết kế có sự hỗ trợ của AI giúp diện tích khối SIMD giảm 8%, diện tích khối ma trận giảm 10%, đồng thời cải thiện cả hiệu năng về timing lẫn mức tiêu thụ điện năng so với phiên bản ban đầu.

Ở tầng phần mềm, OpenAI sử dụng phiên bản mở rộng nội bộ của Codex để viết kernel cho Jalapeño, một số kernel có độ dài lên tới khoảng 3000 dòng; trên các mô-đun ngốn hiệu năng nhất là cơ chế attention và MoE, mã do AI tạo ra nhanh hơn từ 1,5 đến 1,8 lần so với triển khai của các kỹ sư hàng đầu.
SemiAnalysis có nhận xét khá sắc bén về điều này: các mô hình OpenAI (như GPT-5.6 Sol) đang chạy trên GPU NVIDIA lại được dùng để thiết kế một con chip đặt ra mối đe dọa thực sự đối với hào nước CUDA — "chính GPU của NVIDIA đang trong thời gian thực tạo ra người kế nhiệm tiềm năng của chính mình".

Phân tích kiến trúc: Vì sao "đa năng" lại nhanh hơn?
Giới bên ngoài thường giả định Jalapeño là một con chip được tùy chỉnh sâu cho riêng các mô hình của OpenAI, nhưng kết luận của SemiAnalysis lại ngược lại: Jalapeño là một con chip đa năng dành cho suy luận AI, có thể chạy nhiều loại mô hình và khối lượng công việc khác nhau, thậm chí bao gồm cả tựa game Doom được Codex chuyển đổi.
Ở cấp độ kiến trúc, triết lý thiết kế cốt lõi của Jalapeño là "loại bỏ độ trễ cố định". Khác với GPU phụ thuộc vào hệ thống phân cấp bộ nhớ phức tạp, Jalapeño gắn trực tiếp các lõi tính toán với các phân đoạn HBM, các lõi đồng bộ với nhau thông qua mạng tập hợp băng thông cao chuyên dụng, giúp giảm đáng kể độ trễ truy cập bộ nhớ.
Ngoài ra, Jalapeño sử dụng lõi thực thi lệnh không theo thứ tự (OoO) kết hợp với bộ nhớ đệm L1, thay vì bộ nhớ tạm do phần mềm quản lý mà các bộ tăng tốc khác thường dùng. Điều này giúp chip đạt gần hơn với đỉnh lý thuyết về phần cứng trong các kịch bản batch nhỏ, độ trễ thấp.
Về băng thông bộ nhớ, Jalapeño sử dụng HBM4, đạt băng thông bộ nhớ 15,4TB/s trong một gói, băng thông HBM trên mỗi watt là 22, trong khi NVIDIA Rubin chỉ đạt 11,1 và GB300 chỉ vỏn vẹn 5,71.

SemiAnalysis chỉ ra rằng, tốc độ chân cắm HBM4 của Jalapeño đạt 10Gbps, cao hơn một chút so với mức 9,6Gbps của NVIDIA Rubin, và nhà cung cấp HBM có thể là Samsung.
Đáng chú ý, Jalapeño lựa chọn không triển khai tách prefill và decode (PDD). SemiAnalysis giải thích chi tiết về quyết định này:
Trong môi trường sản xuất thực tế, các tham số như tỷ lệ đầu vào/đầu ra, mức độ đồng thời, tỷ lệ hit cache liên tục thay đổi; việc phân bổ pool cố định sẽ khiến hiệu suất sử dụng tổng thể giảm; trong khi một resource pool đồng nhất có thể linh hoạt phản ứng với biến động lưu lượng, phân bổ động giữa các yêu cầu nhạy cảm độ trễ và các batch xử lý thông lượng cao.
Hào nước CUDA: Đã xuất hiện vết nứt?
Trong báo cáo của mình, SemiAnalysis đưa ra một nhận định có trọng lượng: hào nước CUDA có thể đã chết.
Cơ sở nằm ở sự khác biệt về tốc độ khởi động phần mềm. Chip Rubin của NVIDIA hoàn thành đổ khuôn CoWoS sớm hơn Jalapeño một tháng, nhưng cho đến nay, dữ liệu benchmark công khai mà bên ngoài có thể thấy của Rubin chỉ đến từ mẫu kỹ thuật tại CoreWeave; NVIDIA không mở cửa cho bên thứ ba vào phòng thí nghiệm tự do kiểm tra như OpenAI đã làm. SemiAnalysis cho rằng điều này phản ánh không phải khoảng cách về phần cứng, mà là khoảng cách về độ thuần th


