Rubin Ultra bị cắt giảm mạnh thông số, Nvidia cũng không chịu nổi việc giá bộ nhớ tăng?
- Quan điểm chính: Nvidia điều chỉnh thiết kế chip flagship Rubin Ultra do giá HBM tăng vọt, cắt giảm thông số bộ nhớ nhưng tăng cường quy mô kết nối để tối ưu cơ cấu chi phí, động thái này làm dấy lên lo ngại về việc nhu cầu HBM đã đạt đỉnh, khiến cổ phiếu ngành lưu trữ lao dốc.
- Yếu tố then chốt:
- Công suất tính toán đỉnh của Rubin Ultra vẫn giữ nguyên ở mức 35 PFLOPs, nhưng dung lượng bộ nhớ giảm xuống còn 192GB, thấp hơn mức 288GB của Rubin, băng thông chỉ tăng 1 TB/s, mức cải thiện hiệu suất có hạn.
- Trọng tâm tối ưu chi phí: Tỷ trọng chi phí HBM giảm từ gần 40% xuống còn 28%, tỷ trọng chi phí mở rộng kết nối tăng từ 4% lên 12%; chi phí vật tư cho một giá rack giảm từ khoảng 8 triệu USD xuống còn 6,4 triệu USD.
- Điểm nhấn thông số chuyển sang "mở rộng quy mô kết nối": Hỗ trợ kiến trúc NVL576, có thể kết nối tối đa 576 GPU để tạo thành một GPU logic siêu lớn, cao hơn 8 lần so với phiên bản thông thường 72 thẻ.
- Phản ứng thị trường: Cổ phiếu SK Hynix và Samsung đều lao dốc khoảng 8%, chỉ số KOSPI giảm khoảng 5%, phản ánh lo ngại của nhà đầu tư về việc các nhà sản xuất chip AI giảm phụ thuộc vào HBM.
- Báo cáo SemiAnalysis chưa được Nvidia xác nhận chính thức, nhưng thông tin được tiết lộ đã làm dấy lên sự đánh giá lại về cục diện cung cầu và quyền định giá của HBM.
Sáng tác: Odaily 星球日报(@OdailyChina)
Tác giả: Azuma(@azuma_eth)

Cuối tuần vừa qua, một báo cáo thể chế của công ty nghiên cứu đầu tư nổi tiếng SemiAnalysis đã gây ra cuộc thảo luận lớn trong toàn ngành AI.
Nội dung cốt lõi của báo cáo là, sau khi SemiAnalysis tiết lộ vào cuối tháng 6 rằng thiết kế Rubin Ultra 4-die (4 khuôn) nguyên bản của NVIDIA sẽ bị cắt giảm một nửa, công ty nghiên cứu đầu tư này một lần nữa tiết lộ rằng NVIDIA đã cung cấp bản xem trước của Rubin Ultra cho các khách hàng chính, nhưng thông số kỹ thuật của nó đã giảm thêm so với kỳ vọng trước đó.

Ảnh chụp màn hình thông tin liên quan đến Rubin Ultra trong báo cáo SemiAnalysis như sau:
- Rubin Ultra sẽ giữ nguyên đỉnh hiệu năng tính toán lý thuyết tương tự như Rubin, đều là 35 PFLOPs;
- Dung lượng bộ nhớ bị cắt giảm nghiêm trọng, thông số giảm xuống còn 192GB với 8 lớp xếp chồng (8-Hi), thậm chí thấp hơn cả Rubin 288GB với 12 lớp xếp chồng (12-Hi);
- Sự thay đổi về băng thông bộ nhớ gần như không đáng kể, chỉ tăng 1 TB/s, về cơ bản có thể bỏ qua trong các phép tính thông lượng cao thực tế;
- Mức tiêu thụ điện năng ở cấp độ chip thậm chí còn tăng nhẹ, mức tiêu thụ tối thiểu giống như Rubin (1800 W), trong khi mức tối đa lại cao hơn (2600 W);
- Điểm nâng cấp lớn duy nhất là "quy mô kết nối mở rộng" (Scale-up world size), tăng từ 72 GPU lên 576 GPU, điều này có nghĩa là NVIDIA đã chuyển điểm bán hàng thực sự sang mạng cụm. Thông qua mạng NVLink, nó có thể kết nối tối đa 576 Rubin Ultra thành một "GPU logic siêu lớn" (bản thông thường chỉ hỗ trợ kết nối tối đa 72 thẻ).
Là phiên bản cao cấp nhất của Rubin được NVIDIA công bố quan trọng tại GTC 2026 năm nay, định vị ban đầu của Rubin Ultra là tích hợp nhiều chip die và bộ nhớ băng thông cao để đáp ứng nhu cầu huấn luyện và suy luận mô hình AI quy mô cực lớn, nhưng từ thông số kỹ thuật mới nhất do SemiAnalysis tiết lộ, rõ ràng NVIDIA đã điều chỉnh tư duy thiết kế của Rubin Ultra.
Giá HBM tăng quá nhanh, NVIDIA bắt đầu tính toán lại
Trong hai năm qua, một trong những thành phần quan trọng nhất trong quá trình mở rộng ngành AI chắc chắn là HBM.
Khi nhu cầu về các bộ tăng tốc AI như Nvidia H100, H200, Blackwell bùng nổ, bộ nhớ băng thông cao từ sản phẩm lưu trữ cao cấp tương đối ngách trước đây đã trở thành mắt xích khan hiếm nhất trong toàn bộ hạ tầng AI. SK Hynix, Samsung, Micron trong khi liên tục phá kỷ lục doanh thu cũng đồng thời mở rộng đầu tư vào HBM, và sự mất cân bằng cung cầu trên thị trường vẫn tiếp tục đẩy giá HBM tăng liên tục.
Đối với các nhà sản xuất chip AI, tầm quan trọng của HBM là điều hiển nhiên – GPU chịu trách nhiệm tính toán, HBM chịu trách nhiệm cung cấp thông lượng dữ liệu tốc độ cao, cả hai cùng quyết định hiệu quả huấn luyện và suy luận mô hình AI. Nhưng vấn đề là, hiện nay HBM đã đắt đến mức bắt đầu ảnh hưởng đến tính kinh tế tổng thể của hệ thống AI. Lấy HBM3 làm ví dụ, giá một HBM3 chỉ ở mức 180-220 USD tại điểm đáy quý 2 năm 2025, đến quý 1 năm nay (giá hợp đồng) đã tăng lên 600-700 USD, còn quý 2 (giá giao ngay) lại tăng vọt lên 700-850 USD.
Theo tính toán của SemiAnalysis, khi giá HBM tăng, chi phí vật liệu thuần túy (BOM) cho một giá đỡ Rubin Ultra đã từng tăng từ khoảng 6,6 triệu USD lên 8 triệu USD, và sau khi điều chỉnh thông số thiết kế, chi phí có thể giảm xuống còn khoảng 6,4 triệu USD.
Đối với NVIDIA, sự khác biệt chi phí khổng lồ như vậy đặt ra một vấn đề thực tế rất rõ ràng – nếu tiếp tục tăng dung lượng HBM theo thiết kế ban đầu, liệu có mang lại hiệu suất tương xứng với chi phí hay không? Có giải pháp tối ưu nào khác không?
SemiAnalysis đã đưa ra câu trả lời trong báo cáo: việc điều chỉnh Rubin Ultra về bản chất là NVIDIA tối ưu hóa lại cấu trúc chi phí của hệ thống AI trong điều kiện nguồn lực có hạn, tức là giảm cấu hình HBM tương đối đắt đỏ (tỷ trọng chi phí giảm từ gần 40% xuống 28%) và đầu tư nguồn lực vào khả năng kết nối mở rộng có giá trị cao hơn (tỷ trọng chi phí tăng từ 4% lên 12%).
Như đã đề cập ở trên, hướng nâng cấp cốt lõi của Rubin Ultra hiện đã chuyển sang "khả năng kết nối mở rộng ở cấp độ hệ thống". Kiến trúc NVL576 mà Rubin Ultra hỗ trợ có thể kết nối tối đa 576 GPU thành một miền tính toán thống nhất thông qua NVLink, nhằm bù đắp cho việc điều chỉnh thông số trên từng chip bằng cách mở rộng hệ thống ở quy mô lớn hơn.
Cổ phiếu lưu trữ giảm mạnh, thị trường lo ngại nhu cầu đã đạt đỉnh
Chịu ảnh hưởng từ tin tức này, khi thị trường chứng khoán Hàn Quốc mở cửa sáng nay, các cổ phiếu liên quan đến bộ nhớ đồng loạt giảm. Tính đến 11:45 giờ Bắc Kinh, SK Hynix và Samsung – hai ông lớn HBM – đồng loạt giảm khoảng 8%, chỉ số KOSPI cũng giảm khoảng 5%.
Thị trường đã bắt đầu lo ngại rằng nếu việc điều chỉnh thông số Rubin Ultra mà SemiAnalysis tiết lộ là thật (NVIDIA chưa công bố xác nhận thông tin liên quan), điều đó có nghĩa là – NVIDIA, với tư cách là người mua cốt lõi nhất trong hạ tầng AI, có đang giảm nhu cầu đối với HBM không?
Trong hai năm qua, với sự tăng trưởng nhanh chóng của nhu cầu mở rộng AI, HBM đã trở thành phần khan hiếm nhất trong hạ tầng AI. Các nhà sản xuất chip như NVIDIA, AMD liên tục tăng cấu hình HBM trong các bộ tăng tốc AI, thúc đẩy doanh thu của các nhà sản xuất bộ nhớ như SK Hynix, Samsung, Micron tăng vọt, đồng thời liên tục củng cố quyền định giá của họ trong toàn bộ chuỗi cung ứng.
Và lựa chọn của NVIDIA có thể có nghĩa là các nhà sản xuất chip AI đang xem xét giảm sự phụ thuộc của từng chip vào HBM dung lượng cao thông qua việc tối ưu hóa thiết kế phần cứng. Nếu hướng đi này được chứng minh là khả thi, không gian tăng giá liên tục của các nhà sản xuất HBM rất có thể sẽ bị hạn chế.
Việc xây dựng hạ tầng AI sớm muộn cũng sẽ nói lời tạm biệt với thời đại "chất đống nguyên liệu và tăng giá bất chấp", và hiện tại, ngay cả NVIDIA đang ngự trị trên ngai vàng sức mạnh tính toán cũng đã bắt đầu tính toán chi li.


