Marvell推出AI“内存解耦”架构,将解决Agentic AI推理带宽瓶颈
Tin Odaily — Marvell Technology vừa công bố một bộ giải pháp bộ nhớ thế hệ mới dành cho hạ tầng AI, bao gồm lưu trữ AI cấp máy chủ, mở rộng và gộp bộ nhớ CXL cấp tủ rack, cũng như bộ nhớ chia sẻ qua kết nối quang đa tủ, nhằm giải quyết các nút thắt về dung lượng và băng thông bộ nhớ ngày càng tăng trong quá trình suy luận Agentic AI.
Marvell cho biết, khi quy mô mô hình AI ngày càng lớn, cửa sổ ngữ cảnh được kéo dài và nhu cầu KV Cache tăng lên, kiến trúc gắn kết chặt chẽ giữa tính toán và bộ nhớ truyền thống đang hạn chế hiệu quả suy luận AI. Thông qua phân tách bộ nhớ (memory disaggregation), tài nguyên bộ nhớ có thể được mở rộng độc lập hơn với tài nguyên tính toán, nâng cao mức sử dụng GPU và giảm độ trễ di chuyển dữ liệu. Các sản phẩm được công bố lần này bao gồm:
Bộ điều khiển SSD Bravera SC6 PCIe 6.0: Dành cho các tình huống lưu trữ suy luận AI, giúp các nhà cung cấp dịch vụ đám mây di chuyển nhiều KV Cache hơn sang SSD hiệu suất cao, nâng cao hiệu quả hạ tầng. Sản phẩm này sử dụng kiến trúc tương thích NAND đa nhà cung cấp, dự kiến bắt đầu gửi mẫu vào quý 4 năm 2026.
Giải pháp mở rộng bộ nhớ Marvell Structera X: Dựa trên công nghệ CXL, hỗ trợ mở rộng bộ nhớ cấp tủ rack và gộp tài nguyên, giúp các trung tâm dữ liệu chia sẻ và điều phối tài nguyên bộ nhớ linh hoạt hơn, giảm chi phí hạ tầng AI.
Giải pháp bộ nhớ kết nối quang Marvell Photonic Fabric: Xây dựng kiến trúc bộ nhớ chia sẻ đa tủ thông qua công nghệ kết nối quang, hỗ trợ di dời tối đa 32TB KV Cache ấm, đồng thời giúp các cụm suy luận AI nâng cao thông lượng.
Marvell cho biết, giải pháp Photonic Fabric có thể đạt mức tăng thông lượng Token tối đa từ 2 đến 3 lần trong giới hạn không gian và năng lượng hiện có của trung tâm dữ liệu, hỗ trợ các ứng dụng AI với mô hình quy mô lớn hơn và ngữ cảnh dài hơn.
Giám đốc điều hành Marvell, Will Chu, cho biết hạ tầng AI đang chuyển từ kiến trúc máy chủ đơn lẻ sang hệ thống vận hành phối hợp giữa tính toán, bộ nhớ và kết nối. Trong tương lai, bộ nhớ cần được mở rộng độc lập hơn để nâng cao hiệu quả sử dụng tài nguyên và hiệu suất Token.
Khi nhu cầu suy luận từ AI Agent và mô hình lớn tiếp tục tăng trưởng, dung lượng bộ nhớ, băng thông và hiệu quả truyền dữ liệu đang trở thành trọng tâm cạnh tranh mới trong hạ tầng AI sau sức mạnh tính toán.
