BTC
ETH
HTX
SOL
BNB
查看行情
简中
繁中
English
日本語
한국어
ภาษาไทย
Tiếng Việt

SemiAnalysis:Kimi K3的KDA機制提高注意力效率,但將需要更多的GPU、HBM、DRAM和網路,而非更少

星球君的朋友们
Odaily资深作者
2026-07-20 02:31
本文約2204字,閱讀全文需要約4分鐘
Kimi K3的線性注意力雖引發對硬體需求的短期擔憂,但SemiAnalysis指出,其超過2.8兆參數與大規模推理架構,反而會加劇對高階GPU、HBM及高速互連的需求。
AI總結
展開
  • 核心觀點:月之暗面Kimi K3模型採用線性注意力機制,市場擔憂其削弱Nvidia等高階AI硬體需求。但分析認為,K3超過2.8兆參數的龐大規模和推理架構需求,反而可能強化對高效能GPU、HBM及高速互連設備的需求,並長期透過降低成本刺激更多應用落地。
  • 關鍵要素:
    1. K3參數規模超過2.8兆,模型權重需超過1.5TB HBM,且KV快取仍需大量卸載至非HBM儲存,HBM需求未減。
    2. K3高效推理需至少64顆晶片組成的大規模擴展域架構,與Nvidia GB200/GB300 NVL72等機架級AI系統設計高度匹配。
    3. K3採用的WideEP最佳化策略,將896個專家分佈在多GPU上,增加了專家間資料交換對高速網路互連(如銅背板)的需求。
    4. 市場存在不同聲音,指出華為昇騰950 SuperPod的64晶片配置同樣能滿足K3擴展域需求,Nvidia並非唯一受益者。
    5. SemiAnalysis引用傑文斯悖論認為,線性注意力降低推理成本,會推動AI應用大規模擴張,進而刺激GPU等硬體長期需求增長。
    6. 真正關鍵變數在於,頭部AI公司(如OpenAI)若大規模採用線性注意力,長上下文推理對硬體的需求結構可能發生顯著變化。

原文作者:李佳

原文來源:華爾街見聞

月之暗面旗下大模型 Kimi K3 採用線性注意力機制,引發市場對輝達、HBM 以及網路設備需求可能受到削弱的擔憂。

不過,半導體研究機構 SemiAnalysis 近日給出了截然不同的判斷:K3 龐大的參數規模和推理架構需求,不僅不會削弱高階 AI 硬體需求,反而可能進一步強化對輝達高階 GPU、HBM 以及高速互聯設備的需求。

SemiAnalysis 指出,K3 參數規模超過 2.8 兆,模型權重容量超過 1.5TB HBM。即便在相對有限的使用者並發場景下,KV 快取仍需要大量卸載至 CPU DDR5 記憶體及 NVMe 儲存,HBM 空間並不會出現明顯富餘。

更重要的是,月之暗面此前透露,K3 的高效推理部署需要至少 64 顆晶片組成的大規模擴展域架構。這一硬體需求與輝達 GB200/GB300 NVL72 等機架級 AI 系統的設計方向高度匹配。

SemiAnalysis 認為,市場此前將線性注意力理解為「削弱 GPU 需求」的邏輯存在偏差。真正的影響可能恰恰相反:更高效的模型架構降低了 AI 推理成本,將推動更多應用落地,進而刺激 GPU、HBM、DRAM 以及網路基礎設施的長期需求。

無懼線性注意力迭代,輝達晶片需求依舊堅挺

市場擔憂主要來自 Kimi K3 採用的 Kimi Delta Attention(KDA)機制。

相比傳統 Transformer 注意力機制,KDA 能夠顯著降低 KV 快取的數據傳輸需求,最高可減少約 10 倍的網路頻寬壓力。這一變化令部分投資者聯想到 DeepSeek R1 發布後市場對 AI 硬體需求的擔憂,認為模型效率提升可能降低對高階算力硬體的依賴。

但 SemiAnalysis 認為,這一判斷忽視了大模型推理中的另一項核心需求——參數規模帶來的計算和互聯壓力。

K3 擁有超過 2.8 兆參數,其模型權重本身就需要依賴大規模分散式計算系統完成部署。與此同時,K3 採用 WideEP(Wide Expert Parallelism)優化策略,將 896 個專家模組分佈到多顆 GPU 上,使單顆 GPU 僅需承載部分專家權重,從而提升計算利用率。

不過,WideEP 也帶來了新的挑戰:專家之間頻繁的數據交換需要更強大的網路互聯能力。SemiAnalysis 指出,GB200/GB300 NVL72 採用的銅背板互聯架構,提供的機架內頻寬達到傳統 DGX B200 系統的 18 倍,非常適合這類大規模專家並行推理任務。

換言之,KDA 節省的 KV 快取通訊需求,可能被 WideEP 帶來的權重交換需求部分抵消,整體 AI 基礎設施壓力並未明顯下降。

64 顆晶片擴展域並非輝達獨家受益

不過,市場對此也存在不同聲音。知情人士 GDP(@bookwormengr)指出,月之暗面提到的「64 顆晶片擴展域」並不一定意味著輝達 NVL72 方案。華為昇騰 950 SuperPod 同樣採用 64 顆晶片配置,並具備類似 NVLink 的統一匯流排(UB)記憶體擴展能力。

從架構能力看,昇騰 950 SuperPod 可支援跨 16 個機架擴展至 1024 顆 NPU,在滿足大規模模型推理需求方面同樣具備競爭力。因此,K3 帶來的硬體需求增長,並不意味著輝達將成為唯一受益者,但其對於高階 AI 互聯繫統的需求強化趨勢仍然明確。

傑文斯悖論:AI 效率提升可能推動硬體需求增長

SemiAnalysis 進一步援引傑文斯悖論(Jevons' Paradox)解釋 AI 基礎設施趨勢。

該理論認為,當某項技術提升資源利用效率、降低單位成本後,需求往往不會下降,反而可能因應用範圍擴大而增長。應用到 AI 領域,線性注意力機制降低推理成本後,可能推動更多企業部署 AI 應用,使全球 AI 推理規模進一步擴大,最終帶動 GPU、HBM、DRAM 以及高速網路設備需求增長。

不過,GDP 對此保持謹慎態度。他認可傑文斯悖論的長期邏輯,但指出,KDA 對於長上下文任務中的狀態儲存優化具有現實意義。即使模型權重規模巨大,由於採用 4bit 量化以及高度稀疏化設計,實際記憶體壓力可能低於市場直覺。

他認為,真正值得關注的變數在於全球推理需求最大的 AI 公司——OpenAI、Anthropic 以及 Google DeepMind——是否已經或未來會採用類似 KDA、DeepSeek CSA/HCA 等線性注意力方案。如果頭部 AI 公司大規模採用此類架構,長上下文推理對記憶體和互聯資源的需求可能出現明顯下降,這將成為影響未來 AI 硬體需求結構的重要因素。

市場關注點轉向:AI 需求增長能否抵消架構效率提升

總體來看,Kimi K3 的出現並未簡單指向 AI 硬體需求下降。對於輝達而言,真正的競爭焦點可能從「單卡性能」轉向「系統級能力」——包括高速互聯、機架級擴展以及大規模推理優化。

隨著模型規模持續擴大,即使注意力機制不斷優化,AI 基礎設施仍面臨參數規模、專家並行、數據交換以及推理吞吐提升帶來的壓力。

未來市場需要關注的核心問題,不是線性注意力是否降低單項資源消耗,而是 AI 應用規模擴張帶來的新增需求,能否持續超過架構效率提升帶來的資源節省。

AI
歡迎加入Odaily官方社群