SemiAnalysis:Kimi K3的KDA机制提高注意力效率,但将需要更多的GPU、HBM、DRAM和网络,而非更少
- 核心观点:月之暗面Kimi K3模型采用线性注意力机制,市场担忧其削弱英伟达等高端AI硬件需求。但分析认为,K3超2.8万亿参数的庞大规模和推理架构需求,反而可能强化对高性能GPU、HBM及高速互联设备的需求,并长期通过降低成本刺激更多应用落地。
- 关键要素:
- K3参数规模超2.8万亿,模型权重需超1.5TB HBM,且KV缓存仍需大量卸载至非HBM存储,HBM需求未减。
- K3高效推理需至少64颗芯片组成的大规模扩展域架构,与英伟达GB200/GB300 NVL72等机架级AI系统设计高度匹配。
- K3采用的WideEP优化策略,将896个专家分布在多GPU上,增加了专家间数据交换对高速网络互联(如铜背板)的需求。
- 市场存在不同声音,指出华为昇腾950 SuperPod的64芯片配置同样能满足K3扩展域需求,英伟达并非唯一受益者。
- SemiAnalysis引用杰文斯悖论认为,线性注意力降低推理成本,会推动AI应用大规模扩张,进而刺激GPU等硬件长期需求增长。
- 真正关键变量在于,头部AI公司(如OpenAI)若大规模采用线性注意力,长上下文推理对硬件的需求结构可能发生显著变化。
原文作者:李佳
原文来源:华尔街见闻
月之暗面旗下大模型 Kimi K3 采用线性注意力机制,引发市场对英伟达、HBM 以及网络设备需求可能受到削弱的担忧。
不过,半导体研究机构 SemiAnalysis 近日给出了截然不同的判断:K3 庞大的参数规模和推理架构需求,不仅不会削弱高端 AI 硬件需求,反而可能进一步强化对英伟达高端 GPU、HBM 以及高速互联设备的需求。
SemiAnalysis 指出,K3 参数规模超过 2.8 万亿,模型权重容量超过 1.5TB HBM。即便在相对有限的用户并发场景下,KV 缓存仍需要大量卸载至 CPU DDR5 内存及 NVMe 存储,HBM 空间并不会出现明显富余。
更重要的是,月之暗面此前透露,K3 的高效推理部署需要至少 64 颗芯片组成的大规模扩展域架构。这一硬件需求与英伟达 GB200/GB300 NVL72 等机架级 AI 系统的设计方向高度匹配。
SemiAnalysis 认为,市场此前将线性注意力理解为“削弱 GPU 需求”的逻辑存在偏差。真正的影响可能恰恰相反:更高效的模型架构降低了 AI 推理成本,将推动更多应用落地,进而刺激 GPU、HBM、DRAM 以及网络基础设施的长期需求。

无惧线性注意力迭代,英伟达芯片需求依旧坚挺
市场担忧主要来自 Kimi K3 采用的 Kimi Delta Attention(KDA)机制。
相比传统 Transformer 注意力机制,KDA 能够显著降低 KV 缓存的数据传输需求,最高可减少约 10 倍的网络带宽压力。这一变化令部分投资者联想到 DeepSeek R1 发布后市场对 AI 硬件需求的担忧,认为模型效率提升可能降低对高端算力硬件的依赖。
但 SemiAnalysis 认为,这一判断忽视了大模型推理中的另一项核心需求——参数规模带来的计算和互联压力。
K3 拥有超过 2.8 万亿参数,其模型权重本身就需要依赖大规模分布式计算系统完成部署。与此同时,K3 采用 WideEP(Wide Expert Parallelism)优化策略,将 896 个专家模块分布到多颗 GPU 上,使单颗 GPU 仅需承载部分专家权重,从而提升计算利用率。
不过,WideEP 也带来了新的挑战:专家之间频繁的数据交换需要更强大的网络互联能力。SemiAnalysis 指出,GB200/GB300 NVL72 采用的铜背板互联架构,提供的机架内带宽达到传统 DGX B200 系统的 18 倍,非常适合这类大规模专家并行推理任务。
换言之,KDA 节省的 KV 缓存通信需求,可能被 WideEP 带来的权重交换需求部分抵消,整体 AI 基础设施压力并未明显下降。


64 颗芯片扩展域并非英伟达独家受益
不过,市场对此也存在不同声音。知情人士 GDP(@bookwormengr)指出,月之暗面提到的“64 颗芯片扩展域”并不一定意味着英伟达 NVL72 方案。华为昇腾 950 SuperPod 同样采用 64 颗芯片配置,并具备类似 NVLink 的统一总线(UB)内存扩展能力。
从架构能力看,昇腾 950 SuperPod 可支持跨 16 个机架扩展至 1024 颗 NPU,在满足大规模模型推理需求方面同样具备竞争力。因此,K3 带来的硬件需求增长,并不意味着英伟达将成为唯一受益者,但其对于高端 AI 互联系统的需求强化趋势仍然明确。

杰文斯悖论:AI 效率提升可能推动硬件需求增长
SemiAnalysis 进一步援引杰文斯悖论(Jevons' Paradox)解释 AI 基础设施趋势。
该理论认为,当某项技术提升资源利用效率、降低单位成本后,需求往往不会下降,反而可能因应用范围扩大而增长。应用到 AI 领域,线性注意力机制降低推理成本后,可能推动更多企业部署 AI 应用,使全球 AI 推理规模进一步扩大,最终带动 GPU、HBM、DRAM 以及高速网络设备需求增长。
不过,GDP 对此保持谨慎态度。他认可杰文斯悖论的长期逻辑,但指出,KDA 对于长上下文任务中的状态存储优化具有现实意义。即使模型权重规模巨大,由于采用 4bit 量化以及高度稀疏化设计,实际内存压力可能低于市场直觉。
他认为,真正值得关注的变量在于全球推理需求最大的 AI 公司——OpenAI、Anthropic 以及 Google DeepMind——是否已经或未来会采用类似 KDA、DeepSeek CSA/HCA 等线性注意力方案。如果头部 AI 公司大规模采用此类架构,长上下文推理对内存和互联资源的需求可能出现明显下降,这将成为影响未来 AI 硬件需求结构的重要因素。
市场关注点转向:AI 需求增长能否抵消架构效率提升
总体来看,Kimi K3 的出现并未简单指向 AI 硬件需求下降。对于英伟达而言,真正的竞争焦点可能从“单卡性能”转向“系统级能力”——包括高速互联、机架级扩展以及大规模推理优化。
随着模型规模持续扩大,即使注意力机制不断优化,AI 基础设施仍面临参数规模、专家并行、数据交换以及推理吞吐提升带来的压力。
未来市场需要关注的核心问题,不是线性注意力是否降低单项资源消耗,而是 AI 应用规模扩张带来的新增需求,能否持续超过架构效率提升带来的资源节省。


