SemiAnalysis: Kimi K3의 KDA 메커니즘은 주의 효율성을 높이지만, 더 많은 GPU, HBM, DRAM 및 네트워크가 필요할 것이며, 더 적게 필요하지 않습니다.
- 핵심 의견: Moonshot AI의 Kimi K3 모델은 선형 주의 메커니즘을 채택하여 시장에서는 엔비디아 등 고성능 AI 하드웨어 수요를 약화시킬 것을 우려합니다. 그러나 분석 결과, K3의 2.8조 개가 넘는 방대한 파라미터 규모와 추론 아키텍처 요구사항은 오히려 고성능 GPU, HBM 및 고속 상호 연결 장치에 대한 수요를 강화하고, 장기적으로 비용 절감을 통해 더 많은 애플리케이션 도입을 촉진할 수 있습니다.
- 핵심 요소:
- K3의 파라미터 규모는 2.8조 개를 초과하며, 모델 가중치에는 1.5TB 이상의 HBM이 필요하고 KV 캐시는 여전히 상당 부분을 비HBM 스토리지로 오프로드해야 하므로 HBM 수요는 줄어들지 않습니다.
- K3의 효율적인 추론을 위해서는 최소 64개의 칩으로 구성된 대규모 확장 도메인 아키텍처가 필요하며, 이는 엔비디아의 GB200/GB300 NVL72 등 랙 규모 AI 시스템 설계와高度로 일치합니다.
- K3가 채택한 WideEP 최적화 전략은 896개의 전문가(Expert)를 여러 GPU에 분산 배치하여 전문가 간 데이터 교환을 위한 고속 네트워크 상호 연결(예: 구리 백플레인) 수요를 증가시킵니다.
- 시장에는 상반된 의견도 존재하여, 화웨이昇腾 950 SuperPod의 64칩 구성 역시 K3의 확장 도메인 요구사항을 충족할 수 있으므로 엔비디아가 유일한 수혜자는 아닐 수 있다고 지적합니다.
- SemiAnalysis는 제번스의 역설(Jevons paradox)을 인용하여 선형 주의가 추론 비용을 낮추면 AI 애플리케이션의 대규모 확장을 촉진하여 결과적으로 GPU 등 하드웨어에 대한 장기적인 수요 성장을 자극할 것이라고 분석합니다.
- 진정한 핵심 변수는 선도 AI 기업(예: OpenAI)이 선형 주의를 대규모로 채택할 경우, 장문맥 추론(Long-context Inference)에 대한 하드웨어 수요 구조가 크게 변화할 가능성에 있습니다.
原文作者:李佳
原文来源:华尔街见闻
月之暗面旗下大模型 Kimi K3 采用线性注意力机制,引发市场对英伟达、HBM 以及网络设备需求可能受到削弱的担忧。
不过,半导体研究机构 SemiAnalysis 近日给出了截然不同的判断:K3 庞大的参数规模和推理架构需求,不仅不会削弱高端 AI 硬件需求,反而可能进一步强化对英伟达高端 GPU、HBM 以及高速互联设备的需求。
SemiAnalysis 指出,K3 参数规模超过 2.8 万亿,模型权重容量超过 1.5TB HBM。即便在相对有限的用户并发场景下,KV 缓存仍需要大量卸载至 CPU DDR5 内存及 NVMe 存储,HBM 空间并不会出现明显富余。
更重要的是,月之暗面此前透露,K3 的高效推理部署需要至少 64 颗芯片组成的大规模扩展域架构。这一硬件需求与英伟达 GB200/GB300 NVL72 等机架级 AI 系统的设计方向高度匹配。
SemiAnalysis 认为,市场此前将线性注意力理解为“削弱 GPU 需求”的逻辑存在偏差。真正的影响可能恰恰相反:更高效的模型架构降低了 AI 推理成本,将推动更多应用落地,进而刺激 GPU、HBM、DRAM 以及网络基础设施的长期需求。

无惧线性注意力迭代,英伟达芯片需求依旧坚挺
市场担忧主要来自 Kimi K3 采用的 Kimi Delta Attention(KDA)机制。
相比传统 Transformer 注意力机制,KDA 能够显著降低 KV 缓存的数据传输需求,最高可减少约 10 倍的网络带宽压力。这一变化令部分投资者联想到 DeepSeek R1 发布后市场对 AI 硬件需求的担忧,认为模型效率提升可能降低对高端算力硬件的依赖。
但 SemiAnalysis 认为,这一判断忽视了大模型推理中的另一项核心需求——参数规模带来的计算和互联压力。
K3 拥有超过 2.8 万亿参数,其模型权重本身就需要依赖大规模分布式计算系统完成部署。与此同时,K3 采用 WideEP(Wide Expert Parallelism)优化策略,将 896 个专家模块分布到多颗 GPU 上,使单颗 GPU 仅需承载部分专家权重,从而提升计算利用率。
不过,WideEP 也带来了新的挑战:专家之间频繁的数据交换需要更强大的网络互联能力。SemiAnalysis 指出,GB200/GB300 NVL72 采用的铜背板互联架构,提供的机架内带宽达到传统 DGX B200 系统的 18 倍,非常适合这类大规模专家并行推理任务。
换言之,KDA 节省的 KV 缓存通信需求,可能被 WideEP 带来的权重交换需求部分抵消,整体 AI 基础设施压力并未明显下降。


64 颗芯片扩展域并非英伟达独家受益
不过,市场对此也存在不同声音。知情人士 GDP(@bookwormengr)指出,月之暗面提到的“64 颗芯片扩展域”并不一定意味着英伟达 NVL72 方案。华为昇腾 950 SuperPod 同样采用 64 颗芯片配置,并具备类似 NVLink 的统一总线(UB)内存扩展能力。
从架构能力看,昇腾 950 SuperPod 可支持跨 16 个机架扩展至 1024 颗 NPU,在满足大规模模型推理需求方面同样具备竞争力。因此,K3 带来的硬件需求增长,并不意味着英伟达将成为唯一受益者,但其对于高端 AI 互联系统的需求强化趋势仍然明确。

杰文斯悖论:AI 效率提升可能推动硬件需求增长
SemiAnalysis 进一步援引杰文斯悖论(Jevons' Paradox)解释 AI 基础设施趋势。
该理论认为,当某项技术提升资源利用效率、降低单位成本后,需求往往不会下降,反而可能因应用范围扩大而增长。应用到 AI 领域,线性注意力机制降低推理成本后,可能推动更多企业部署 AI 应用,使全球 AI 推理规模进一步扩大,最终带动 GPU、HBM、DRAM 以及高速网络设备需求增长。
不过,GDP 对此保持谨慎态度。他认可杰文斯悖论的长期逻辑,但指出,KDA 对于长上下文任务中的状态存储优化具有现实意义。即使模型权重规模巨大,由于采用 4bit 量化以及高度稀疏化设计,实际内存压力可能低于市场直觉。
他认为,真正值得关注的变量在于全球推理需求最大的 AI 公司——OpenAI、Anthropic 以及 Google DeepMind——是否已经或未来会采用类似 KDA、DeepSeek CSA/HCA 等线性注意力方案。如果头部 AI 公司大规模采用此类架构,长上下文推理对内存和互联资源的需求可能出现明显下降,这将成为影响未来 AI 硬件需求结构的重要因素。
市场关注点转向:AI 需求增长能否抵消架构效率提升
总体来看,Kimi K3 的出现并未简单指向 AI 硬件需求下降。对于英伟达而言,真正的竞争焦点可能从“单卡性能”转向“系统级能力”——包括高速互联、机架级扩展以及大规模推理优化。
随着模型规模持续扩大,即使注意力机制不断优化,AI 基础设施仍面临参数规模、专家并行、数据交换以及推理吞吐提升带来的压力。
未来市场需要关注的核心问题,不是线性注意力是否降低单项资源消耗,而是 AI 应用规模扩张带来的新增需求,能否持续超过架构效率提升带来的资源节省。


