BTC
ETH
HTX
SOL
BNB
시장 동향 보기
简中
繁中
English
日本語
한국어
ภาษาไทย
Tiếng Việt

SemiAnalysis: Kimi K3의 KDA 메커니즘은 주의 효율성을 높이지만, 더 많은 GPU, HBM, DRAM 및 네트워크가 필요할 것이며, 더 적게 필요하지 않습니다.

星球君的朋友们
Odaily资深作者
2026-07-20 02:31
이 기사는 약 2204자로, 전체를 읽는 데 약 4분이 소요됩니다
Kimi K3의 선형 주의(Linear Attention)는 단기적으로 하드웨어 수요에 대한 우려를 불러일으키지만, SemiAnalysis는 2.8조 개가 넘는 파라미터와 대규모 추론 아키텍처가 오히려 고성능 GPU, HBM 및 고속 상호 연결에 대한 수요를 심화시킬 것이라고 지적합니다.
AI 요약
펼치기
  • 핵심 의견: Moonshot AI의 Kimi K3 모델은 선형 주의 메커니즘을 채택하여 시장에서는 엔비디아 등 고성능 AI 하드웨어 수요를 약화시킬 것을 우려합니다. 그러나 분석 결과, K3의 2.8조 개가 넘는 방대한 파라미터 규모와 추론 아키텍처 요구사항은 오히려 고성능 GPU, HBM 및 고속 상호 연결 장치에 대한 수요를 강화하고, 장기적으로 비용 절감을 통해 더 많은 애플리케이션 도입을 촉진할 수 있습니다.
  • 핵심 요소:
    1. K3의 파라미터 규모는 2.8조 개를 초과하며, 모델 가중치에는 1.5TB 이상의 HBM이 필요하고 KV 캐시는 여전히 상당 부분을 비HBM 스토리지로 오프로드해야 하므로 HBM 수요는 줄어들지 않습니다.
    2. K3의 효율적인 추론을 위해서는 최소 64개의 칩으로 구성된 대규모 확장 도메인 아키텍처가 필요하며, 이는 엔비디아의 GB200/GB300 NVL72 등 랙 규모 AI 시스템 설계와高度로 일치합니다.
    3. K3가 채택한 WideEP 최적화 전략은 896개의 전문가(Expert)를 여러 GPU에 분산 배치하여 전문가 간 데이터 교환을 위한 고속 네트워크 상호 연결(예: 구리 백플레인) 수요를 증가시킵니다.
    4. 시장에는 상반된 의견도 존재하여, 화웨이昇腾 950 SuperPod의 64칩 구성 역시 K3의 확장 도메인 요구사항을 충족할 수 있으므로 엔비디아가 유일한 수혜자는 아닐 수 있다고 지적합니다.
    5. SemiAnalysis는 제번스의 역설(Jevons paradox)을 인용하여 선형 주의가 추론 비용을 낮추면 AI 애플리케이션의 대규모 확장을 촉진하여 결과적으로 GPU 등 하드웨어에 대한 장기적인 수요 성장을 자극할 것이라고 분석합니다.
    6. 진정한 핵심 변수는 선도 AI 기업(예: OpenAI)이 선형 주의를 대규모로 채택할 경우, 장문맥 추론(Long-context Inference)에 대한 하드웨어 수요 구조가 크게 변화할 가능성에 있습니다.

原文作者:李佳

原文来源:华尔街见闻

月之暗面旗下大模型 Kimi K3 采用线性注意力机制,引发市场对英伟达、HBM 以及网络设备需求可能受到削弱的担忧。

不过,半导体研究机构 SemiAnalysis 近日给出了截然不同的判断:K3 庞大的参数规模和推理架构需求,不仅不会削弱高端 AI 硬件需求,反而可能进一步强化对英伟达高端 GPU、HBM 以及高速互联设备的需求。

SemiAnalysis 指出,K3 参数规模超过 2.8 万亿,模型权重容量超过 1.5TB HBM。即便在相对有限的用户并发场景下,KV 缓存仍需要大量卸载至 CPU DDR5 内存及 NVMe 存储,HBM 空间并不会出现明显富余。

更重要的是,月之暗面此前透露,K3 的高效推理部署需要至少 64 颗芯片组成的大规模扩展域架构。这一硬件需求与英伟达 GB200/GB300 NVL72 等机架级 AI 系统的设计方向高度匹配。

SemiAnalysis 认为,市场此前将线性注意力理解为“削弱 GPU 需求”的逻辑存在偏差。真正的影响可能恰恰相反:更高效的模型架构降低了 AI 推理成本,将推动更多应用落地,进而刺激 GPU、HBM、DRAM 以及网络基础设施的长期需求。

无惧线性注意力迭代,英伟达芯片需求依旧坚挺

市场担忧主要来自 Kimi K3 采用的 Kimi Delta Attention(KDA)机制。

相比传统 Transformer 注意力机制,KDA 能够显著降低 KV 缓存的数据传输需求,最高可减少约 10 倍的网络带宽压力。这一变化令部分投资者联想到 DeepSeek R1 发布后市场对 AI 硬件需求的担忧,认为模型效率提升可能降低对高端算力硬件的依赖。

但 SemiAnalysis 认为,这一判断忽视了大模型推理中的另一项核心需求——参数规模带来的计算和互联压力。

K3 拥有超过 2.8 万亿参数,其模型权重本身就需要依赖大规模分布式计算系统完成部署。与此同时,K3 采用 WideEP(Wide Expert Parallelism)优化策略,将 896 个专家模块分布到多颗 GPU 上,使单颗 GPU 仅需承载部分专家权重,从而提升计算利用率。

不过,WideEP 也带来了新的挑战:专家之间频繁的数据交换需要更强大的网络互联能力。SemiAnalysis 指出,GB200/GB300 NVL72 采用的铜背板互联架构,提供的机架内带宽达到传统 DGX B200 系统的 18 倍,非常适合这类大规模专家并行推理任务。

换言之,KDA 节省的 KV 缓存通信需求,可能被 WideEP 带来的权重交换需求部分抵消,整体 AI 基础设施压力并未明显下降。

64 颗芯片扩展域并非英伟达独家受益

不过,市场对此也存在不同声音。知情人士 GDP(@bookwormengr)指出,月之暗面提到的“64 颗芯片扩展域”并不一定意味着英伟达 NVL72 方案。华为昇腾 950 SuperPod 同样采用 64 颗芯片配置,并具备类似 NVLink 的统一总线(UB)内存扩展能力。

从架构能力看,昇腾 950 SuperPod 可支持跨 16 个机架扩展至 1024 颗 NPU,在满足大规模模型推理需求方面同样具备竞争力。因此,K3 带来的硬件需求增长,并不意味着英伟达将成为唯一受益者,但其对于高端 AI 互联系统的需求强化趋势仍然明确。

杰文斯悖论:AI 效率提升可能推动硬件需求增长

SemiAnalysis 进一步援引杰文斯悖论(Jevons' Paradox)解释 AI 基础设施趋势。

该理论认为,当某项技术提升资源利用效率、降低单位成本后,需求往往不会下降,反而可能因应用范围扩大而增长。应用到 AI 领域,线性注意力机制降低推理成本后,可能推动更多企业部署 AI 应用,使全球 AI 推理规模进一步扩大,最终带动 GPU、HBM、DRAM 以及高速网络设备需求增长。

不过,GDP 对此保持谨慎态度。他认可杰文斯悖论的长期逻辑,但指出,KDA 对于长上下文任务中的状态存储优化具有现实意义。即使模型权重规模巨大,由于采用 4bit 量化以及高度稀疏化设计,实际内存压力可能低于市场直觉。

他认为,真正值得关注的变量在于全球推理需求最大的 AI 公司——OpenAI、Anthropic 以及 Google DeepMind——是否已经或未来会采用类似 KDA、DeepSeek CSA/HCA 等线性注意力方案。如果头部 AI 公司大规模采用此类架构,长上下文推理对内存和互联资源的需求可能出现明显下降,这将成为影响未来 AI 硬件需求结构的重要因素。

市场关注点转向:AI 需求增长能否抵消架构效率提升

总体来看,Kimi K3 的出现并未简单指向 AI 硬件需求下降。对于英伟达而言,真正的竞争焦点可能从“单卡性能”转向“系统级能力”——包括高速互联、机架级扩展以及大规模推理优化。

随着模型规模持续扩大,即使注意力机制不断优化,AI 基础设施仍面临参数规模、专家并行、数据交换以及推理吞吐提升带来的压力。

未来市场需要关注的核心问题,不是线性注意力是否降低单项资源消耗,而是 AI 应用规模扩张带来的新增需求,能否持续超过架构效率提升带来的资源节省。

AI
Odaily 공식 커뮤니티에 가입하세요