BTC
ETH
HTX
SOL
BNB
Xem thị trường
简中
繁中
English
日本語
한국어
ภาษาไทย
Tiếng Việt

SemiAnalysis: Cơ chế KDA của Kimi K3 giúp nâng cao hiệu quả tập trung, nhưng sẽ đòi hỏi nhiều GPU, HBM, DRAM và mạng lưới hơn, chứ không phải ít hơn

星球君的朋友们
Odaily资深作者
2026-07-20 02:31
Bài viết này có khoảng 2204 từ, đọc toàn bộ bài viết mất khoảng 4 phút
Khả năng chú ý tuyến tính của Kimi K3 dấy lên lo ngại ngắn hạn về nhu cầu phần cứng, nhưng SemiAnalysis chỉ ra rằng kiến trúc suy luận quy mô lớn với hơn 2,8 nghìn tỷ tham số của nó lại làm gia tăng nhu cầu về GPU cao cấp, HBM và kết nối tốc độ cao.
Tóm tắt AI
Mở rộng
  • Quan điểm chính: Mô hình Kimi K3 của Moonlight sử dụng cơ chế chú ý tuyến tính, thị trường lo ngại điều này sẽ làm suy yếu nhu cầu về phần cứng AI cao cấp như NVIDIA. Tuy nhiên, phân tích cho thấy quy mô khổng lồ hơn 2,8 nghìn tỷ tham số và nhu cầu kiến trúc suy luận của K3 có thể củng cố nhu cầu về GPU hiệu năng cao, HBM và thiết bị kết nối tốc độ cao, đồng thời về lâu dài kích thích nhiều ứng dụng ra đời hơn nhờ giảm chi phí.
  • Các yếu tố chính:
    1. K3 có quy mô tham số vượt quá 2,8 nghìn tỷ, trọng số mô hình cần hơn 1,5TB HBM và bộ nhớ đệm KV vẫn cần được dỡ tải một lượng lớn sang bộ nhớ không phải HBM, do đó nhu cầu HBM không hề giảm.
    2. Suy luận hiệu quả của K3 cần kiến trúc miền mở rộng quy mô lớn với ít nhất 64 chip, phù hợp cao với các hệ thống AI quy mô rack như NVIDIA GB200/GB300 NVL72.
    3. Chiến lược tối ưu hóa WideEP mà K3 áp dụng, phân bổ 896 chuyên gia trên nhiều GPU, làm tăng nhu cầu trao đổi dữ liệu giữa các chuyên gia thông qua kết nối mạng tốc độ cao (ví dụ: backplane đồng).
    4. Có những ý kiến khác nhau trên thị trường, chỉ ra rằng cấu hình 64 chip của Huawei Ascend 950 SuperPod cũng có thể đáp ứng yêu cầu miền mở rộng của K3, NVIDIA không phải là bên hưởng lợi duy nhất.
    5. SemiAnalysis trích dẫn nghịch lý Jevons cho rằng, việc giảm chi phí suy luận do chú ý tuyến tính sẽ thúc đẩy mở rộng quy mô lớn các ứng dụng AI, từ đó kích thích nhu cầu tăng trưởng dài hạn đối với phần cứng như GPU.
    6. Biến số thực sự quan trọng là nếu các công ty AI hàng đầu (như OpenAI) áp dụng rộng rãi chú ý tuyến tính, cấu trúc nhu cầu phần cứng cho suy luận ngữ cảnh dài có thể thay đổi đáng kể.

原文作者:李佳

原文来源:华尔街见闻

月之暗面旗下大模型 Kimi K3 采用线性注意力机制,引发市场对英伟达、HBM 以及网络设备需求可能受到削弱的担忧。

不过,半导体研究机构 SemiAnalysis 近日给出了截然不同的判断:K3 庞大的参数规模和推理架构需求,不仅不会削弱高端 AI 硬件需求,反而可能进一步强化对英伟达高端 GPU、HBM 以及高速互联设备的需求。

SemiAnalysis 指出,K3 参数规模超过 2.8 万亿,模型权重容量超过 1.5TB HBM。即便在相对有限的用户并发场景下,KV 缓存仍需要大量卸载至 CPU DDR5 内存及 NVMe 存储,HBM 空间并不会出现明显富余。

更重要的是,月之暗面此前透露,K3 的高效推理部署需要至少 64 颗芯片组成的大规模扩展域架构。这一硬件需求与英伟达 GB200/GB300 NVL72 等机架级 AI 系统的设计方向高度匹配。

SemiAnalysis 认为,市场此前将线性注意力理解为“削弱 GPU 需求”的逻辑存在偏差。真正的影响可能恰恰相反:更高效的模型架构降低了 AI 推理成本,将推动更多应用落地,进而刺激 GPU、HBM、DRAM 以及网络基础设施的长期需求。

无惧线性注意力迭代,英伟达芯片需求依旧坚挺

市场担忧主要来自 Kimi K3 采用的 Kimi Delta Attention(KDA)机制。

相比传统 Transformer 注意力机制,KDA 能够显著降低 KV 缓存的数据传输需求,最高可减少约 10 倍的网络带宽压力。这一变化令部分投资者联想到 DeepSeek R1 发布后市场对 AI 硬件需求的担忧,认为模型效率提升可能降低对高端算力硬件的依赖。

但 SemiAnalysis 认为,这一判断忽视了大模型推理中的另一项核心需求——参数规模带来的计算和互联压力。

K3 拥有超过 2.8 万亿参数,其模型权重本身就需要依赖大规模分布式计算系统完成部署。与此同时,K3 采用 WideEP(Wide Expert Parallelism)优化策略,将 896 个专家模块分布到多颗 GPU 上,使单颗 GPU 仅需承载部分专家权重,从而提升计算利用率。

不过,WideEP 也带来了新的挑战:专家之间频繁的数据交换需要更强大的网络互联能力。SemiAnalysis 指出,GB200/GB300 NVL72 采用的铜背板互联架构,提供的机架内带宽达到传统 DGX B200 系统的 18 倍,非常适合这类大规模专家并行推理任务。

换言之,KDA 节省的 KV 缓存通信需求,可能被 WideEP 带来的权重交换需求部分抵消,整体 AI 基础设施压力并未明显下降。

64 颗芯片扩展域并非英伟达独家受益

不过,市场对此也存在不同声音。知情人士 GDP(@bookwormengr)指出,月之暗面提到的“64 颗芯片扩展域”并不一定意味着英伟达 NVL72 方案。华为昇腾 950 SuperPod 同样采用 64 颗芯片配置,并具备类似 NVLink 的统一总线(UB)内存扩展能力。

从架构能力看,昇腾 950 SuperPod 可支持跨 16 个机架扩展至 1024 颗 NPU,在满足大规模模型推理需求方面同样具备竞争力。因此,K3 带来的硬件需求增长,并不意味着英伟达将成为唯一受益者,但其对于高端 AI 互联系统的需求强化趋势仍然明确。

杰文斯悖论:AI 效率提升可能推动硬件需求增长

SemiAnalysis 进一步援引杰文斯悖论(Jevons' Paradox)解释 AI 基础设施趋势。

该理论认为,当某项技术提升资源利用效率、降低单位成本后,需求往往不会下降,反而可能因应用范围扩大而增长。应用到 AI 领域,线性注意力机制降低推理成本后,可能推动更多企业部署 AI 应用,使全球 AI 推理规模进一步扩大,最终带动 GPU、HBM、DRAM 以及高速网络设备需求增长。

不过,GDP 对此保持谨慎态度。他认可杰文斯悖论的长期逻辑,但指出,KDA 对于长上下文任务中的状态存储优化具有现实意义。即使模型权重规模巨大,由于采用 4bit 量化以及高度稀疏化设计,实际内存压力可能低于市场直觉。

他认为,真正值得关注的变量在于全球推理需求最大的 AI 公司——OpenAI、Anthropic 以及 Google DeepMind——是否已经或未来会采用类似 KDA、DeepSeek CSA/HCA 等线性注意力方案。如果头部 AI 公司大规模采用此类架构,长上下文推理对内存和互联资源的需求可能出现明显下降,这将成为影响未来 AI 硬件需求结构的重要因素。

市场关注点转向:AI 需求增长能否抵消架构效率提升

总体来看,Kimi K3 的出现并未简单指向 AI 硬件需求下降。对于英伟达而言,真正的竞争焦点可能从“单卡性能”转向“系统级能力”——包括高速互联、机架级扩展以及大规模推理优化。

随着模型规模持续扩大,即使注意力机制不断优化,AI 基础设施仍面临参数规模、专家并行、数据交换以及推理吞吐提升带来的压力。

未来市场需要关注的核心问题,不是线性注意力是否降低单项资源消耗,而是 AI 应用规模扩张带来的新增需求,能否持续超过架构效率提升带来的资源节省。

AI
Chào mừng tham gia cộng đồng chính thức của Odaily
Nhóm đăng ký
https://t.me/Odaily_News
Nhóm trò chuyện
https://t.me/Odaily_GoldenApe
Tài khoản chính thức
https://twitter.com/OdailyChina
Nhóm trò chuyện
https://t.me/Odaily_CryptoPunk