1. 月之暗面发布Kimi K3模型,其线性注意力机制(KDA)降低了KV缓存需求,引发对英伟达GPU、HBM和网络需求下滑的担忧。
2. 但SemiAnalysis分析指出,K3拥有超过2.8万亿参数,权重要占用超1.5TB HBM,需多GPU分布式存储;采用的WideEP优化将896个专家分布到多GPU上,反要强化网络带宽,尤其适合NVL72等铜背板高带宽系统。
3. 英伟达的GB200/GB300 NVL72因18倍于DGX B200的带宽而受益,大模型推理成本降低会刺激更多AI采用,最终推高整体GPU和网络需求。
4. 新人须知:模型参数规模越大,越需要大容量HBM和多GPU互联,网络成为瓶颈,这正是英伟达NVLink和机架级系统的优势所在。
[1] [2] [3] [4] [5] [6] [7] [8]