[ DATA_STREAM: NVME%E6%B5%81%E5%BC%8F%E4%BC%A0%E8%BE%93 ]

NVMe流式传输

SCORE
9.5

WASTE 引擎发布:通过 NVMe 流式传输,在消费级硬件上运行 2.7 万亿参数 Kimi K3

TIMESTAMP // 8 月.03
#Kimi K3 #NVMe流式传输 #推理引擎 #本地大模型 #混合专家模型

事件核心 近日,开源项目 WASTE(由 sqliteai 开发)在 LocalLLaMA 社区引发轰动。该项目提供了一个无依赖、可嵌入的 C 语言推理引擎,其核心突破在于允许用户在内存(RAM/VRAM)远低于模型规模的情况下,运行拥有 2.78 万亿参数的 Kimi K3 模型。WASTE 通过将模型主干驻留在内存,并直接从 NVMe 硬盘流式传输激活的专家权重(Activated Weights),配合有界专家缓存机制,彻底打破了超大规模混合专家模型(MoE)的本地运行门槛。 技术/商业细节 WASTE 的技术实现精准切中了 MoE 架构的特性。Kimi K3 虽然拥有近 2.8 万亿参数,但在推理每一 token 时,仅有极小比例的“专家”被激活。WASTE 引擎利用这一稀疏性,不再尝试将整个模型塞入显存,而是将 NVMe 存储作为“二级内存”。 流式推理机制: 引擎仅在推理路径需要特定专家权重时,才通过高速 I/O 从磁盘读取,实现了“按需加载”。 性能权衡: 虽然这种方式的推理速度受限于 NVMe 的读取带宽(相较于 HBM 或 DDR 慢数个数量级),但它解决了“能不能跑”的存量问题,使得在单机甚至工作站上研究超大规模模型成为可能。 架构优势: 作为一个纯 C 语言编写、零依赖的引擎,WASTE 极易集成到现有系统中,其轻量化的设计与 Kimi K3 庞大的体量形成了鲜明对比。 八卦分析:全球影响 「八卦号外」认为,WASTE 的出现标志着本地大模型(Local LLM)运动进入了“存储即计算”的新阶段。长期以来,英伟达通过 HBM 显存容量建立了严密的等级森严的算力市场,而 WASTE 这种“以空间换时间”的方案,实质上是在软件层面解构显存霸权。 从全球视角看,这为研究人员和极客提供了一种极低成本的“大模型考古”工具。Kimi K3 作为目前最强的国产 MoE 模型之一,其完整能力的释放不再局限于月之暗面的云端服务器。这种“去中心化”的推理趋势,将迫使硬件厂商重新审视 NVMe 与 CPU/GPU 之间的总线带宽优化,未来 U.2 接口和 PCIe 5.0 硬盘可能会成为 AI 工作站的标配,而非仅仅是显存。 战略建议 对于开发者: 应关注 MoE 模型的“权重路由”优化。如果能预测下一 token 可能激活的专家并提前预取(Prefetching),将极大缓解 NVMe 的延迟瓶颈。 对于企业: 在私有化部署超大规模模型时,不必盲目追求昂贵的 H100 集群。针对非实时、高吞吐的离线任务,利用 WASTE 类似的流式架构配合高性能存储阵列,可以实现极高的成本效益比。 对于硬件供应链: 关注“大容量、高随机读取”型 SSD 在 AI 推理市场的潜力,这可能催生出一类专门为 AI 推理优化的存储产品。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE