Argonaut Labs 近期发布的 Deltafin 项目引发了技术圈震动。该项目通过利用四块外置 SSD 进行权重流式传输(Weight Streaming),成功在普通的 MacBook Pro 上运行了拥有 2.8 万亿参数的 Kimi K3 模型,推理速度达到 1 token/s。
▶ 突破“显存墙”:SSD 流式推理技术将推理瓶颈从昂贵的显存容量转移到了存储带宽,为超大规模模型在边缘端的平民化铺平了道路。
▶ 异构推理新范式:通过多通道 SSD 并行读取,Deltafin 证明了在非 H100 集群上运行万亿级参数模型的可行性,预示着“大模型个人化”时代的加速到来。
八卦洞察
这不仅仅是一个技术 Demo,它本质上是对 Nvidia “显存税”的一次有力回击。长期以来,运行万亿参数模型被认为是顶级 GPU 集群的特权。Deltafin 的出现证明了:当推理任务对延迟不极度敏感时(如深度阅读、长文档分析),存储带宽(NVMe)可以替代部分显存功能。1 token/s 的速度虽然无法满足实时对话,但在异步处理、私有化知识库索引等场景下已具商用价值。这意味着大模型的“准入门槛”正在从算力垄断转向工程优化,未来存储硬件厂商(如三星、海力士)在 AI 版图中的话语权将显著提升。
行动建议
对于企业级开发者,建议立即评估基于存储流式的异步推理方案,特别是在处理长文本(Long Context)或 RAG 任务时,这能极大降低硬件成本。硬件采购方面,应关注 PCIe 5.0/6.0 接口及高带宽 NVMe 阵列的配置,而非盲目追求高显存 GPU。对于 AI 创业者,这是一个切入“本地化巨型模型”应用的新机会点。
SOURCE: HACKERNEWS // UPLINK_STABLE