[ INTEL_NODE_31157 ] · PRIORITY: 9.2/10

DeepSeek-V4-Flash 284B 现身 5.3GB 内存设备:Mference 引擎开启“SSD 串流专家”时代

  PUBLISHED: · SOURCE: Reddit LocalLLaMA →
[ DATA_STREAM_START ]

开发者近日发布了名为 Mference 的全新推理引擎,继 Qwen 3.6 移植成功后,再次刷新了端侧 AI 的极限:通过从 SSD 实时串流 MoE 专家参数,实现了在仅 5.3GB 内存的设备上运行拥有 284B 参数规模的 DeepSeek-V4-Flash 模型。

  • 技术范式转移:该引擎沿用了 TurboFieldfare 的思路,利用混合专家模型(MoE)单 token 仅激活极少数参数的特性,将共享核心与 KV 缓存驻留内存,而将海量专家参数存储于 SSD,实现按需加载。
  • 性能表现惊人:在 M5 Pro 芯片上,Gemma 2 26B-A4B 模型仅需约 2GB 内存即可运行,且推理速度高达 31-35 tok/s,证明了 SSD 串流方案在实用化道路上的巨大潜力。

八卦洞察

这一突破标志着端侧 AI(Edge AI)进入了“显存/内存与存储解耦”的新阶段。长期以来,大模型的普及受限于昂贵的 HBM 或统一内存容量,而 Mference 证明了通过精密的 I/O 调度和 MoE 的稀疏性,消费级 SSD 也能充当“虚拟显存”。这不仅是技术的胜利,更是对英伟达等硬件厂商“内存溢价”策略的底层解构。当 284B 规模的模型可以在平板电脑上流畅运行时,大模型平民化的临界点已经到来。

行动建议

对于硬件厂商,应加速推进高带宽 SSD(如 PCIe 5.0+)与 SoC 的直连优化,存储性能将成为 AI PC 的核心竞争力;对于开发者,应重点转向 MoE 架构的动态加载优化,而非盲目追求全量参数量化压缩;对于企业,可重新评估在低配终端部署私有化大模型的可行性,大幅降低硬件采购成本。

[ DATA_STREAM_END ]
[ ORIGINAL_SOURCE ]
READ_ORIGINAL →
[ 02 ] RELATED_INTEL