[ INTEL_NODE_31505 ] · PRIORITY: 9.2/10

284B MoE 性能巅峰:双 DGX Spark 跑出 75 tok/s,DeepSeek-V4-Flash 生产级部署方案详解

  PUBLISHED: · SOURCE: Reddit LocalLLaMA →
[ DATA_STREAM_START ]

核心事件

近日,技术社区披露了 DeepSeek-V4-Flash-0731(284B MoE)在两台 DGX Spark 节点上的生产级部署实战。通过 QSFP DAC 直连、vLLM 框架、投机解码(Speculative Decoding)以及 NVFP4 量化优化,该方案成功将这一超大规模模型的推理速度推至 74.8 tok/s,并提供了包含 11 个核心避坑指南的完整开源工具链。

  • 极致性能压榨: 利用 NVFP4 优化与投机解码技术,在双节点集群上实现了接近实时的高吞吐量,打破了 200B+ 规模模型在非超算集群上的推理瓶颈。
  • 工业级稳定性: 方案不仅关注速度,还解决了集群重启后的自动恢复(Reboot-proof)及 Codex CLI 集成,标志着 DeepSeek 部署从“实验室脚本”转向“企业级基础设施”。

八卦洞察

DeepSeek-V4-Flash 的这次部署实战,本质上是开源社区对大模型“推理成本墙”的一次成功突围。284B 的 MoE 架构以往被认为是私有化部署的噩梦,但通过 NVFP4(NVIDIA 4位浮点格式)的引入,显存占用与计算效率达到了新的平衡点。值得注意的是,开发者强调了“11 个避坑要点”,这反映出多节点推理(Multi-node Inference)中网络拓扑和驱动兼容性依然是最大的隐形杀手。DeepSeek 正在通过其极高的性价比,逼迫企业从单纯的“买算力”转向“精细化工程调优”。

行动建议

  • 拥抱 NVFP4 量化: 对于拥有最新 NVIDIA 硬件的企业,应优先评估 NVFP4 格式,它在保持模型精度的同时,能显著降低 MoE 模型的显存带宽压力。
  • 重视网络拓扑优化: 多节点部署时,QSFP DAC 的直连配置优于传统的交换机连接,能有效降低节点间通信延迟。
  • 构建自动化运维链: 引入类似 Codex CLI 的集成方案,解决模型服务在生产环境中的自愈与监控问题。
[ DATA_STREAM_END ]
[ ORIGINAL_SOURCE ]
READ_ORIGINAL →
[ 02 ] RELATED_INTEL