核心事件
开发者在 Modal 平台上利用 8 张 NVIDIA B300 GPU 成功部署了拥有 2.8 万亿参数的 Kimi K3 模型,通过原生 MXFP4 量化与 vLLM 框架,实现了 92 tok/s 的稳定推理速度,标志着超大规模模型在 Blackwell 架构下的私有化部署进入实操阶段。
▶ Blackwell 架构的性能红利: 凭借 B300 的 192GB HBM3e 显存,8 卡集群即可承载 1.56 TB 的模型权重,MXFP4 量化在保持精度的同时显著提升了吞吐量。
▶ 成本与效率的权衡: 虽然 $190/M tokens 的成本远高于商业 API,但 0.92s 的首字延迟(TTFT)证明了 Blackwell 在处理超大规模 MoE 模型时的卓越响应能力。
八卦洞察
这次实测揭示了 AI 基础设施的一个残酷现实:超大规模模型(2T+ 参数)的“准入门槛”正在被 Blackwell 重新定义。过去需要数个 H100 节点才能跑起来的 Kimi K3,现在单机 8 卡 B300 即可流畅运行。值得注意的是,MXFP4 正在取代 FP8 成为超大模型推理的新标准,它在压缩率与计算精度之间找到了极佳的平衡点。此外,冷启动加载 1.56 TB 数据耗时 27 分钟,说明在追求推理速度的同时,存储 I/O 和网络带宽已成为限制大模型即时弹性的主要瓶颈。
行动建议
对于追求极致性能的企业,应优先布局支持原生 MXFP4 的 Blackwell 集群,以获得最佳的能效比。对于预算敏感型开发者,建议关注 Unsloth 推出的动态 GGUF 方案,其 1-bit 版本能将 2.8T 模型的显存占用压缩至 600GB 以下,使更低端的硬件环境也能参与超大模型的测试与微调。
SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE