[ DATA_STREAM: NVIDIA-B300 ]

NVIDIA B300

SCORE
9.2

2.8T 巨兽落地:在 8x B300 上实测 Kimi K3,单价每百万 Token 约 190 美元

TIMESTAMP // 8 月.23
#Blackwell #Kimi K3 #MXFP4量化 #NVIDIA B300 #大模型推理

核心事件 开发者在 Modal 平台上利用 8 张 NVIDIA B300 GPU 成功部署了拥有 2.8 万亿参数的 Kimi K3 模型,通过原生 MXFP4 量化与 vLLM 框架,实现了 92 tok/s 的稳定推理速度,标志着超大规模模型在 Blackwell 架构下的私有化部署进入实操阶段。 ▶ Blackwell 架构的性能红利: 凭借 B300 的 192GB HBM3e 显存,8 卡集群即可承载 1.56 TB 的模型权重,MXFP4 量化在保持精度的同时显著提升了吞吐量。 ▶ 成本与效率的权衡: 虽然 $190/M tokens 的成本远高于商业 API,但 0.92s 的首字延迟(TTFT)证明了 Blackwell 在处理超大规模 MoE 模型时的卓越响应能力。 八卦洞察 这次实测揭示了 AI 基础设施的一个残酷现实:超大规模模型(2T+ 参数)的“准入门槛”正在被 Blackwell 重新定义。过去需要数个 H100 节点才能跑起来的 Kimi K3,现在单机 8 卡 B300 即可流畅运行。值得注意的是,MXFP4 正在取代 FP8 成为超大模型推理的新标准,它在压缩率与计算精度之间找到了极佳的平衡点。此外,冷启动加载 1.56 TB 数据耗时 27 分钟,说明在追求推理速度的同时,存储 I/O 和网络带宽已成为限制大模型即时弹性的主要瓶颈。 行动建议 对于追求极致性能的企业,应优先布局支持原生 MXFP4 的 Blackwell 集群,以获得最佳的能效比。对于预算敏感型开发者,建议关注 Unsloth 推出的动态 GGUF 方案,其 1-bit 版本能将 2.8T 模型的显存占用压缩至 600GB 以下,使更低端的硬件环境也能参与超大模型的测试与微调。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE