核心事件
在最新的 NVIDIA GB300 NVL72 集群测试中,拥有 2.4 万亿参数的 Qwen 3.8 模型在 FP8 精度下实现了惊人的推理表现:全集群总吞吐量达到 28.8 万 tokens/s,单 GPU 速率突破 4k tokens/s,单用户响应速度超过 350 tokens/s。
▶ 硬件互联的质变:GB300 NVL72 通过 72 颗 Blackwell GPU 的全互联架构,彻底消除了万亿级参数模型在节点间的通信瓶颈。
▶ FP8 生产力基准:无需额外微调即可在 FP8 精度下保持高性能,标志着超大规模模型从“实验室跑通”正式进入“工业化高并发”阶段。
八卦洞察
这次性能数据的流出,本质上宣告了“万亿参数模型推理难”的时代已经终结。以往 2.4T 级别的模型(如疑似 GPT-4 规模)在推理时往往面临极高的延迟和显存碎片化问题,但 GB300 NVL72 的第五代 NVLink 技术将 72 颗 GPU 虚拟化为一颗巨大的“超级 GPU”。
值得注意的是,单用户 350 tokens/s 的速度远超人类阅读极限(约 5-10 tokens/s),这意味着算力冗余将直接转化为更复杂的推理链(CoT)或多智能体(Multi-agent)实时协作。Qwen 3.8 在该架构上的表现,证明了国产顶级模型在 Blackwell 生态下的适配效率已达世界一流水平,算力霸权正在从单纯的显存堆砌转向“互联带宽”的降维打击。
行动建议
算力选型:对于追求万亿级 MoE 或密集模型实时响应的企业,应优先评估 GB300 NVL72 的 TCO 优势,而非单纯采购 H100 散卡。
架构优化:由于单卡吞吐量已达 4k+ tokens/s,开发者应将优化重心从“算子加速”转向“KV Cache 管理”和“高并发调度”,以充分喂饱 Blackwell 的吞吐胃口。
模型策略:鉴于 FP8 无损推理的成熟,建议在模型预训练阶段即考虑 FP8 兼容性,以实现从训练到推理的无缝切换。
SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE