月之暗面(Moonshot AI)的旗舰大模型 Kimi K3(参数量达 2.8T)近日在 16 路 GB10(Blackwell)集群上展现了惊人的推理性能,通过深度定制的运行时补丁与网络优化,其代码生成吞吐量稳定在 30 tok/s,并发峰值高达 136 tok/s。
▶ 超大规模模型的平民化推理:2.8T 参数级别的模型在高性能集群上已能实现商用级的响应速度,打破了“万亿参数模型不可实时推理”的迷思。
▶ 软硬一体优化的代差优势:单纯依靠硬件堆叠已不足以支撑 Blackwell 的算力释放,自定义运行时补丁(Runtime Patches)成为压榨硬件极限的关键。
八卦洞察
Kimi K3 达到 2.8T 的参数规模,这几乎可以确定其采用了极其复杂的 MoE(混合专家)架构。在 16 路 GB10 集群上跑出 30 tok/s 的代码生成速度,意味着 Moonshot 在算子融合与跨节点通信(NCCL/NVLink)优化上走在了行业前列。GB10(Blackwell 架构)的 FP4/FP6 推理能力在这一案例中得到了充分验证。对于全球 AI 竞争而言,这标志着大模型竞赛已从“参数量比拼”转向“高吞吐、低延迟的工程落地比拼”。如果 2.8T 模型能够维持 136 tok/s 的并发峰值,其单位 Token 的推理成本将大幅下降,直接威胁到中小型稠密模型的生存空间。
行动建议
基础设施侧:企业在部署 Blackwell 集群时,应重点评估网络拓扑与分布式推理框架(如 vLLM 或 TensorRT-LLM)的定制化能力,而非仅仅关注显存容量。
模型策略:开发者应关注 MoE 架构在大规模集群上的负载均衡问题,Kimi K3 的案例证明了“大模型+高性能集群+深度优化”是通往 AGI 推理的必经之路。
技术跟进:密切关注针对 Blackwell 架构的自定义 Kernel 开发,这是在同等算力下实现 2-3 倍性能提升的“秘密武器”。
SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE