[ DATA_STREAM: GPU%E7%AE%97%E5%8A%9B ]

GPU算力

SCORE
9.6

AMD MI350X 算力觉醒:开源内核助力 Qwen3.6 实现 7.8 万代币/秒推理吞吐

TIMESTAMP // 8 月.26
#AMD MI350X #GPU算力 #开源内核 #推理优化 #通义千问

事件核心 在 AI 基础设施领域,NVIDIA 的统治地位正面临来自开源社区与 AMD 硬件协同的强力挑战。最新技术报告显示,通过针对 AMD MI350X 优化的开源内核,Qwen3.6-35B-A3B 模型在 8 卡并行环境下实现了惊人的 78,498 output tokens/s 推理吞吐量。这一数据不仅证明了 AMD MI350X 在原始算力(TFLOPS)和内存带宽上超越 NVIDIA B200 的潜力,更揭示了通过底层软件优化弥合 ROCm 与 CUDA 生态差距的可行路径。 技术/商业细节 本次性能突破的核心在于对 Qwen3.6-35B-A3B 这一混合专家模型(MoE)的深度定制。该模型虽有 35B 总参数,但推理时仅激活约 3B 参数,这为高并发处理提供了天然优势。在 AMD MI350X 集群上,开发者利用开源内核优化了注意力机制与专家路由(Expert Routing)的计算效率。MI350X 凭借其领先的 HBM3e 内存容量与带宽,在处理大规模并发请求时展现了极高的吞吐上限。相比之下,虽然 NVIDIA 的 TensorRT-LLM 依然在易用性上领先,但在特定开源内核的加持下,AMD 硬件在每秒处理代币数(TPS)这一核心指标上已具备与 Blackwell 架构正面硬刚的实力。 八卦分析:全球影响 「八卦情报」认为,这一事件标志着 AI 算力市场进入了“后 CUDA 时代”的转折点。长期以来,AMD 硬件被戏称为“沉睡的巨人”,其硬件参数华丽却因软件栈(ROCm)的羸弱而难以发挥。然而,随着 Triton 等硬件无关编程语言的普及以及社区对开源内核的持续贡献,NVIDIA 的“软件护城河”正在被蚕食。对于全球云服务商(CSP)而言,MI350X 的这种表现提供了极佳的议价筹码。如果 AMD 能持续通过开源路径解决兼容性与性能释放问题,算力市场的双雄格局将从“纸面对比”真正转化为“落地竞争”。此外,Qwen3.6 作为中国顶尖开源模型的代表,在美系最强非核算力芯片上的极致表现,也体现了全球 AI 产业链在底层技术上的深度交织。 战略建议 算力采购方: 建议在未来的推理集群扩容中,将 AMD MI350X 纳入灰度测试范围,尤其是在高并发、低延迟的 MoE 模型推理场景下,其性价比潜力巨大。 模型开发者: 关注并投入 Triton 或特定硬件的开源内核开发。依赖单一供应商的优化库(如 TensorRT)会带来长期的技术债,拥抱跨平台内核是保持竞争力的关键。 企业决策层: 评估“软件定义算力”的风险。硬件差距正在缩小,未来的核心竞争力将在于谁能更快地在异构芯片上完成模型算子的适配与调优。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE