[ INTEL_NODE_32847 ]
· PRIORITY: 8.8/10
2018年“性能怪兽”复活:IBM AC922 运行 Qwen 预填充速度突破 7,300 tk/s
●
PUBLISHED:
· SOURCE:
Reddit LocalLLaMA →
[ DATA_STREAM_START ]
核心事件
一名开发者通过深度修改 Strata(Opus 5.5 分叉版),成功在 2018 年发布的 IBM AC922 服务器上实现了惊人的推理性能。搭载两颗 POWER9 处理器及 4 块 NVIDIA Tesla V100 GPU 的老旧设备,在运行 Qwen3.8-FN (UD-Q4_K_XL) 模型时,预填充(Prefill)速度达到 7,357 tk/s,解码(Decode)速度为 113 tk/s。该成果的核心在于充分利用了 IBM 独特的 CPU-GPU NVLink 互联技术。
- ▶ 打破 x86 瓶颈: 传统的 llama.cpp 在 POWER9 架构上因缺乏 AVX 指令集而表现不佳,该分叉版通过底层优化绕过了这一限制。
- ▶ NVLink 的降维打击: AC922 支持 150GB/s 的 CPU-GPU 带宽,远超当代 PCIe 方案,使得统一内存(Unified Memory)在处理大上下文时具备极高效率。
八卦洞察
这并非简单的“老树发新芽”,而是一次对硬件底层拓扑结构的深刻利用。在当前 H100 难求的背景下,这项实验揭示了一个被忽视的真相:大模型推理的瓶颈往往不在算力(TFLOPS),而在带宽。IBM AC922 这种 6 年前的“过气”旗舰,凭借其超前的 NVLink CPU-GPU 直接互联架构,在预填充阶段(即 RAG 检索增强生成的关键环节)依然能秒杀许多现代消费级多卡方案。这说明,针对特定非 x86 架构的软件重构,可以释放出巨大的存量算力价值。
行动建议
对于持有旧款企业级 HPC 集群(如搭载 V100/POWER9 的节点)的机构,不应盲目将其报废。建议:1. 针对 RAG 等高预填充需求的业务场景,开发或引入适配底层架构(如 UMA 统一内存)的定制化推理后端;2. 关注 Strata 等高性能推理框架在非标准架构上的移植性,以较低成本构建高吞吐量的私有化模型服务。
[ DATA_STREAM_END ]
[ ORIGINAL_SOURCE ]
READ_ORIGINAL →
[ 02 ]
RELATED_INTEL
粤公网安备44030002003366号