[ DATA_STREAM: FP8%E9%87%8F%E5%8C%96 ]

FP8量化

SCORE
8.8

性能狂飙:RTX 5060 Ti 实现 Qwen3.5 35B 极速推理,国产 MoE 架构潜力被彻底释放

TIMESTAMP // 7 月.24
#FP8量化 #RTX 5060 Ti #推理优化 #混合专家模型 #端侧AI

开发者近日在 Reddit 社区展示了名为 “Garlic” 的优化项目,通过开发专用的 Gated Delta Network 内核,成功在消费级显卡 RTX 5060 Ti 上以 55-61 tok/s 的惊人速度运行 Qwen3.5 35B (A3B) 模型。该性能表现不仅大幅超越了主流的 llama.cpp 框架,更标志着大模型端侧部署效率的新突破。 ▶ MoE 架构的效能红利:Qwen3.5 35B 采用 Mixture-of-Experts (MoE) 架构,单次推理仅需激活 3B 参数。通过 FP8 量化与特定内核优化,使得中端显卡也能跑出以往高端服务器级别的吞吐量。 ▶ 内核级优化的“降维打击”:Garlic 项目证明了针对特定网络结构(如 Gated Delta)编写底层 CUDA 内核,其效率远高于 llama.cpp 等追求通用性的推理后端。 ▶ 端侧 AI 交互体验的质变:60 tok/s 的推理速度意味着模型生成速度已远超人类阅读速度,为本地实时语音交互、复杂 Agent 逻辑推理扫清了硬件性能障碍。 八卦洞察 Qwen3.5 35B (A3B) 的设计初衷本就是为了平衡规模与效率,但 Garlic 项目的出现,实际上揭示了目前主流推理框架在处理 MoE 模型时仍存在巨大的优化空间。55 tok/s 的速度在 RTX 5060 Ti 这种“甜点级”显卡上实现,意味着大模型“平民化”的拐点已经到来。这不仅是硬件的胜利,更是底层软件栈(Software Stack)对算力压榨的极致体现。未来,端侧 AI 的竞争将从“谁的模型更大”转向“谁的内核更贴合硬件底层”。 行动建议 对于开发者而言,应密切关注针对 MoE 架构的专用推理引擎(如 Garlic 或类似的专用 Kernel),而非盲目依赖通用框架。企业在进行端侧 AI 选型时,应优先考虑 Qwen3.5 这种“小激活、大参数”的 MoE 模型,并配套 FP8 量化方案,以在有限的 VRAM 预算内实现最优的响应延迟。此外,建议关注 RTX 50 系列显卡在 FP8 计算上的原生支持,这将是未来一年端侧推理的硬件基准。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE