[ DATA_STREAM: BLACKWELL ]

Blackwell

SCORE
8.8

算力霸权松动?Kimi K3 在 AMD MI355X 上的性价比超越 NVIDIA B300

TIMESTAMP // 8 月.02
#AMD MI355X #Blackwell #Kimi K3 #大模型推理 #性价比

Y Mode: 核心洞察 本文深入分析了 Moonshot AI 的 Kimi K3 模型在 AMD 下一代 MI355X 加速器上的推理表现,结果显示其单位成本性能(Performance per Dollar)已超越 NVIDIA Blackwell 架构的 B300。 ▶ 显存带宽与容量成为胜负手: Kimi K3 作为复杂的混合专家模型(MoE),对显存吞吐极其敏感。AMD MI355X 凭借更高规格的 HBM3e 配置,在处理大规模并发推理时展现出比 B300 更高的硬件利用率。 ▶ 推理市场的“去 NVIDIA 化”拐点: 随着模型架构向 MoE 演进,算力瓶颈从单纯的算力(FLOPS)转向存储带宽。AMD 的策略是通过冗余的硬件参数对冲 NVIDIA 的 CUDA 生态优势,为大模型厂商提供更具性价比的备选方案。 八卦洞察 AMD 正在复刻其在 CPU 领域对阵 Intel 的“性价比奇袭”。在 AI 推理成本占据大模型运营 80% 以上成本的背景下,MI355X 的表现证明了在特定模型架构(如 Kimi K3)下,NVIDIA 的溢价能力正在被削弱。这不仅是硬件的胜利,更是 AMD ROCm 软件栈在特定模型优化上追赶 CUDA 的阶段性成果。 行动建议 对于算力需求巨大的 AI 实验室及云服务商,建议立即启动对 AMD MI300/355 系列的 POC(概念验证)测试,特别是针对 MoE 架构模型。在供应链层面,应建立多供应商策略(Multi-vendor strategy),利用 AMD 的性价比优势作为与 NVIDIA 谈判的筹码,以降低长期推理成本。 Z Mode: 深度分析 事件核心 近日,关于 Kimi K3 模型在 AMD MI355X 上的基准测试数据引发了行业震动。数据显示,在运行 Moonshot AI 最新的 Kimi K3 模型时,AMD MI355X 的推理吞吐量与成本比值优于 NVIDIA 的 Blackwell B300。这一发现打破了“高端 AI 推理必须依赖 NVIDIA”的思维定式,标志着 AI 算力市场进入了真正的双强竞争阶段。 技术/商业细节 Kimi K3 推理表现的差异主要源于硬件设计的底层逻辑。Kimi K3 采用了典型的 Mixture of Experts (MoE) 架构,这类模型在推理时需要频繁调用不同的专家模块,对显存带宽(Memory Bandwidth)和显存容量(Memory Capacity)的要求远高于传统的 Dense 模型。AMD MI355X 搭载了高达 288GB 的 HBM3e 显存,带宽突破 8TB/s,这使得它在处理超长上下文(Long Context)和高并发请求时,能够减少数据交换的延迟。相比之下,NVIDIA B300 虽然在 FP4/FP6 算力上具有优势,但在显存容量与带宽的配比上显得更为克制。在实际的推理场景中,计算单元往往在等待数据传输,导致 B300 的算力利用率(MFU)未能完全释放,而 MI355X 则凭借“大水管”效应实现了更高的有效吞吐。 八卦分析:全球影响 从全球 AI 产业格局来看,这一结果具有深远的政治与经济意义。首先,对于像 Moonshot AI 这样追求极致推理效率的中国厂商,AMD 提供的不仅是性价比,更是供应链的韧性。在 NVIDIA 高端芯片受限的大背景下,AMD 的高性能表现为全球大模型开发者提供了一条“非绿阵营”的高效路径。其次,这预示着 AI 芯片的竞争焦点正在从“峰值算力”转向“推理能效比”。如果 AMD 能够持续在软件层面(ROCm)缩小与 CUDA 的易用性差距,NVIDIA 的护城河将面临自 A100 发布以来最大的挑战。硅谷的顶级 VC 们已经开始重新评估那些基于 AMD 算力构建的 AI 初创公司的资产价值。 战略建议 1. 技术栈迁移评估: 企业应评估其模型架构与 AMD 硬件的适配度。如果业务核心是基于 MoE 或长文本处理,转向 AMD 平台可能带来 30%-50% 的 TCO(总拥有成本)下降。2. 软件定义算力: 开发者应关注 vLLM、Triton 等跨平台推理框架,通过软件抽象层屏蔽底层硬件差异,实现算力的灵活调度。3. 关注二级市场: 随着 MI355X 的量产,AMD 在数据中心业务的毛利率有望进一步提升,建议投资者关注其在推理市场份额的实质性突破。

SOURCE: HACKERNEWS // UPLINK_STABLE
SCORE
8.8

Blackwell 架构 + FP4 量化实测:vLLM 吞吐量突破 2000 tps,开启低精度推理新纪元

TIMESTAMP // 7 月.05
#Blackwell #FP4量化 #vLLM #吞吐量 #多模态推理

核心事件近日,来自 LocalLLaMA 社区的 vLLM 运行日志揭示了 NVIDIA Blackwell 架构在 FP4(nvfp4)精度下的惊人性能。在 30 个并发流的批量图像标注测试中,Blackwell 展现了极高的吞吐效率:Prompt 处理平均达到 1301.0 tokens/s,而生成阶段平均吞吐量高达 1924.0 tokens/s。这一数据证明了 Blackwell 在处理复杂多模态任务时的算力统治力。▶ FP4 精度成为性能倍增器:通过 nvfp4 量化,Blackwell 在保持模型能力的条件下,显著降低了显存占用并提升了计算吞吐,是实现 2000 tps 级别的关键。▶ 并发饱和度是释放算力的核心:测试通过 30 个并发流成功压榨了 Blackwell 的计算资源,展示了该架构在大规模推理集群中的扩展潜力。▶ 缓存机制显著优化二次请求:利用 vLLM 的缓存机制,后续请求的生成效率明显高于初始 Prompt 处理,验证了 KV Cache 优化在多模态流水线中的价值。八卦洞察「Bagua Intelligence」认为,这次实测数据不仅仅是数字的堆砌,它标志着大模型推理正式进入“极低精度”时代。Blackwell 对 FP4 的原生硬件支持,解决了以往量化带来的精度损失与计算增益之间的平衡难题。2000 tps 的生成速度意味着多模态 Agent(如实时视频理解、大规模图像索引)的运营成本将下降一个数量级。这对于追求高吞吐、低延迟的云服务商和垂直领域 AI 厂商来说,Blackwell 不是“可选项”,而是维持竞争力的“必选项”。行动建议1. 算力升级预研:建议高频多模态应用开发者立即评估从 H100 向 Blackwell 迁移的成本效益比,重点关注 FP4 量化对特定业务模型的精度影响。2. 优化并发策略:在 Blackwell 环境下,传统的低并发模式无法发挥硬件优势,应重新设计推理架构以支持更高维度的并发流。3. 强化缓存管理:针对图像标注等重复性 Prompt 场景,深度优化 KV Cache 策略以进一步提升吞吐上限。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE
SCORE
9.2

智谱GLM5.2在AMD MI355X上跑出2626 tok/s:性价比两倍于Blackwell,算力格局迎来临界点

TIMESTAMP // 7 月.04
#AMD MI355X #Blackwell #大模型推理 #智谱AI #算力性价比

核心事件 Wafer.ai 的最新基准测试显示,智谱 AI 的 GLM5.2 模型在 AMD Instinct MI355X 加速器上实现了单节点 2626 tokens/s 的惊人吞吐量。在同等推理性能下,其部署成本仅为 NVIDIA Blackwell (B200) 架构的一半以上,标志着 AMD 在高端 LLM 推理市场正式具备了颠覆性的竞争力。 ▶ 性能跨越:MI355X 凭借卓越的 HBM3e 内存带宽和容量,在处理 GLM5.2 等长文本、高参数模型时展现出极高的吞吐效率。 ▶ 成本优势:通过对比 TCO(总拥有成本),AMD 方案在单位 Token 成本上比 NVIDIA Blackwell 架构高出 2 倍以上的性价比,直接挑战了绿色阵营的定价权。 ▶ 生态兼容:此次测试证明了 ROCm 软件栈与国产顶尖大模型(智谱 GLM 系列)的深度适配已趋于成熟,打破了 CUDA 的绝对垄断。 八卦洞察 「八卦智库」认为,这不仅仅是一次跑分胜出,而是 AI 算力从“稀缺溢价”转向“能效竞争”的转折点。长期以来,市场对 AMD 的质疑集中在软件生态和实战性能上,但 GLM5.2 与 MI355X 的结合证明了在特定推理场景下,硬件参数的领先(尤其是内存带宽)可以直接转化为商业上的成本优势。随着 Blackwell 供应受限且价格高企,AMD 正在通过“性价比暴力”撕开超大规模云厂商和头部 AI 实验室的防线。 行动建议 对于算力需求方,建议立即启动对 AMD MI300/355 系列的兼容性测试,尤其是在推理侧,2 倍的成本缩减意味着商业闭环的难度降低了一半。对于开发者,应关注跨平台内核优化工具(如 Wafer.ai 提供的方案),减少对 CUDA 专有库的依赖,以获取更灵活的硬件议价能力。

SOURCE: HACKERNEWS // UPLINK_STABLE
SCORE
8.8

英伟达发布 Qwen3.6-27B-NVFP4:Blackwell 时代的 4-bit 量化新标杆

TIMESTAMP // 6 月.30
#Blackwell #Qwen #大模型 #英伟达 #量化技术

核心事件 英伟达(NVIDIA)正式在 Hugging Face 平台发布了 Qwen3.6-27B-NVFP4 模型。该模型采用了英伟达最新的 NVFP4(4-bit Floating Point)量化技术,旨在充分榨取 Blackwell 架构 GPU 的硬件算力,标志着超低比特推理从实验室走向主流应用的关键一步。 ▶ Blackwell 算力释放: NVFP4 是英伟达 Blackwell 架构的核心特性之一,相比传统的 INT4 或 FP8,它能在保持更高精度的同时,显著提升推理吞吐量。 ▶ Qwen 成为“一等公民”: 英伟达亲自下场为 Qwen 模型进行量化优化,证明了通义千问在国际开源生态中的核心地位,以及英伟达“硬件+模型”深度绑定的战略。 ▶ 27B 参数的“甜点位”: 27B 规模的模型在 NVFP4 压缩下,能够以极低的显存占用实现媲美更大规模模型的性能,是企业级边缘计算和本地 RAG 的理想选择。 八卦洞察 英伟达此次发布不仅仅是更新了一个模型权重,更是一次对 Blackwell 硬件生态的“催熟”。长期以来,量化模型(如 GGUF、EXL2)多由社区驱动,而英伟达亲自发布 NVFP4 格式,是在定义下一代工业级量化标准。NVFP4 相比 INT4 拥有更好的动态范围,这解决了大模型在低比特下容易出现的“精度崩塌”问题。通过将 Qwen 这一顶级开源模型作为载体,英伟达正在迫使软件栈(如 TensorRT-LLM)加速对新硬件特性的适配,从而巩固其在 AI 推理市场的统治地位。 行动建议 对于开发者和企业架构师,建议立即关注 Blackwell 架构的采购进度,并评估现有推理框架对 NVFP4 的支持情况。如果你的业务场景涉及高并发的本地化部署,Qwen3.6-27B-NVFP4 可能是目前性能与成本平衡的最佳方案。此外,建议算法团队开始研究 FP4 微调技术,以应对即将到来的超低比特训练与推理一体化趋势。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE
SCORE
8.5

英伟达 GB300 Grace Blackwell Ultra 价格曝光:定义 AI 算力的新溢价时代

TIMESTAMP // 6 月.02
#AI硬件 #Blackwell #大模型 #算力成本 #英伟达

事件核心英国知名零售商 Scan.co.uk 近期上线了英伟达 GB300 Grace Blackwell Ultra 工作站的相关页面,虽然具体价格信息在曝光后引发了行业热议,但这标志着 Blackwell 架构的最强“Ultra”版本已正式进入分销渠道。GB300 作为 Grace-Blackwell 超级芯片的高性能迭代,旨在为本地大模型(Local LLM)开发、复杂机器人仿真及高端 AI 研究提供极致的算力支撑。▶ 性能与规格的极致化: GB300 重点强化了对 FP4 精度支持及 HBM3e 内存容量,其吞吐量相较于前代 H100/H200 有量级提升。▶ 全栈集成的标准化: 此次曝光再次确认了英伟达将 Grace CPU 与 Blackwell GPU 深度绑定的战略,单芯片销售正逐渐向全系统集成模式转型。八卦洞察从「八卦智库」的角度看,GB300 的定价策略不仅是硬件成本的反映,更是英伟达对“算力稀缺性”的二次收割。通过冠以“Ultra”后缀,英伟达成功在 Blackwell 序列中开辟了一个超高端生态位。这不仅仅是技术升级,更是为了应对 HBM3e 供应链成本上涨而进行的利润对冲。对于企业而言,GB300 的出现意味着本地部署 SOTA 模型的门槛再次被拉高,英伟达正在通过硬件性能的绝对领先,迫使开发者在“昂贵的本地算力”与“受限的云端 API”之间做出艰难抉择。行动建议1. 算力规划: 建议正在进行千亿级参数模型微调的企业,优先评估 GB300 的单位能效比(Performance per Watt),其在长期运行中的电力节省可能抵消高昂的采购溢价。2. 供应链预警: 鉴于 Blackwell 架构的产能仍受限于 CoWoS 封装,有意向采购的机构应尽早进入供应商排队序列,避免因供应短缺导致的研发停滞。3. 架构选型: 评估业务对 FP4 精度的依赖程度,若主要任务为传统 FP16 推理,可考虑性价比更高的 H200 二手或租赁方案。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE
SCORE
8.8

英伟达官宣 Qwen3.6-35B NVFP4 量化版:算力巨头深度背书,Blackwell 推理生态再下一城

TIMESTAMP // 5 月.31
#Blackwell #Qwen3.6 #混合专家模型 #英伟达 #量化技术

核心事件 英伟达(NVIDIA)正式在 Hugging Face 发布了基于阿里巴巴 Qwen3.6-35B-A3B 的 NVFP4 量化版本。该模型利用 NVIDIA Model Optimizer 工具,通过训练后量化(PTQ)技术,将原本的权重压缩至 4 位浮点(FP4)精度。这不仅是 Qwen3.6 系列在国际算力生态中的重要进展,也标志着英伟达正在加速将其最新的 Blackwell 架构特性(原生支持 FP4)推向主流开源模型市场。 ▶ 架构协同:Qwen3.6-35B-A3B 采用 MoE(混合专家)架构,总参数 35B,激活参数仅为 3B。NVFP4 的引入使其在保持极高性能的同时,显存占用大幅下降,单卡推理门槛进一步降低。 ▶ 软硬一体优化:此次发布并非简单的格式转换,而是通过英伟达官方量化工具链进行的深度适配,旨在最大化 Tensor Core 在 FP4 模式下的吞吐量表现。 八卦洞察 英伟达此举释放了一个强烈的信号:Qwen 已经成为全球推理侧事实上的“一等公民”。在 Blackwell 架构大规模铺货前夕,英伟达急需高质量、高性能的开源模型来展示其 FP4 硬件加速的优越性。选择 Qwen3.6 而非其他模型,证明了阿里在 MoE 架构上的领先性已获得全球算力霸主的底层认可。对于开发者而言,这预示着“低比特推理”将从实验室走向大规模生产环境,FP4 可能很快会取代 FP8 成为平衡精度与效率的新黄金标准。 行动建议 1. 硬件升级预研:建议正在使用 A100/H100 的企业关注 Blackwell (B200/GB200) 的迁移路径,NVFP4 将是实现推理成本减半的关键。 2. 模型选型转向:对于追求高吞吐、低延迟的 RAG 或 Agent 应用,应优先评估 Qwen3.6-35B-A3B 的 FP4 版本,其 3B 激活参数在 NVFP4 加持下将提供极佳的响应速度。 3. 工具链适配:开发者应尽早熟悉 NVIDIA Model Optimizer,掌握 PTQ 量化流程,以便在自有私有化模型上复现类似的性能增益。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE
SCORE
9.2

算力效率新巅峰:llama.cpp 正式支持 NVFP4 与多 Token 预测 (MTP)

TIMESTAMP // 5 月.24
#Blackwell #llama.cpp #NVIDIA #推理加速 #量化技术

开源大模型推理框架 llama.cpp 在其最新的 b9297 版本中,正式集成了对 NVIDIA FP4 (NVFP4) 量化格式和多 Token 预测 (Multi-Token Prediction, MTP) 的支持。这一更新标志着本地推理社区已全面接轨 NVIDIA Blackwell 架构的核心特性,进一步压榨硬件性能极限。 ▶ NVFP4 降临:作为 NVIDIA 最新的 4 位浮点格式,NVFP4 在保持极低显存占用的同时,其精度表现优于传统的 INT4 量化,为本地部署高参数模型提供了更优的“精度/容量”平衡点。 ▶ MTP 速度倍增:多 Token 预测技术的引入,改变了传统的逐个 Token 生成模式,通过并行预测后续多个 Token,显著提升了推理吞吐量(Throughput),尤其在长文本生成场景下优势巨大。 八卦洞察 此次更新并非简单的功能堆砌,而是本地 AI 生态对企业级硬件特性的一次“降维打击”。NVFP4 是 Blackwell GPU 架构的杀手锏,llama.cpp 的快速跟进意味着社区开发者无需等待昂贵的企业级软件栈,即可在消费级或专业级 NVIDIA 硬件上体验最前沿的量化增益。此外,MTP 的加入暗示了未来模型架构的演进方向——从“追求单点准确”转向“追求系统级生成速度”,这对于构建实时交互式 AI 应用至关重要。 行动建议 对于追求极致性能的开发者,建议立即升级至 b9297 或更高版本,并针对现有模型进行 NVFP4 重新量化测试。在部署高并发 API 服务时,应优先开启 MTP 功能以优化 Token 生成成本。同时,需密切关注硬件兼容性,NVFP4 的最佳性能表现仍高度依赖于 NVIDIA 最新一代 Tensor Core 的硬件加速。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE
SCORE
8.8

突破 Blackwell 兼容性瓶颈:SM1 实现纯 PyTorch 版 Mamba 架构

TIMESTAMP // 5 月.23
#Blackwell #Mamba #深度学习框架 #算子优化

开发者成功构建了名为 SM1(Scalar Mamba1)的变体,通过数学闭式解将 Mamba 的核心选择性扫描(Selective Scan)简化为原生 PyTorch 算子,解决了该架构在 NVIDIA Blackwell (sm_120) 硬件及 Windows 环境下的编译难题。 ▶ 硬件解耦:SM1 彻底摆脱了对特定 CUDA 内核(mamba-ssm)的依赖,利用原生 cumprod 和 cumsum 算子实现了与原始算法数学一致的逻辑。 ▶ 架构简化:通过常数变易法(Method of Variation of Parameters)推导出 d_state=1 递归的精确解,证明了在特定维度下,复杂的状态空间模型(SSM)可以被极简实现。 八卦洞察 SM1 的出现揭示了当前 AI 基础设施的一个痛点:前沿架构(如 SSM)往往过度依赖高度优化的定制化 CUDA Kernel,这导致了严重的硬件滞后性——即便是最先进的 Blackwell 显卡,在初期也面临驱动和算子库不匹配的尴尬。SM1 放弃了高维状态(d_state > 1)带来的微弱表达力增益,换取了在 Blackwell 上的“即插即用”能力。这种“以退为进”的工程思路,对于需要在非 Linux 环境或最新硬件上快速部署 Mamba 模型的团队具有极高的参考价值。 行动建议 工程团队:若在 Windows 或新一代 NVIDIA 硬件上遇到 mamba-ssm 编译失败,应优先评估 SM1 这种纯 PyTorch 实现方案,以降低环境配置成本。 研究人员:关注 d_state=1 在大规模任务中的表现损耗。如果标量状态足以支撑特定领域的性能,那么 SSM 的计算复杂度将进一步下降,有利于边缘侧推理。

SOURCE: REDDIT MACHINELEARNING // UPLINK_STABLE
SCORE
8.8

Anthropic 进驻 Colossus2:GB200 时代的算力霸权争夺战

TIMESTAMP // 5 月.21
#Anthropic #Blackwell #GB200 #大语言模型 #算力基建

Anthropic 宣布将其计算基础设施扩展至 Colossus2 集群,并全面采用 NVIDIA 最新的 GB200 Blackwell 芯片。这一战略举措旨在通过极致的算力密度,为其下一代 Claude 系列模型的训练与大规模推理提供核心支撑,标志着全球大模型竞争正式进入“Blackwell 时代”。 ▶ 算力代差优势:从 H100 向 GB200 的跨代演进,不仅是单卡性能的提升,更是通过 NVLink 技术实现的机架级算力爆发,预示着 Anthropic 将在复杂逻辑推理与超长上下文处理上实现指数级突破。 ▶ 基建即护城河:在模型架构趋同的背景下,对顶级算力集群(如 Colossus2)的优先占有权已成为第一梯队 AI 实验室的核心壁垒,Anthropic 正试图通过基建规模锁定其在 AGI 赛道的领先地位。 八卦洞察 Anthropic 此次选择 Colossus2 集群并非偶然。在 OpenAI 紧锣密鼓筹备其超大规模算力中心的同时,Anthropic 必须通过更高效的算力利用率来实现“非对称竞争”。GB200 提供的 FP4 精度支持是关键变量,它能在不牺牲精度的前提下显著降低推理成本并提升吞吐量。这暗示了 Anthropic 未来的商业化策略:在维持模型“高智商”的同时,大幅下调企业级 API 的使用成本,直接切入 OpenAI 的腹地。 行动建议 对于算力产业链投资者,应重点关注 Blackwell 供应链中散热与高速互联组件的头部供应商;对于企业决策者,建议提前评估基于 GB200 推理架构的高阶模型性能,为即将到来的“廉价高智”AI 应用浪潮做好架构适配准备。

SOURCE: HACKERNEWS // UPLINK_STABLE
SCORE
8.8

llama.cpp b9095 发布:双 Blackwell 显卡实现“无 NCCL”张量并行,消费级多卡推理门槛骤降

TIMESTAMP // 5 月.10
#Blackwell #llama.cpp #RTX 50系列 #张量并行 #边缘计算

核心速递 llama.cpp b9095 版本正式发布,核心突破在于支持双 Blackwell PCIe GPU 在无需 NCCL 依赖的情况下实现张量并行(Tensor Parallelism, -sm tensor)。 ▶ 去 NCCL 化:通过绕过复杂的 NVIDIA 集体通信库(NCCL),显著降低了 Windows 及消费级环境下多显卡协同推理的配置难度。 ▶ Blackwell 深度适配:在 RTX 50 系列显卡大规模铺货前,社区已完成底层 P2P 通信优化,预示着新一代架构在本地大模型(LocalLLaMA)领域的统治力。 ▶ 性能潜力:该更新针对 PCIe 通道优化了数据交换效率,特别是在双 5060 Ti 等中端配置上,有望实现大参数模型的高速推理。 八卦洞察 长期以来,张量并行(TP)被视为企业级 A100/H100 集群的专利,主要受限于 NCCL 在非 Linux 环境下的兼容性黑盒。llama.cpp 此次更新本质上是在软件层面“暴力拆解”了 NVIDIA 的企业级软件护城河。通过在 Blackwell 架构上实现原生的 P2P(Peer-to-Peer)内存访问,开发者正将消费级硬件推向“准服务器级”表现。这意味着,未来的 AI 开发者可能不再需要昂贵的 NVLink 桥接,仅靠 PCIe 槽位即可在双卡环境下流畅运行 70B 甚至更大规模的模型。这不仅是技术的进步,更是本地算力对云端垄断的又一次有力回击。 行动建议 对于计划构建本地推理性算力池的用户,建议密切关注 RTX 50 系列显卡的 PCIe P2P 带宽实测数据。若双 5060 Ti 或 5090 在无 NCCL 模式下表现稳定,企业应重新评估边缘侧部署(Edge Deployment)的硬件选型,优先考虑具备高带宽 PCIe 通道的 Blackwell 消费级方案,而非盲目追求昂贵的专业卡。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE