[ DATA_STREAM: %E7%8E%84%E9%93%81C950 ]

玄铁C950

SCORE
9.2

谁还需要GPU?阿里玄铁C950 RISC-V处理器在27B大模型推理中跑出30 TPS

TIMESTAMP // 8 月.19
#RISC-V #大模型推理 #玄铁C950 #算力自主 #边缘AI

阿里巴巴平头哥(T-Head)近期展示了其高性能RISC-V处理器玄铁C950在AI推理领域的强悍实力。在运行270亿参数(27B)的通义千问Qwen-3.8模型时,该处理器实现了30 tokens per second (tps) 的推理速度。这一数据标志着RISC-V架构在处理复杂生成式AI任务上已具备与主流架构一较高下的能力。 ▶ 性能跨越: 30 tps对于27B规模的模型而言已远超人类阅读速度,证明了RISC-V在无需昂贵GPU辅助的情况下,亦能支撑高性能本地化推理。 ▶ 架构深度优化: 玄铁C950通过强化矢量指令集(Vector Extension)及矩阵运算单元,针对Transformer架构的算子进行了底层重构,极大缓解了传统CPU在AI负载下的性能瓶颈。 ▶ 生态自主信号: 在全球算力供应链波动的背景下,阿里通过“自研指令集架构 + 自研大模型”的垂直整合,展示了一条绕过x86和ARM生态壁垒的自主算力路径。 八卦洞察 这不仅仅是一次硬件跑分,而是RISC-V从“物联网芯片”向“高性能计算”转型的关键分水岭。27B参数模型通常被认为是企业级私有化部署的“黄金分割点”——既具备足够的逻辑推理能力,又对显存有极高要求。阿里玄铁C950能在此规模下跑出30 tps,意味着边缘侧服务器和高性能工作站的“去GPU化”正在成为可能。通过垂直整合Qwen模型与XuanTie硬件,阿里正在构建一套闭环的AI基础设施,这对于降低推理成本、实现算力主权具有深远的战略意义。 行动建议 对于基础设施架构师,建议开始评估RISC-V在边缘侧AI推理节点的TCO(总拥有成本)优势,尤其是在高密度的私有云场景中。对于AI软件开发者,应重点关注RVV(RISC-V Vector)指令集的优化工具链,提前布局跨平台的算子库迁移,以应对未来多元化的算力格局。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE