[ DATA_STREAM: %E6%A8%A1%E5%9E%8B%E5%89%AA%E6%9E%9D ]

模型剪枝

SCORE
8.8

ToMoE:稠密模型向MoE演进的“剪枝”新路径

TIMESTAMP // 8 月.24
#大语言模型 #模型剪枝 #混合专家模型 #端侧AI

ToMoE(Top-k Mixture-of-Experts)提出了一种通过动态结构剪枝将稠密大语言模型(LLM)高效转换为混合专家模型(MoE)的新架构,旨在解决大模型在资源受限环境下的部署难题。▶ 突破静态剪枝局限:ToMoE 不再是简单的权重剔除,而是通过动态路由实现参数的结构化复用,将冗余的稠密层转化为按需激活的专家模块。▶ 性能与效率的帕累托改进:在大幅降低推理 FLOPs 和内存带宽压力的同时,该方法能最大限度保留原始稠密模型的认知能力,实现了计算成本与模型精度的最优平衡。八卦洞察「八卦资本」认为,ToMoE 的出现标志着大模型效率优化进入了“存量改造”时代。过去,业界倾向于从零开始训练 MoE 模型(如 Mixtral),但成本极高。ToMoE 证明了现有的强大稠密模型(如 Llama 3 或 Qwen 系列)可以通过“手术刀式”的动态剪枝,在不损失核心逻辑能力的前提下,转化为轻量化的 MoE 架构。这本质上是在挖掘神经网络中的“闲置资产”,对于那些希望在端侧设备(Edge AI)运行中大型模型的厂商来说,这是一种极具性价比的工程路径。行动建议对于模型开发者:应重点关注“后训练 MoE 化”(Post-training MoE-fication)技术,利用 ToMoE 框架对现有私有模型进行瘦身,以降低私有化部署的硬件门槛。对于硬件厂商:需优化底层算子以支持动态稀疏计算,因为 ToMoE 类架构的普及将使“动态路由”成为推理侧的常态需求。对于企业架构师:在评估模型部署方案时,不再仅限于选择“小尺寸稠密模型”,应考虑经过 MoE 转换的大模型,以获取更好的推理性能功耗比。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE
SCORE
8.8

极限压榨 GLM 5.2:4卡 GB10 实现 33万超长上下文与高性能推理

TIMESTAMP // 7 月.09
#GLM 5.2 #上下文并行 #投机采样 #推理优化 #模型剪枝

核心事件 在 LocalLLaMA 社区的最新实测中,开发者成功在 4x GB10 显卡配合 100G 交换机的硬件环境下,实现了智谱 GLM 5.2 的深度优化部署。通过 TP4(张量并行)与 DCP2(分布式上下文并行)的组合策略,该方案在维持 330k 超长上下文的同时,实现了约 25 t/s 的生成速度与最高 1000 t/s 的预填充效率。 ▶ 上下文并行(DCP)是突破显存瓶颈的关键: 采用 DCP2 可支持 330k 上下文,若升级至 DCP4 则可扩展至 660k,虽然预填充速度会降至 400 t/s,但这为超长文档处理提供了本地化可行性。 ▶ 投机采样与剪枝的协同优化: 通过设置 4 个 Draft Tokens 并配合 10% 的无损剪枝,模型在处理代码任务时表现优异(25-35 t/s),且剪枝技术有望将上下文进一步推向 1M 门槛。 ▶ 硬件互联决定性能上限: 100G 交换机在多卡分布式推理中扮演了核心角色,解决了跨卡通信的延迟问题,使得分布式上下文并行不再是实验室专利。 八卦洞察 这次实测揭示了国产大模型(GLM 5.2)在海外极客圈的高认可度。值得关注的是,开发者提到的“思考模式”(Thinking Mode)与“代码模式”在推理速度上的显著差异(20 t/s vs 35 t/s),这表明 GLM 5.2 在逻辑推理时存在更高的计算密度或更复杂的注意力机制。此外,10% 的“无数据剪枝”(Data-free Pruning)能在几乎不损失精度的情况下大幅提升并发能力或上下文长度,这暗示了当前顶级模型在参数冗余度上仍有优化空间,对于追求极致性价比的企业级私有化部署具有极高的参考价值。 行动建议 针对架构师: 在构建多 GPU 推理集群时,应优先投资高带宽交换机(如 100G+),而非仅仅追求单卡算力,因为互联带宽直接决定了 DCP 等并行策略的有效性。 针对开发者: 建议在长文本 RAG 或复杂编程助手场景中,尝试 5%-10% 的模型剪枝策略,以换取更大的 KV Cache 空间。 针对算法团队: 针对不同任务类型(散文 vs 代码)动态调整投机采样的 Draft Tokens 数量,可进一步压榨硬件性能。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE