[ DATA_STREAM: %E5%B0%8F%E7%B1%B3MIMO ]

小米MiMo

SCORE
8.8

小米 MiMo v2.5 推理优化深度解析:混合 SWA 机制如何重塑长文本效率?

TIMESTAMP // 7 月.07
#大模型推理 #小米MiMo #性能优化 #混合注意力机制 #端侧AI

核心事件小米技术团队近期披露了 MiMo v2.5 的推理优化细节,该版本通过深度整合混合滑动窗口注意力(Hybrid Sliding Window Attention, SWA)机制,成功在保持模型性能的同时,大幅降低了长文本推理的显存占用并提升了吞吐量,标志着端侧大模型向长序列处理能力的又一次进化。▶ 混合 SWA 架构彻底打破了 KV Cache 的线性增长瓶颈:通过在不同层交替使用全局注意力和滑动窗口注意力,MiMo v2.5 实现了显存占用与序列长度的部分解耦,使得在有限显存下处理超长文本成为可能。▶ 内核级优化是性能释放的关键:针对 SWA 特性开发的定制化 CUDA 内核,避免了标准算子在处理非连续内存访问时的效率损失,推理速度提升显著。▶ 从“暴力堆算力”转向“算法精算”:MiMo v2.5 的成功证明了在模型架构层面进行推理友好型设计(Inference-aware design),其收益远超单纯的硬件加速。八卦洞察小米在 MiMo v2.5 上的发力,本质上是在为“全场景边缘 AI”铺路。在手机和 IoT 设备等内存受限的端侧环境下,传统的全注意力机制(Full Attention)是不可持续的。MiMo v2.5 选择 Hybrid SWA 并非偶然,而是在计算精度与部署成本之间寻找最优解。这释放了一个强烈的行业信号:未来大模型的竞争焦点将从“谁的参数多”转向“谁的推理成本更低、速度更快”。小米通过这种底层架构的微操,正在构建其在端侧大模型领域的成本护城河。行动建议对于开发者和企业而言,应密切关注混合注意力机制(Hybrid Attention)的演进,在构建私有化模型时,优先考虑具有类似 SWA 特性的架构以降低长期运维成本。对于硬件厂商,优化针对非对齐内存访问的算子库将成为适配下一代高效模型的关键竞争力。

SOURCE: HACKERNEWS // UPLINK_STABLE
SCORE
9.2

小米 MiMo V2.5 突破 3000 TPS:DFlash 与持久化内核重塑大模型推理效率

TIMESTAMP // 6 月.14
#吞吐量优化 #大模型推理 #小米MiMo #开源技术 #端侧AI

小米近日披露其 MiMo V2.5 模型在推理性能上取得重大突破,通过引入 DFlash 架构与持久化内核(Persistent Kernel)技术,实现了 1000-3000 TPS(每秒 Token 数)的惊人吞吐量,并承诺近期将正式开源相关代码。 ▶ 软硬协同深度优化:DFlash 并非单纯的算法改进,而是针对显存带宽瓶颈的底层重构,配合持久化内核减少了算子切换开销。 ▶ 端侧与云端推理边界模糊:如此高的吞吐量预示着小米在端侧 AI 响应速度上已具备行业领先的竞争力,为复杂智能体(Agent)的实时交互奠定了基础。 八卦洞察 小米此次的技术飞跃释放了一个明确信号:大模型竞赛的下半场已从“参数规模”转向“推理效率”。1000-3000 TPS 的量级意味着模型可以在极短时间内完成多轮思考或长文本生成,这对于需要高频调用、低延迟反馈的 Agentic Workflow(智能体工作流)至关重要。小米选择在此时开源 DFlash,显然是意图通过贡献底层推理基础设施来争夺开发者生态的话语权,挑战目前由 NVIDIA TensorRT-LLM 或 vLLM 主导的推理格局。 行动建议 对于开发者和企业架构师,建议密切关注小米即将发布的 DFlash 开源仓库。若其持久化内核技术能够适配主流算力平台,将成为降低大模型推理成本(TCO)的关键工具。特别是针对高并发、实时性要求高的业务场景,应提前评估 DFlash 架构对现有推理链路的替代潜力。同时,硬件厂商需警惕这种深度定制化内核带来的软件栈壁垒,加强对异构计算的底层优化支持。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE