[ INTEL_NODE_31883 ] · PRIORITY: 8.5/10

Ornith-1.5-35B 震撼发布:RTX 5090 实测 250 tok/s,本地 Agent 交互进入“毫秒时代”

  PUBLISHED: · SOURCE: Reddit LocalLLaMA →
[ DATA_STREAM_START ]

核心事件

近日,开发者社区对 Ornith-1.5-35B-A3B 模型在本地推理表现给予了高度评价。基于 RTX 5090 显卡与 NInfer 推理框架(Windows 版),该模型实现了惊人的 250 tokens/s 生成速度及 5k-8k 的预填充速度,被公认为目前最适合交互式任务与智能体(Agent)场景的本地模型。

  • 极致性能表现: 在 RTX 5090 上达到 250 tok/s,这意味着模型响应几乎是瞬时的,彻底消除了本地大模型常见的“打字机”迟滞感。
  • Agent 任务适配: 该模型在逻辑推理与任务执行上表现卓越,尤其适合需要高频交互和快速反馈的自主智能体工作流。
  • 推理框架红利: NInfer 在 Windows 环境下的深度优化,显著提升了 35B 规模模型在消费级硬件上的吞吐效率。

八卦洞察

“聪明但迟钝”一直是本地大模型的痛点,但 Ornith-1.5-35B 的出现标志着一个转折点。从架构上看,35B-A3B 这种命名暗示了其可能采用了高效的 MoE(混合专家)架构,仅激活少量参数即可实现高水平推理。这种“小快灵”的策略,配合 RTX 50 系列显卡巨大的内存带宽,正在将本地 AI 从“玩具”推向“生产力工具”。

我们认为,250 tok/s 的速度已经超越了人类的阅读极限,这并非性能过剩,而是为多步推理(Chain-of-Thought)和复杂的 Agent 反思循环留出了巨大的时间余量。当模型可以在 1 秒内完成数百词的思考和输出时,本地 Agent 的可用性将发生质变。

行动建议

  • 开发者: 立即关注 NInfer 推理框架的 GitHub 进展,并尝试将 Ornith-1.5 集成至低延迟要求的 RAG 或 Agent 应用中。
  • 硬件玩家: 若持有 RTX 4090 或 5090,该模型是目前测试显卡极限性能与交互体验的最佳标杆。
  • 企业应用: 评估该模型在本地化部署、隐私敏感型实时客服或自动化脚本编写中的替代潜力。
[ DATA_STREAM_END ]
[ ORIGINAL_SOURCE ]
READ_ORIGINAL →
[ 02 ] RELATED_INTEL