[ DATA_STREAM: %E8%85%BE%E8%AE%AFAI ]

腾讯AI

SCORE
8.6

腾讯发布 EVIE 系列模型:视觉文档检索(ViDoRe)的新 SOTA 标杆

TIMESTAMP // 9 月.07
#RAG #向量嵌入 #多模态大模型 #腾讯AI #视觉文档检索

核心事件 腾讯正式发布 EVIE-8B 与 EVIE-4.5B 模型,专注于高容量视觉文档检索(Visual Document Retrieval),在权威基准测试 ViDoRe V3 上取得了 66.75 nDCG@10 的成绩,刷新了行业 SOTA(当前最佳)纪录。 ▶ 技术突破:EVIE 采用了全逐标记(Per-token)多向量嵌入技术,能够直接从视觉层面捕捉文档的细粒度布局、排版及图表特征。 ▶ 高维表征:支持 4096 维的高容量向量表示,相比传统模型,极大地提升了对复杂非结构化数据(如财务报表、技术手册)的检索精度。 ▶ 架构演进:该模型在 ColPali 等前序研究的基础上进行了深度优化,标志着多模态检索从“OCR 依赖型”向“视觉原生型”的范式转移。 八卦洞察 「八卦资本」认为,EVIE 的出现解决了 RAG(检索增强生成)领域长期存在的“PDF 痛点”。传统的 RAG 流程依赖 OCR 识别,在面对复杂的表格、公式和多栏布局时极易丢掉语义上下文。腾讯此举并非简单的参数竞赛,而是试图通过“视觉-语义直接对齐”来绕过 OCR 的精度瓶颈。4096 维的高容量设计虽然增加了计算开销,但在企业级应用中,这种对文档“物理结构”的理解能力是实现精准问答的刚需。这预示着未来高端 RAG 市场将从纯文本向量检索全面转向视觉多模态向量检索。 行动建议 对于企业架构师:如果你的业务涉及大量复杂 PDF、图纸或带有复杂排版的专业文档,建议立即评估 EVIE 模型,以替代现有的“OCR + 文本向量”流水线。 对于开发者:关注 EVIE 在多向量检索(Multi-vector Retrieval)上的实现,这需要向量数据库支持更复杂的索引机制,需提前优化基础设施。 对于投资者:视觉原生检索(Vision-native Retrieval)是多模态大模型落地的关键拼图,关注在该领域有深厚技术储备的头部云厂商。

SOURCE: REDDIT LOCALLLAMA // UPLINK_STABLE