LlamaIndex 🦙(@llama_index)

Introducing 𝗘𝘅𝘁𝗿𝗮𝗰𝘁𝗕𝗲𝗻𝗰𝗵: the most comprehensive benchmark for information extraction fr...

8.5内容质量

TL;DR · AI 摘要

LlamaIndex推出ExtractBench基准测试,发现商业VLMs在处理超过50页文档时召回率骤降至35%以下。

核心要点

  • ExtractBench测试了14个系统在370个企业文档、4869页、67种文档类型上的表现
  • 商业VLMs处理超过50页文档时召回率低于35%但精确度保持较高
  • 表格行遗漏是当前信息提取系统的重大缺陷

结构提纲

按章节快速跳转。

  1. §ExtractBench介绍

    介绍ExtractBench基准测试的背景和目标

  2. 描述测试的14个系统和370个企业文档的规模

  3. 揭示商业VLMs在长文档处理中的召回率骤降问题

  4. 分析表格行遗漏对实际应用的影响

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • ExtractBench基准测试
    • 测试范围
      • 370文档/4869页/67类型
    • 核心发现
      • 50页后召回率<35%
      • 表格行遗漏严重
    • 技术影响
      • 影响企业文档处理效果

金句 / Highlights

值得收藏与分享的关键句。

#信息提取#基准测试#LlamaIndex#企业文档
打开原文

LlamaIndex 🦙 on X: "推出 𝗘𝘅𝘁𝗿𝗮𝗰𝘁𝗕𝗲𝗻𝗰𝗵:首个面向复杂企业文档信息提取的综合性基准测试。我们的应用研究团队进行了测试:在370份企业文档、4,869页内容、67种文档类型上,对14个系统(前沿视觉语言模型、代码代理、提取API)进行了评估。https://t.co/sqddzo1hdL" / X

LlamaIndex 🦙

@llama_index

推出 𝗘𝘅𝘁𝗿𝗮𝗰𝘁𝗕𝗲𝗻𝗰𝗵:首个面向复杂企业文档信息提取的综合性基准测试。我们的应用研究团队进行了测试:在370份企业文档、4,869页内容、67种文档类型上,对14个系统(前沿视觉语言模型、代码代理、提取API)进行了评估。零LLM裁判,完全确定性评估。最重要的发现:超过50页后,商业视觉语言模型的召回率下降至35%以下。精确度保持较高水平,但它们会静默丢弃大部分表格行。你的提取代理遗漏了什么?立即运行ExtractBench查看结果。博客:

llamaindex.ai/blog/introduci…

GitHub:

github.com/run-llama/Extr…

HuggingFace:

huggingface.co/datasets/llama…

$

00:00

/$

下午1:00 · 2026年8月11日

29.6K

浏览量

17

10

79

39