多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

阅读笔记:ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

阅读笔记:ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction 资源论文https://arxiv.org/abs/2607.29677代码https://github.com/run-llama/ExtractBench数据集https://huggingface.co/datasets/llamaindex/ExtractBench项目主页n/aTL;DR这篇论文用一个五轴挑战标注的 benchmark370 篇真实/合成企业文档、4869 页、8 领域 67 文档类型 value F1 与 word/page-level grounding 成本的联合评估解决了schema-guided 企业文档抽取缺乏广覆盖 可溯源 可比成本统一评测的问题。核心结论是不同系统族在质量-成本前沿上占据截然不同的位置裸 VLM 便宜≤1.0¢/page但 F1 不超 80% 且长文档/巨型表崩塌coding agent 健壮但 15¢/pagespecialized API尤其 LlamaExtract Agentic Plus在最前方95.6% F1 8.1¢/page且即便最强的 word-level grounding F1 也不到 50%。主要 caveatbenchmark 由 LlamaIndex 团队构建而全面领先的 LlamaExtract 正是其自家产品利益冲突需打折看。1. 研究内容1.1 研究问题、痛点与动机研究问题给定一篇文档和一个用户自定义 JSON Schema抽取系统能否在值正确且完备 每个值能溯源到原文位置 单页成本可控三方面同时达标形式化即f:(document, schema)⟼(structured data, evidence)f:(\text{document},\ \text{schema}) \longmapsto (\text{structured data},\ \text{evidence})f:(document,schema)⟼(structured data,evidence)。痛点企业要把金融报表、保险理赔、采购单、政府表单里的结构化数据从文档里抽出来进系统历史上靠人工录现有 benchmark 各覆盖一窄条——固定模板的 KIESROIE/DocILE/RealKIE不接受用户自定义 schemaschema-guided 的新基准ContextualAI ExtractBench / LongArray-Extract / LongExtractBench-50 / VAREX要么只几十篇、要么只合成单页、要么不评 grounding 也不量成本于是无法横向比较不同系统族、也无法定位失败到底来自长列表截断 / 扫描噪声 / 表格错拼 / schema 太大中的哪一个。动机 / 为什么重要企业部署是百万页量级“每页差一分钱就决定 AI 项目是否划算”100 万页 × 1¢ $10,000且出错代价高、必须有 grounding 让人在环审计一个能同时量准确率、溯源、成本并按挑战维度切片的 benchmark直接决定系统能不能上生产。领域定位文档智能 / 信息抽取document IE的评测方向上接 OCR 与版面分析下接 RAG 与企业工作流自动化。1.2 核心贡献一个挑战标注、广覆盖的 benchmark370 篇文档 / 4869 页 / 8 业务领域 / 67 文档类型每篇沿五个独立轴任务挑战、感知挑战、表格结构、长度、领域打标签支持按挑战切片归因失败。一套可扩展的 schema 与 ground truth 构建流水线真实文档用前沿模型 ensemble 共识 分歧裁决合成长列表用数据先于文档的程序化生成保证 ground truth 精确扫描表单用人工逐字段核验。不靠纯人工逐字段标注。一次覆盖 14 个前沿系统的广谱评测横跨商用 VLM、开源抽取模型、coding agent、specialized API同时报准确率、grounding、成本与质量-成本权衡。1.3 相关工作脉络SROIEHuang et al., 2019DocILEŠimsa et al., 2023RealKIETownsend et al., 2024ExtractBench本文LlamaIndex, 2026ContextualAI ExtractBenchFerguson et al., 2026LongArray-ExtractExtend AI, 2026LongExtractBench-50micro1, 2026VAREXBarzelay et al., 2026关键传承固定本体 KIE 线SROIE → DocILE → RealKIE逐步从收据/表单扩到多语言、企业域、行项目与长文档但目标字段始终预设固定不测跟随用户新 schema的能力schema-guided 线的四 个新基准各压一个维度——ContextualAI ExtractBench 压 schema 复杂度最多 369 字段但仅 5 个共享 schema、LongArray-Extract 与 LongExtractBench-50 压长文档行完整性、VAREX 用每文档一 schema 的合成单页表单。本文把这四条线的覆盖面合并到一份 benchmark 里。分歧本文是唯一同时评长列表完整性、真实扫描与手写、word/page-level grounding、实测成本的基准Table 1/7且强调五个独立轴而非单一聚合分使低分能追溯到真实成因。注意与 Contextual AI 那篇同名 ExtractBench [12] 是不同工作作者专门加了 footnote 区分。2. 方法概要方法路线系统构建 / 基准评测benchmark 评测协议 14 系统横评非理论证明也非单一新模型。关键假设显式同一文档类型共享一个 schemaschema 写得足够明确时每个字段有确定性期望值五个挑战轴互相独立、可正交归因。隐式读者识别合成文档虽程序化生成、ground truth 精确但能代表真实企业文档的视觉变异性ensemble 共识的 ground truth 接近真值用公开牌价重构的成本能反映真实部署开销。数据 / 实验设置370 篇文档来自三种来源真实 born-digital、基于真实版面的合成长列表、真实监管/税表扫描件其中 38 篇为扫描退化重捕clean 原件的旋转透视噪点版本值不变14 个系统在相同 document-schema 对上跑、无 benchmark 专属调参运行于 2026 年 6–7 月指标为 value F1、word/page-level grounding F1、¢/page 成本附录 C.2 用 2026-07-01 公开牌价按实测 token/credit 消耗重构。训练目标n/abenchmark 论文无训练。整体处理流程鸟瞰评测一篇文档时系统拿到完整文档 用户写的 JSON Schema 作为输入产出一个 schema-valid 的 JSON 对象其中每个标量值和每条对齐后的记录子字段都要带上 source page 与 bounding box 作为 evidence。评分端把预测输出与 ground truth 都展平成 cells一个标量字段、一个对齐后的记录子字段各一个 cell先做归一化日期转 ISO、空白压缩、其余精确相等、无数值容差无 LLM judge再用 Hungarian 算法对数组记录做全局最优一对一配对逐 cell 按期望-预测状态表Table 9判 correct/miss算出 per-document 的 micro precision/recall/F1slice 与 overall 取 per-document F1 的无权重均值。对带人工核验 box 的字段额外评 groundingword-level 要求值正确且预测 box 与真值 box 在正确页上 IoU≥0.5page-level 只要求值正确且给对源页。最后把 F1 与实测 ¢/page 摆到质量-成本前沿图上横评。2.1 架构图上图原文 Figure 2展示 ground truth 如何由三种来源各自构建卡片边框颜色标执行者蓝抽取模型池、紫coding-agent 流水线代码、琥珀人工绿色填充卡是产出的 ground truth橙色虚线标修复与分歧裁决回路。三条流水线分别是真实文档上条多系统 ensemble 提议 分歧裁决、合成长列表中条数据先于文档的程序化渲染 ground truth 精确回读、扫描表单下条schema 冻结后 ensemble 投票 人工逐字段核验 box。2.2 模块详解任务定义模块输入→输出处理流程1. 输入一篇完整文档born-digital 或扫描 用户写的 JSON Schema列字段名、类型、自然语言描述可含标量、嵌套对象、记录数组、可空字段、值约束2. 系统按 schema 抽取3. 输出 schema-valid JSON每个值带 source page 与 bounding box4. 文档里没有的字段必须显式返回 null不能省略键。设计理由JSON Schema 是工业界结构化输出的事实标准一 schema 覆盖同类型所有文档贴近企业为每个新工作流写一个 schema的真实用法强制 null 而非省略键让空字段也被正确计入评分见 Metrics 模块。关键参数schema 由用户而非 benchmark 预设——这正是 schema-guided 与固定本体 KIE 的本质区别。Taxonomy 五轴标注模块挑战归因处理流程每篇文档被沿五个独立轴打标签——任务挑战T1 长列表完整性 / T2 大海捞针 / T3 密集文档、感知挑战P1 旋转或纯图 / P2 扫描 / P3 手写、表格结构S1 合并表头 / S2 透视或表头不在顶部 / S3 跨页 / S4 千行以上巨型表 / S5 单元格内嵌套表、长度L1 ≤10 页 / L2 11–50 / L3 50、业务领域D1–D8。设计理由单一聚合分无法区分漏了三分之一的行与读错一个标签也无法区分任务难与扫描差独立轴让低分能追溯到真实成因。表格单列一轴是因为表格会逐值读对却拼成错误结构这种失败任务轴和感知轴都隔离不了。关键参数标签可跨轴重叠同一文档可同时是 T1 P2 S3 L3 D1Figure 1 给出各标签在 370 篇中的占比。Ground truth 三流水线模块按来源分工真实文档ensemble 共识1. 从样本文档起草 schema字段描述带别名、格式要求、位置提示、勿混指引2. 跑多个不同模型/流水线家族的抽取系统同家族共享错误故刻意跨家族3. 所有系统一致同意的值含空字段的 null成为候选 ground truth4. 分歧按成因分类——若多种读法都站得住脚说明 schema 有歧义就收紧描述直到重跑收敛若只有一种读法站得住脚就是模型失败由审查者对照页面裁定。设计理由单系统输出做 ground truth 会重复其错误并偏向该系统。合成长列表精确构造1. 选一个真实长列表版面基金附表、持仓登记、债权人矩阵2.数据先于文档——先产出记录逐字解析或按真实风格生成再让 coding agent 研究版面字体/列宽/页眉写出渲染代码3. 渲染成贴近真实的 PDF按实测尺寸分页而非固定行数/页否则产生假分页与错误源页标签4. 因为值在 PDF 存在前就已知页码与 word-level box 从渲染结果回读ground truth 无论列表多长都精确5. 机械检查捕风格不匹配与裁剪再由抽取系统池审计完工文档暴露渲染 bug。设计理由数千条相似记录人工标太慢太易错先造数据再造文档让 ground truth 生而可信、无需人工标值。扫描表单人工核验1. schema 对照空白模板起草并在标注前冻结之后改动需版本号 定向复审2. 最多五个系统 ensemble 对每个 schema 叶节点投票争议叶节点交给必须先看页面才裁决的 adjudication agent3. 由单一 citation 管线提议每字段 boxbox 永不跨系统合并4. 人工标注者对每字段 accept/edit/null/redraw。产出 169 篇人工核验文档84% 核验字段带人工放置的 box其余多为空字段页面无物可框。设计理由三种来源各有短板按各自最合适的方法标注——真实文档给版面/扫描噪声/领域跨度但逐字段画框太慢合成覆盖太大无法手标扫描件必须由人判断手写与介于两字段间的标记。退化扫描重捕不需新标注值不变clean 的 ground truth 直接沿用。Metrics 模块value F1 groundingvalue F1 评分流程1. 预测与 ground truth 各展平成 cells2. 归一化8 种日期格式转 ISO、空白折叠、其余精确相等、无数值容差无 LLM judge3. 数组用 Hungarian 算法做全局最优一对一配对代价不匹配子字段数最小化总代价等价于最大化字段一致完全匹配的行用 hash join 预配对作加速快路径4. 按 Table 9 状态表逐 cell 判定——值匹配值correct计入 P 和 R、值→null两边 miss、null→nullcorrect、null→值两边 misshallucination、记录少了缺记录 cell 仅计 R miss、记录多了多余记录 cell 仅计 P miss5. per-document 算 micro P/R/F1slice 与 overall 取 per-document F1 无权重均值文档字段多不加大权重。设计理由数组用 Hungarian 对齐而非按位置是因为记录顺序不应影响值分显式 null 计入两侧分母让诚实返回 null不被惩罚、让空字段上幻觉同时扣 P 和 R只有重复记录会把 P 和 R 拆开所以 P-R 差直接诊断截断 vs 多余记录。grounding仅对带人工核验 box 的字段评word-level 要求值正确且预测 box 与真值 box 在正确页 IoU≥0.5page-level 只要求值正确且给对源页grounding 的 P 分母只计可评分 claim、R 分母只计带核验 box 的 ground truth cell、无核验 box 的文档不产生 grounding 分而非记零。关键约束每篇文档上恒有 value F1 ≥ page F1 ≥ word-level grounding F1前者是后者的门控。2.3 算法 / 伪代码原文无 Algorithm 伪代码框评分是完全确定性的“the same predictions and ground truth always produce the same same score, with no model in the loop”核心规则在 §2.4 与附录 B。其算法性流程已在 2.2 Metrics 模块中逐步说明cell 展平 → 归一化 → Hungarian 对齐 → 状态表判定 → micro P/R/F1 → 无权重均值附录 B.1–B.4 给出精确匹配规则、缺失值语义Table 9、数组对齐细节与聚合/grounding 门控定义可直接复现无需伪代码框。3. 关键结果主要发现系统 族在质量-成本前沿上占据截然不同的区域——裸 VLMGPT-5.4 Nano、Gemini 3.5 Flash 及四个自托管 OSS占低成本端≤1.0¢/page但 F1 都不超 80%coding agentClaude Code Opus 4.8、Codex GPT-5.5达 87–94% F1 但 15¢/pagespecialized API 跨度最大LlamaExtract 三档描绘前沿。长文档是裸 VLM 的死穴Gemini 3.5 Flash 从短文档 87.9% 暴跌到长文档 27.9%多数 VLM 长文档 40%而 LlamaExtract Agentic Plus 在三档长度上从不低于 90%96.6 / 93.3 / 94.4。巨型表S4千行以上是最锋利的分水岭所有 VLM 10%Gemma4 26B 与 Gemini 3.5 Flash 低至 0.0% / 1.5%只有 LlamaExtract Agentic Plus95.9%、Reducto Deep Extract95.3%、Claude Code Opus 4.887.8%能扛。Grounding gap所有 VLM 和 coding agent 默认不返回 evidenceword/page-level grounding 直接记零即便返回 box 的 specialized 系统最好的 word-level grounding F1 也 50%LlamaExtract Agentic Plus 46.4%但 page-level 能到 84.9%。模型层级不预测抽取质量GPT 家族是唯一质量随成本单调上升的Nano 74.9 → Mini 85.2 → GPT-5.5 88.7Gemini 基本持平甚至略降Flash Lite 79.6 → Flash 79.8 → Pro 78.2Claude 非单调且因拒签 Automotive 与 K-1 schema33 篇 / 8.9%拉低分数。证据强度370 篇文档的横评每系统每切片报 unweighted document-level mean F1附录 D 给出 precision/recall 分拆Table 13证明长文档失败集中在 recall整条记录被丢而非读错值成本用公开牌价按实测消耗重构附录 C.2 透明列出所有定价。无置信区间/无多次重复单次运行但确定性评分 统一输入降低了运行间噪声。最支撑结论的一条证据Table 2 的 Document Length 切片 Table 13 的 P-R 分拆——长文档上 Gemini 3.5 Flash 的ΔP−R57.2\DeltaP-R57.2ΔP−R57.2个百分点P83.7、R26.5直接证明裸 VLM 长文档失败是截断recall 崩而非读错这是VLM 便宜但截断长列表结论的最硬证据。3.1 关键结果图 / 表上图原文 Figure 3是 headline 结果横轴实测 ¢/page对数轴纵轴 overall unified value F1。可读出三层信息——VLM 聚在最左低成本区但顶部被 80% 压住两个 coding agent 在右上高质高代价区15¢/pageLlamaExtract 三档沿前沿排列Agentic Plus95.6% 8.1¢/page在最右上方、质价比同时压住两个 coding agent。上图原文 Figure 7把 GPT/Gemini/Claude 三家族的 basic/medium/flagship 三档连成线只有 GPT 质量随成本单调上升Gemini 与 Claude 都非单调——说明换更大的模型不必然换来更好的文档抽取最佳工作点取决于成本-质量权衡而非模型层级。下表重现 Table 2 的关键切片Overall 长度 任务挑战 巨型表 S4系统列选 8 个代表完整 14 系统见原文 Table 2系统族OverallL1 短L2 中L3 长T1 长列表T2 大海捞针T3 密集S4 巨型表LE Agentic Plusspecialized95.696.693.394.496.193.695.595.9LE Cost-Effectivespecialized86.890.880.169.281.882.390.567.8Reducto Deep Extractspecialized90.494.280.592.094.892.587.595.3Codex GPT-5.5coding agent93.695.791.278.991.791.795.478.9CC Opus 4.8coding agent87.190.179.288.193.689.182.487.8GPT-5.4 NanoVLM74.977.476.435.872.274.076.47.2Gemini 3.5 FlashVLM79.887.969.827.978.887.980.51.5Qwen3.6 35B-A3BOSS VLM87.393.184.826.879.085.393.11.3数值为 unified value F1 %取自原文 Table 2加粗为该行最高。完整 14 系统 × 全维度见原文 Table 2子标签细拆见 Table 14。下表重现 Table 3 的 grounding 结果完整系统word-level F1Overallword-level F1长文档page-level F1Overallpage-level F1长文档LE Agentic Plus46.454.784.987.1LE Agentic44.145.766.167.6LE Cost-Effective40.436.764.256.5Datalab AB2.00.048.50.0Extend Max Context25.10.048.90.0Reducto Deep Extract43.341.171.767.3所有其余系统0.00.00.00.0% 取自原文 Table 3VLM 与 coding agent 默认不返回 evidence 故全零。重点解读质量-成本前沿图LlamaExtract Agentic Plus 在右上角同时比两个 coding agent 质量更高95.6 vs 93.6/87.1、成本更低8.1 vs 27.8/16.2 ¢/page是全文最核心的单点结论但这也是利益冲突最刺眼之处见 §4.1。Table 2 长度切片裸 VLM 在 L3 长文档上的崩塌Gemini 27.9、GPT-5.4 Nano 35.8、Qwen3.6 26.8、Gemma4 12.2、NuExtract3 8.9是系统性而非个例Reducto92.0与 Claude Code Opus 4.888.1在长文档上反常地稳——前者是 specialized API 的长文档策略后者是 coding agent 的迭代工具循环。Table 2 的 S4 巨型表所有 VLM 10%这是逐值读对却拼不对结构或读到一半就停的最纯样本CC Opus 4.8 在此拿到 87.8%说明 coding agent 的写解析脚本跑策略对超大表有效。Table 3 groundingword-level 与 page-level 的巨大鸿沟Agentic Plus 46.4 vs 84.9说明找对页远比圈对词容易Extend 与 Datalab 在长文档上 word/page-level 双零说明其 grounding 在长文档上完全失效。4. 批判性评估与价值4.1 批判性评估评估这篇 benchmark 在设计与执行层面相当扎实——五个独立挑战轴解决了单聚合分无法归因的老问题三流水线 ground truth 构建把无法纯人工标注的规模问题用 ensemble 共识 程序化精确构造 定向人工核验组合化解且每种来源都诚实声明了 ground truth 的背书强度共识确认 / 构造精确 / 人工核验评分完全确定性、无数值容差无 LLM judge避免了主观打分成本核算在附录 C.2 透明列出所有定价与重构规则是同类 benchmark 里少见的诚实。precision/recall 分拆Table 13把截断从读错中隔离出来是很有说服力的诊断证据。评估但最不容回避的是利益冲突——benchmark 由 LlamaIndex 团队构建而全面领先Overall、三档长度、T1/T3、S4、page-level grounding 全拿下的 LlamaExtract Agentic Plus 正是 LlamaIndex 的商业产品。最强反方论证是schema 全部由 LlamaIndex 团队撰写即便无主观恶意schema 的字段描述风格、勿混指引、位置提示也可能无意中更契合自家系统的处理路径更微妙的是 Agentic Plus 用了per-document extraction with confidence scores的机制附录 C.1若该机制与评分的 cell 对齐 / null 语义更兼容就构成结构性有利偏差。作者的部分缓解措施是实打实的所有系统吃相同 document-schema 对、无 benchmark 专属调参、成本用公开牌价、ground truth 由跨家族 ensemble 共识而非任一被评测系统决定。但这些措施挡不住schema 写法偏向与评分协议偏向这两条更隐蔽的路径。读者应把Agentic Plus 全面最优的结论打折看——它很可能确实强Reducto Deep Extract 作为独立第三方产品在多数切片也紧随其后间接佐证 specialized API 族的整体优势是真的但刚好自家产品每项第一的画面需要独立复现才能坐实。评估第二个值得说的是规模与代表性。370 篇相对 DocILE6680、VAREX1798小很多作者用广度 真实 多维辩护且合成长列表补规模逻辑成立但 67 种文档类型分摊下来平均每种约 5.5 篇长文档L3只有 20 篇、房地产D8只 6 篇部分切片的得分波动会更受个别文档影响。合成长列表虽 ground truth 精确但作者自己承认generated documents do not capture the visual variability…of real enterprise data——S4 巨型表的高分系统之所以集中在 specialized API 与 coding agent部分可能因为这些系统能处理规整的合成大表而真实世界的脏大表未必如此。评估grounding 的 IoU 0.5 阈值是未经敏感性分析的选择——word-level F1 全员 50% 的结论在更松阈值下可能没那么悲观论文未给阈值扫描略可惜。另外 14 个系统里裸 VLM单次模型调用与specialized API含预处理解析抽取的完整流水线“被放一张图比较严格说不在同一起跑线但论文的 framing 本就是比较不同 family 的工程权衡而非比较模型能力”这个 framing 站得住。综合可信度中——高。基准设计、评分确定性、成本透明度都是高质量最大阴影是利益冲突作者的程序性缓解部分有效但无法排除 schema/评分协议偏向。结论的方向VLM 便宜但截断、coding agent 健壮但贵、specialized API 占前沿、grounding 是 open problem可信结论的具体排名Agentic Plus 每项第一需独立复现打折看。4.2 Limitations 与复现性论文自承合成文档不捕获真实视觉变异性370 篇规模相对较小单次运行无置信区间Claude 家族拒签部分 schema 拉低分数33 篇。读者发现grounding IoU 0.5 阈值无敏感性分析schema 全由 LlamaIndex 团队撰写存在潜在偏向L3 仅 20 篇、D8 仅 6 篇小切片波动大裸 VLM 与完整流水线 specialized API 同图比较、起跑线不同。复现性代码 是GitHub run-llama/ExtractBench · 数据 是HuggingFace llamaindex/ExtractBench · 超参/定价 是附录 C 详列 prompt、配置、2026-07-01 牌价 · (uncertain) 各被评测系统的具体版本快照与运行日志是否全开源未读清。4.3 可复用与后续可借鉴五轴独立挑战 taxonomy 的归因思路unified value F1 的 cell 展平 Hungarian 对齐 归一化评分法附录 B 可直接实现ground truth 三流水线ensemble 共识 / 数据先于文档的精确合成 / 定向人工核验的分工策略质量-成本前沿的联合评估框架。引用场景做文档抽取/IE benchmark 或评测 schema-guided 抽取系统时讨论 VLM 在长文档/巨型表上的系统性局限时论证 grounding 是 open problem 时BibTeX key 候选zhang2026extractbench。下一步若做文档抽取下载 ExtractBench 数据集测自家系统重点跑 L3 长文档与 S4 巨型表两切片关注 word-level grounding全员 50%这块 open problem看是否有可突破的研究点独立复现时优先验证 schema 是否对 LlamaExtract 有偏向用第三方重写部分 schema 再跑Verdict推荐深读领域相关者— 对做文档智能 / 企业信息抽取 / RAG 上游文档处理的人这是 2026 年最值得读的基准之一五轴 taxonomy、确定性的 unified value F1、ground truth 三流水线、质量-成本联合评估都是可直接借鉴的方法论14 系统横评的失败模式数据长文档截断、巨型表崩塌、grounding gap极有参考价值。领域外读者选读 TL;DR Figure 3 即可。最大保留意见利益冲突使自家产品每项第一的排名需独立复现打折看。作者lusca版本lusca-paper-read v1.10.3出处https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-read
返回列表