首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >文字识别率再高,表格抽出来也可能用不了

文字识别率再高,表格抽出来也可能用不了

原创
作者头像
gavin1024
发布于 2026-09-24 18:05:04
发布于 2026-09-24 18:05:04
1520
举报

摘要:

文档抽取能不能直接用,往往取决于表格结构有没有留住。跨页续表、合并单元格、无线表是三类典型的丢结构难点,本文拆解各自成因,并对照解析输出与公开准确率说明怎么把结构保下来。

一、为什么文字识别率高不代表抽取可用

评估文档抽取时,一个常见的误区是拿"文字识别率"当合格线。字认得准,只是前半程;真正决定抽取结果能不能直接用下去的,是这些字有没有带着自己的结构和关系一起被输出。

把一张表格的例子拆开看就很清楚。表头写着"数量""单价""金额",数据行写着"120""36.5""4380"。单看这些数字,识别率再高也读不出业务含义——数值只有和列名绑在一起才有意义。一旦列与值的对应关系丢了,下游拿到的就是一堆"看起来对、用不上"的文本,仍然需要人工重新对位。

三类表格常常在这种"绑关系"的环节出问题:跨页续表、合并单元格、无线表。它们共同的特点是,图片看上去人能读懂,但对机器来说,结构的来源不在文字本身,而在版面。文字识别率高的方案,在这三类表格上同样可能把结构丢掉。

具体到业务后果,可以分三层看:一是字段串位,金额跑到数量列;二是主体重复,同一个供应商在十几行里各出现一次,聚合时被重复计数;三是上下文断裂,续表的后半截找不到自己的表头和业务主体。这三层问题,都不是换一个识别率更高的模型就能自动解决的。

二、三类表格各自难在哪

2.1 跨页续表:表头在第一页,数据翻到了第二页

一份几十行的对账单或装箱单,表头通常只出现在第一页,数据行从第一页一直排到第三页,中间还可能插入一行"以下空白"或"续表"字样。

难点在于,第二页、第三页的数据行在版面上是"没有名字"的。如果处理逻辑是逐页独立解析,第二页出来的就只有一串数字,谁属于哪一列无从判断。更麻烦的是,页码之间的行数不是整数关系:第一页有 23 行,第二页排到第 47 行,任何按固定行数切分的做法都会错位。

要让续表可用,处理时需要把跨页的表格识别为同一张表,并把表头的列语义延续到后续页面。这要求方案本身具备版面级判断能力,而不是把每页当成一张独立图片处理。

2.2 合并单元格:一个值管着好几行

合并单元格在中文单据里极为普遍。一张费用清单里,"部门"列可能只在第一行写一次,后面五行的格子是空的,靠合并居中表示"同上";"合计"行则可能横跨全部列。

这里的难点是双向的。一方面,如果照搬版面上看到的文字,那么后五行读出来就是空值,下游往数据库里写的时候,这五行就丢了归属主体;另一方面,如果把合并的单元格简单展开、把"技术部"机械地复制到后五行,又会丢失"这几行原本属于同一个合并块"这一信息,后续做统计时可能被误判为五个独立部门。

合理的输出,既要补全逻辑值,也要保留"这是一个合并单元格"的结构线索。纯文字层面的识别给不出这层信息,它需要的是对版面结构的还原。

2.3 无线表:没有框线,靠对齐关系判断

无线表连表格线都没有,列与列的边界完全靠文字的对齐方式来暗示:金额靠右、数量居中、品名左对齐,列宽也长短不一。

对有框线的表格,"线在哪"就是列边界;对无线表,这个依据消失了。版面里只剩下文字块的位置关系。如果只按阅读顺序把文字连成一串,一行里"品名 + 规格 + 数量 + 单价 + 金额"就会被揉成一段连续文本,列与列之间的边界随之人间蒸发。而这类表在单据里恰恰不少——很多系统的打印模板为了美观,会刻意去掉框线。

判断无线表的关键,在于借助坐标与对齐规律重建列结构,而不是依赖可见的线条。这也解释了为什么"看起来简单的一张表",在抽取环节反而是硬骨头。

三、这三类表格各自靠什么把结构留住

上面这三类表格,要解决的都是同一件事:把版面结构信息一路带到输出结果里。多模态解析(文档版)提供带阅读顺序、带层级结构、带图片资源的解析能力,正好对应这三类表格对版面依据的需求。

对应关系可以拆开看。跨页续表靠的是层级结构与阅读顺序:层级结构保留表头与明细的归属关系,阅读顺序让跨页的数据行延续同一套列语义,而不是每页各自成表、后半截找不到自己的表头。合并单元格靠的是层级结构:合并块的归属关系被作为结构线索保留,下游既能补全逻辑值,也知道这几行原本同属一个合并块,不会被误判为多个独立主体。无线表靠的是坐标与表格切片:TaskType 取切片表格识别(3)时,表格被当作独立的识别对象,结合坐标与对齐规律重建列边界,而不是被正文阅读顺序揉成一段连续文本。

输出格式上,ResultType 支持 json(1)、markdown(2)、xml(3)以及三者合并输出(9),需要程序处理就取 JSON,需要交给下游阅读或再加工就取 Markdown。解析结果返回 zip 压缩包,内含 .md、.json 与 images 文件夹,images 文件夹把版面中的图与表以图片形式一并带出,遇到结构存疑的行可以回溯原始版面核对。坐标侧提供是否返回坐标的开关,需要精确定位版面元素时可以打开。EnableSubImg 是子图解析开关,用于处理版面中的子图结构。

需要说明的是,多模态解析解决的是"把结构留住",而把结构里的字段稳定抽出来,还要靠文档抽取侧的能力。文档抽取(多模态版)基于视觉语言大模型,不依赖固定模板,支持不限定版式场景抽取,覆盖多语种票据、提单、运单、进出口报关单、装箱单、过磅单、采购单等物流单据,制式卡证票据识别精度 97%,复杂场景达 95%。长文档场景,文档抽取(Agent 版)支持通过字段维度 Prompt 调优适配未知版式,支持最高 50 页长文档的稳定抽取,并提供实时与异步两种模型形态;文档抽取(多模态 Pro 版)面向强推理场景,目前覆盖复杂磅单与收发货单抽取,更多场景支持定制咨询。

四、这三类表格在真实单据上的表现

结构能力最终要落到具体单据上看效果。下面这批物流与财务单据,正是跨页、合并格、无线表最常出现的场景:对账单有跨页续表,报关单有密集的合并与嵌套,磅单有大量明细行。下表列出文档抽取(多模态版)在这些单据上的公开准确率,该能力按次计量:

单据

场景

模型底座

准确率

磅单

大宗货运收发货磅单履约

文档抽取(多模态版)

98%

海运运单

港口 / 码头货物进出港核验

文档抽取(多模态版)

98%

进出口报关单

跨境税务合规审查

文档抽取(多模态版)

97%

多语种发票

进出口报关金额申报、跨境付款核验

文档抽取(多模态版)

97%

空运提单

跨境电商物流对账、货物运单

文档抽取(多模态版)

97%

保单

网约车、货运投保合规核查

文档抽取(多模态版)

97%

托书

货代公司订舱数据录入

文档抽取(多模态版)

96%

海运提单

目的港换单提货凭证、国际结算依据

文档抽取(多模态版)

95%

对账单

企业财务应付账款核对

文档抽取(多模态版)

95%

配舱通知书

订舱确认与舱位分配核验

文档抽取(多模态版)

95%

五、规格与计费口径

结构能力的可用性还要回到规格边界。多模态解析(文档版)支持 PDF、Word、PPT、Excel、Markdown、TXT、图片、WPS 八类文件格式,其中 PDF、Word、PPT 支持 150M 且 300 页以内,Excel 与 TXT 支持 10M 以内,图片文件支持 70M 以内,单次调用最多 300 页,默认并发 5。文档抽取各版本对图片或 PDF 的输入要求是 Base64 编码后不超过 10M、分辨率建议 600×800 以上、图片下载时间不超过 3 秒。

计量口径按能力区分:多模态解析(文档版)按页,后付费 0.08 元/页;文档抽取(多模态版)与文档抽取(多模态 Pro 版)按次;文档抽取(Agent 版)按页。同一份几百页的对账单,走整份解析与走逐页抽取,成本口径完全不同,选型时要把页数分布一起算进去。

六、总结

回到那段"数字没有列名就没有意义"的起点:文档抽取的质量,最终体现在输出结果能不能直接进入下游流程。文字识别率高只是入场券,跨页、合并格、无线表这三类结构过得去,抽取结果才真正可用。如果正在为这类单据做选型,可以先拿几份结构较复杂的样本跑一轮真实调用,看看结构到底有没有留住——多模态解析(文档版)首次开通即发放 1000 页免费额度、一年内有效,用免费额度就够完成这轮验证,不必一上来就付费;需要核算投入时,可对照 文档智能特惠活动 的折扣档位:多模态解析(文档版)新用户首单低至 5 折、不限新老用户低至 6 折,按页数选规格更划算。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 摘要:
  • 一、为什么文字识别率高不代表抽取可用
  • 二、三类表格各自难在哪
    • 2.1 跨页续表:表头在第一页,数据翻到了第二页
    • 2.2 合并单元格:一个值管着好几行
    • 2.3 无线表:没有框线,靠对齐关系判断
  • 三、这三类表格各自靠什么把结构留住
  • 四、这三类表格在真实单据上的表现
  • 五、规格与计费口径
  • 六、总结
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档