公司里大量信息躺在 PDF、Word、截图里——合同、报表、通知。要用这些数据,得先把它变成表格。手工抄又慢又错。本文用大白话教你,怎么用 WorkBuddy 把乱糟糟的文档,抽成整齐的结构化数据。
你有一堆合同 PDF,想统计"每家供应商的到期日"。肉眼翻+手抄,100 份能抄一下午还漏。如果用 AI 把每份里的关键字段抽出来,拼成一张表,几分钟搞定。这就是"非结构化→结构化"。
下面是一段从文档里复制出来的文字(可能是合同/报表/通知),请帮我抽取成结构化字段。
原文:[粘贴文字] 我要的字段:[如"甲方、乙方、金额、到期日、关键条款"]
请输出:
大白话说明你是怎么判断的。
第一轮:拿到抽取表。 第二轮:追问"检查一下有没有明显矛盾,比如金额大小和文字描述对不上"。 第三轮:追问"把这张表转成可以直接粘进 Excel 的格式(制表符分隔)"。
原文"甲方张三公司,乙方李四工作室,合同金额伍万元,2026年12月31日到期": 输出结构: | 甲方 | 乙方 | 金额 | 到期日 | 关键条款 | | 张三公司 | 李四工作室 | 50000 | 2026-12-31 | 未提及 | 判断:金额由中文"伍万"转成 50000,日期转标准格式。
注意:以上为结构示例,实际以 WorkBuddy 实时返回为准。
一次贴一份太慢?可以追问"给我一个处理流程:我每天把 N 份文档文字粘进来,你统一抽成一张大表",把套路固定下来。注意单次别超长,分批更稳。
坑一:让 AI 补缺失字段,它容易编。规则写死"抽不到就留空"。
坑二:不统一格式,金额"5万""50000""五万"混着,后面没法算。
坑三:一次塞太多文档,抽取质量下降,分批更准。
文档里的数据,不抽出来就是死信息。用本文模板,把 PDF/Word 变成表格,是数据治理最基础的一步。大白话:把散落的话,整理成表格,电脑才看得懂。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。