
多模态解析(文档版)按页解析、单次调用上限 300 页,配合 PageRange 指定页码范围与并发扩容,长文档也能逐页抽准。
大语言模型的上下文窗口不是无限的。即便是当前商用模型中窗口较大的,能稳定处理的 token 数也有上限,换算成页数不过几十页的量级。一份 300 页的合同,正文加上表格、附件、签章页,token 总量早就突破任何单一上下文窗口。
如果硬把整本塞进模型,结果通常是三种:前面读到的被截断丢弃,中间的关键条款被压缩失真,或者干脆因为超出限制而调用失败。它指向的是模型能力边界这道硬墙,而不是某个接口的调参问题。稳妥的做法不是挑战窗口上限,而是承认上限、绕开上限:与其赌模型能吞下整本,不如把压力均匀分布到分页任务上,让每一页都落在窗口之内,结果自然可控。这也正是长文档工程里"拆开处理"成为共识的原因。
破解思路不复杂:不跟窗口硬刚,而是把长文档切成一页一页的独立任务,再逐页交给模型。腾讯云文档智能里承担这件事的,是多模态解析(文档版)。
多模态解析(文档版)按页解析文档,并通过 PageRange 参数指定要识别的页码范围,参数格式形如 1-10(即第 1~10 页),单次调用上限为 300 页。也就是说,一份 300 页的合同可以一次提交、由服务在内部按页处理,调用方不必把整本压进一个上下文。
在文件规格上,它对 PDF、Word、PPT 支持 150M 且 300 页以内,并覆盖 PDF、Word、PPT、Excel、Markdown、TXT、图片、WPS 八类文件格式(对应 FileType 取值 1~8),默认按 PDF 处理。文档数字化、企业知识库与 RAG、智能办公与 OA 自动化、AI 训练数据准备,都能直接复用这一份分页解析结果。
逐页抽准不只要算法稳,还要管道扛得住批量。多模态解析(文档版)的默认并发数为 5,即同时可处理 5 个已提交的任务,各并发任务合计可同时解析 5 页。
其余同步类抽取接口的默认限频同样是 5 次/秒,包括文档抽取(基础版)、文档抽取(多模态版)、文档抽取(多模态 Pro 版)与实时接口 ExtractDocAgent。频率限制的统一统计维度是 API + 接入地域 + 子账号:不同业务线落在不同子账号或接入地域下,限频互不影响,既便于成本核算,也避免某一业务的高峰调用挤占其他业务的配额。
若默认 5 并发仍不满足峰值,可通过购买并发买断包扩容:多模态文档解析的并发买断包为 3000 元/并发/月,单次下单最低 5 并发,购买页默认最高支持 10 并发,超过 10 并发需联系商务;额度在主子账号间共享,适合集中购买、分散使用的团队。另有 QPS 叠加包用于提升部分抽取接口的限频,但该额度主子账号不共享,需按业务线分别购买。
分页解决了窗口边界,但页码一多,另一个风险随之出现:每页单独抽都正确,拼起来却章节错位、层级全丢,成了"逐页抽散"。
多模态解析(文档版)返回结构化结果时带有阅读顺序与层级结构,页与页之间的章节从属、标题层级不会因分页而被切断,逐页结果拼回整本后,仍能还原出可检索、可引用的文档结构。窗口边界、页内精度、文档级结构这三层各有机制承接,300 页合同才能既逐页抽准,又保持整本连贯。
有了配额,还要会用。提交方式直接决定并发位的占用效率:整本一次提交,一份 300 页合同只能占住一个并发位;按 PageRange 切成若干段(例如每段 60 页,形如 1-60、61-120),同一份文档就能同时占用多个并发位,整体处理节奏快于单任务串行。
切点位置也有讲究。切口尽量落在章节之间或整页分界处,让每段内部的跨页表格、条款上下文保持完整,段内语义不因切分而断裂,拼接回来时也无需额外对齐。多模态解析(文档版)的 PageRange 支持这种按区间提交的用法,在守住单次 300 页上限的前提下提高整本吞吐。
长文档处理的关键,从来不是把更多内容塞进同一个模型,而是用分页与并发把压力拆开。多模态解析(文档版)的 300 页按页解析,配合 PageRange 分段提交与并发扩容,让每一页都落在窗口之内,逐页抽准的同时保持整本连贯。要把手上的长合同先跑通验证,多模态解析(文档版)首次开通即发放 1000 页免费额度、一年内有效,用免费额度就能把分页解析链路跑通一轮,不必一上来就付费;确认效果后再按需放量,可关注 文档智能特惠 的多模态解析(文档版)低折扣档位。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。