首页
学习
活动
专区
圈层
工具
发布
首页标签行业文档识别

#行业文档识别

行业文档和表单表格的高精度识别服务

DocClaw:让文档 Agent 记住自己刚刚读过哪里

用户8729876

💡 一句话总结:DocClaw 的贡献不是发明新 backbone,而是把文档任务差异放到技能层、把可复用知识放到状态层、把感知动作放到工具层;技能提升质量,状...

400

OmniHandwritingOCR:别让多模态大模型把手写公式读成幻觉

用户8729876

💡 一句话总结:OmniHandwritingOCR 用 77,572 个图像-标签对、6 个子任务和 12 个子集把手写 OCR 从“总分游戏”变成失败模式诊...

6600

DocMemo:让长文档 RAG 学会带记忆地翻页

用户8729876

💡 一句话总结:DocMemo 把长文档检索从“先选一批页再硬答”改成“读、记、更新置信度、再找”的循环;如果你做的是 RAG、文档 Agent 或多模态文档理...

10110

83.85% vs 17.91%:FormStruct-Bench 揭开表单解析的错觉

用户8729876

💡 一句话总结:FormStruct-Bench 把表单解析从“字段抽取对了几个”推进到“结构到底坏在哪一层”;它测出最强内容分数可达 83.85%,但最佳主结...

8910

DEC:别急着重训,先让表格解析器再检查一遍

用户8729876

💡 一句话总结:这篇论文把“公开基准高分但真实复杂表格仍翻车”的问题拆开诊断,再用 DEC 在不重训解析器的前提下做拆表、增强、修正和回滚;它不是万能 OCR ...

8810

1.2B 小模型赢过 235B 大模型:NaviDC-OCR 把文档解析卷明白了

用户8729876

💡 一句话总结:NaviDC-OCR 证明了在文档解析这条赛道上,"针对性的数据工程 + 训练配方"比堆参数量管用——1.2B 模型四大基准全第一,还顺手赢了一...

16310

Q-CueGraph:你的多模态大模型会 zoom,但真的知道该看哪儿吗?

用户8729876

💡 一句话总结:Q-CueGraph 把多模态大模型"看哪里"的决策拎出来,做成一个独立、可审计的坐标级策略,在冻结的 Qwen2.5-VL 上用 19% 的画...

12110

Prompt-Region Grounding:为什么把题目画进图片,多模态大模型就集体"不会做题"了

用户8729876

💡 一句话总结:把题目从文本挪进图片,主流多模态大模型几乎全军覆没(24 个组合全掉分,平均 17.8 分),而它们常常能正确"读"出题目却不照它作答——这篇论...

12210

美国加州大麻行业仿冒监管机构钓鱼邮件攻击机理与全域防御研究

芦笛

中国互联网络信息中心 | 工程师 (已认证)

美国加利福尼亚州大麻管控局(DCC)于 2026 年 8 月发布安全预警,辖区内持证大麻经营企业批量收到仿冒 DCC 官方邮件钓鱼攻击,攻击者伪造监管机构通知模...

14700

ConfBench:大模型的「我很有把握」,到底能不能信?

用户8729876

💡 一句话总结:ConfBench 用受控退化造出一份「低精度区」基准,首次系统测出 VLM 在文档提取时自报的置信度能不能信,还给了 ECARB 这个能直接算...

13810

PaDoc:让端到端文档解析不再串行——吞吐翻倍、延迟减半,质量还没掉

用户8729876

💡 一句话总结:PaDoc 把端到端文档解析的解码图从「一条长链」改成「布局串行规划 + 各区域内容并发生成」的分支树,靠祖先注意(ancestral atte...

13410

每天3分钟,AI自动给我产出行业动态简报!WorkBuddy自动化工作流保姆级搭建指南

凌乱233

每天手动刷行业新闻、政策、价格,又累又漏?我把跑了半年的「行业动态每日简报」自动化工作流拆开了讲,照着做你也能拥有一座 24 小时在线的 AI 情报站。

6281510

告别“扫描即结束”,AI开启文档处理的“后扫描时代”

用户11926694

市面上绝大多数扫描软件,核心功能都只是把纸质文件变成电子版。如今高清裁剪、智能增强、OCR识别、转格式这些基础功能,各大工具都做得很完善,同质化特别严重。

14010

AI文档解析实战:复杂PDF信息提取指南

Youna

传统的PDF解析工具,在面对多栏排版、合并表格或扫描件时,往往显得力不从心。它们只能“看见”像素和文字碎片,却无法“理解”文档的逻辑结构。随着AI技术,尤其是版...

67410
领券