首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >5天破万star,又一款国产 OCR 神器杀疯了

5天破万star,又一款国产 OCR 神器杀疯了

作者头像
豆芽菜小萌
发布2026-09-08 19:21:55
发布2026-09-08 19:21:55
400
举报

大家好呀,我是开源先驱~

5 天,GitHub Star 破万。发布次日登顶 GitHub Daily Trending 榜和 Python 榜。HuggingFace、GitHub 四榜第一。这就是百度 Unlimited OCR 交出的成绩单。

有人可能好奇:OCR 这个赛道不是早就卷到头了吗?PaddleOCR、Tesseract、EasyOCR……为什么一个新模型还能引起这么大动静?

答案很简单:以前的 OCR 模型,处理长文档是一场噩梦。

一个典型的翻车现场

假设你有一份 40 页的 PDF 合同需要做 OCR 解析。用传统方案的话,流程是这样的:

01 切页。把 40 页 PDF 拆成 40 张图片,每张独立送进模型。 02 碎片化。每页独立推理意味着模型看不到跨页上下文——表格跨页断开?对不起,它不知道前一页说了什么。 03 拼接。40 次推理跑完后,你还要手动拼接结果。页码、页眉页脚、跨页段落——全得靠后处理逻辑收拾。 04 耗时。40 页 × 每次推理 5 秒 = 200 秒。而且随着页数增加,KV cache 线性膨胀,长文档直接 OOM。

做过文档解析的读者看到这里应该已经开始点头了。

Unlimited OCR 是怎么破局的?

核心创新就一个:Reference Sliding Window Attention (R-SWA)。听起来复杂,但逻辑其实很优雅——

传统方案处理长文档时,每增加一页,KV cache 就膨胀一截。Unlimited OCR 的做法是:KV cache 保持恒定,永远不会超过 L_m + 128。不管你是 10 页、40 页还是 100 页,推理过程的内存占用基本不变。

这意味着什么?40+ 页文档可以在一次前向传播中完成解析。不用切页、不用拼接、不用手动对齐——整份文档扔进去,完整结果出来。

几个让人"哇塞"的数据

🏆 OmniDocBench v1.6:93.92%——开源模型第一,超越 DeepSeek OCR 基线(87.01%)6.91 个百分点 ⚡ 推理速度比 DeepSeek OCR 快 35%——在 6K 输出 token 时已领先,文档越长差距越大 📄 单次前向处理 40+ 页——96.90% Distinct-35 得分,长文档不重复不丢内容 🪶 3B 总参数,仅 500M 激活推理——一张 A800 或 H100 就能跑,不需要多卡集群 📊 9 类文档全面领先——PPT、学术论文、书籍、彩色教科书、试卷、杂志、报纸、笔记、研究报告

保姆级上手

环境要求:Python 3.12 + CUDA 12.9 + NVIDIA GPU

第一步:安装依赖

代码语言:javascript
复制
pip install torch==2.10.0 transformers==4.57.1 Pillow==12.1.1

第二步:几行代码跑起来

代码语言:javascript
复制
from transformers import AutoModel, AutoTokenizer
import torch

model = AutoModel.from_pretrained(
    'baidu/Unlimited-OCR',
    trust_remote_code=True,
    torch_dtype=torch.bfloat16,
).eval().cuda()

tokenizer = AutoTokenizer.from_pretrained('baidu/Unlimited-OCR', trust_remote_code=True)

# 单张图片 OCR — gundam 模式(高精度)
model.infer(
    tokenizer,
    prompt='document parsing.',
    image_file='your_doc.jpg',
    output_path='./output',
    base_size=1024, image_size=640, crop_mode=True,
    max_length=32768,
)

# 多页 PDF — 一次性解析
model.infer_multi(
    tokenizer,
    prompt='Multi page parsing.',
    image_files=['page1.png', 'page2.png', 'page3.png'],
    output_path='./output',
    image_size=1024,
    max_length=32768,
)

第三步:生产环境部署

支持 vLLM 和 SGLang 两种部署方式,都提供 OpenAI 兼容 API:

代码语言:javascript
复制
# Docker 一键部署(vLLM) docker pull vllm/vllm-openai:unlimited-ocr

也支持 ms-swift 微调、百度云一键调用、HuggingFace Spaces 在线体验。

适用人群

如果你属于以下任何一类,Unlimited OCR 都值得你立刻试试:

📄 需要做大量 PDF/文档解析的开发者 🏢 企业文档数字化、合同/发票 OCR 场景 🔬 学术论文批量提取和结构化 🤖 在做 RAG 应用,需要高质量文档解析 pipeline 🧪 OCR 方向研究者,关注 SOTA 方法

小结

Unlimited OCR 做了一件很具体但非常有用的事:把长文档 OCR 从"切页+拼接+祈祷"变成了"一次前向全搞定"。

R-SWA 这个创新看似只是注意力机制的优化,但它解锁了一个之前所有 OCR 模型都在回避的场景——真正的长文档端到端解析。40 页不够?作者团队已经在规划 128K 上下文窗口了。

3B 参数、500M 激活、单卡可跑、MIT 开源——这个诚意,确实值得 5 天破万星。

🔗 GitHub: https://github.com/baidu/Unlimited-OCR

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-29,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 一个典型的翻车现场
  • Unlimited OCR 是怎么破局的?
  • 几个让人"哇塞"的数据
  • 保姆级上手
  • 适用人群
  • 小结
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档