大家好呀,我是开源先驱~
5 天,GitHub Star 破万。发布次日登顶 GitHub Daily Trending 榜和 Python 榜。HuggingFace、GitHub 四榜第一。这就是百度 Unlimited OCR 交出的成绩单。
有人可能好奇:OCR 这个赛道不是早就卷到头了吗?PaddleOCR、Tesseract、EasyOCR……为什么一个新模型还能引起这么大动静?
答案很简单:以前的 OCR 模型,处理长文档是一场噩梦。

假设你有一份 40 页的 PDF 合同需要做 OCR 解析。用传统方案的话,流程是这样的:
01 切页。把 40 页 PDF 拆成 40 张图片,每张独立送进模型。 02 碎片化。每页独立推理意味着模型看不到跨页上下文——表格跨页断开?对不起,它不知道前一页说了什么。 03 拼接。40 次推理跑完后,你还要手动拼接结果。页码、页眉页脚、跨页段落——全得靠后处理逻辑收拾。 04 耗时。40 页 × 每次推理 5 秒 = 200 秒。而且随着页数增加,KV cache 线性膨胀,长文档直接 OOM。
做过文档解析的读者看到这里应该已经开始点头了。
核心创新就一个:Reference Sliding Window Attention (R-SWA)。听起来复杂,但逻辑其实很优雅——
传统方案处理长文档时,每增加一页,KV cache 就膨胀一截。Unlimited OCR 的做法是:KV cache 保持恒定,永远不会超过 L_m + 128。不管你是 10 页、40 页还是 100 页,推理过程的内存占用基本不变。
这意味着什么?40+ 页文档可以在一次前向传播中完成解析。不用切页、不用拼接、不用手动对齐——整份文档扔进去,完整结果出来。
🏆 OmniDocBench v1.6:93.92%——开源模型第一,超越 DeepSeek OCR 基线(87.01%)6.91 个百分点 ⚡ 推理速度比 DeepSeek OCR 快 35%——在 6K 输出 token 时已领先,文档越长差距越大 📄 单次前向处理 40+ 页——96.90% Distinct-35 得分,长文档不重复不丢内容 🪶 3B 总参数,仅 500M 激活推理——一张 A800 或 H100 就能跑,不需要多卡集群 📊 9 类文档全面领先——PPT、学术论文、书籍、彩色教科书、试卷、杂志、报纸、笔记、研究报告
环境要求:Python 3.12 + CUDA 12.9 + NVIDIA GPU
第一步:安装依赖
pip install torch==2.10.0 transformers==4.57.1 Pillow==12.1.1第二步:几行代码跑起来
from transformers import AutoModel, AutoTokenizer
import torch
model = AutoModel.from_pretrained(
'baidu/Unlimited-OCR',
trust_remote_code=True,
torch_dtype=torch.bfloat16,
).eval().cuda()
tokenizer = AutoTokenizer.from_pretrained('baidu/Unlimited-OCR', trust_remote_code=True)
# 单张图片 OCR — gundam 模式(高精度)
model.infer(
tokenizer,
prompt='document parsing.',
image_file='your_doc.jpg',
output_path='./output',
base_size=1024, image_size=640, crop_mode=True,
max_length=32768,
)
# 多页 PDF — 一次性解析
model.infer_multi(
tokenizer,
prompt='Multi page parsing.',
image_files=['page1.png', 'page2.png', 'page3.png'],
output_path='./output',
image_size=1024,
max_length=32768,
)第三步:生产环境部署
支持 vLLM 和 SGLang 两种部署方式,都提供 OpenAI 兼容 API:
# Docker 一键部署(vLLM) docker pull vllm/vllm-openai:unlimited-ocr也支持 ms-swift 微调、百度云一键调用、HuggingFace Spaces 在线体验。
如果你属于以下任何一类,Unlimited OCR 都值得你立刻试试:
📄 需要做大量 PDF/文档解析的开发者 🏢 企业文档数字化、合同/发票 OCR 场景 🔬 学术论文批量提取和结构化 🤖 在做 RAG 应用,需要高质量文档解析 pipeline 🧪 OCR 方向研究者,关注 SOTA 方法
Unlimited OCR 做了一件很具体但非常有用的事:把长文档 OCR 从"切页+拼接+祈祷"变成了"一次前向全搞定"。
R-SWA 这个创新看似只是注意力机制的优化,但它解锁了一个之前所有 OCR 模型都在回避的场景——真正的长文档端到端解析。40 页不够?作者团队已经在规划 128K 上下文窗口了。
3B 参数、500M 激活、单卡可跑、MIT 开源——这个诚意,确实值得 5 天破万星。
🔗 GitHub: https://github.com/baidu/Unlimited-OCR