首页
学习
活动
专区
圈层
工具
发布
首页
学习
活动
专区
圈层
工具
MCP广场
社区首页 >专栏 >使用tesseract训练自己的字库简单方法软件一键训练

使用tesseract训练自己的字库简单方法软件一键训练

作者头像
云未归来
发布2025-07-18 18:13:03
发布2025-07-18 18:13:03
14600
代码可运行
举报
运行总次数:0
代码可运行

tesseract-ocr训练相信在网上大家都看到过,其使用过程需要敲打很多命令而且容易出错,由于每个人的文章层次不齐,导致有的安装其流程或者方法更本行不通,或者卡壳。为了解决训练困难,FIRC最近开发了一个小工具,可以不用写任何代码,您只需要打开软件导入图片,修改校正文字位置和正确文字即可快速得到自己traineddata文件。具体使用方法如下:

第一步:生成BOX:打开软件

导入图片目录,然后选择自己对应图片格式点击生成BOX即可在软件data文件夹下面生成box文件和tif文件,如果您想使用自己合并好的tif文件可以勾选使用外部tif文件即可,然后选择对应的tif文件后点击生成BOX即可生成对应的box文件。

第二步:校正文字位置和识别结果。我们点击识别校正后会弹出软件,然后我们选择Edit BOX即可开始修正自己文字位置和识别果。

第三步:生成字典,点击后会在data文件下面生成traineddata文件,这就是我们需要的文件,然后我编写python代码测试自己文件

代码语言:javascript
代码运行次数:0
运行
复制
# -*- coding: utf-8 -*-
import cv2
import pytesseract
img=cv2.imread(r'C:\Users\Administrator\Desktop\tesseract-ocr-fast-train\FIRC\bin\Release\images\1.png')
print(img.shape)
text = pytesseract.image_to_string(img,lang='FIRC')
print('ocr result is:',text)

注意lang要和自己traineddata对应起来,而且需要把自己的traineddata文件放在tesseract-ocr安装目录的tessdata文件夹下才可以。具体可以观看视频教程:

tesseract-ocr快速训练助手_哔哩哔哩_bilibili

本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2022-03-03,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档