前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >Python下Tesseract Ocr引擎及安装介绍

Python下Tesseract Ocr引擎及安装介绍

作者头像
小小杰啊
发布2022-12-21 21:39:08
1.5K0
发布2022-12-21 21:39:08
举报
文章被收录于专栏:Dimples开发记Dimples开发记

# 1. Tesseract 介绍

tesseract 是一个 google 支持的开源 ocr 项目

其项目地址:https://github.com/tesseract-ocr/tesseract

目前最新的源码可以在这里下载

# 2. Tesseract 安装包下载

Tesseract 的 release 版本下载地址:https://github.com/tesseract-ocr/tesseract/wiki/Downloads,这里需要注意这一段话:

Currently, there is no official Windows installer for newer versions

意思就是官方不提供最新版 windows 平台安装包,只有相对略老的 3.02.02 版本,其下载地址:https://sourceforge.net/projects/tesseract-ocr-alt/files/

最新版 3.03 和 3.05 版本,都是三方维护和管理的安装包,有好几个发行机构,分别是:

  • https://www.dropbox.com/s/8t54mz39i58qslh/tesseract-3.05.00dev-win32-vc19.zip?dl=1
  • https://github.com/UB-Mannheim/tesseract/wiki
  • http://domasofan.spdns.eu/tesseract/

# 3. 小结

  1. 官方发布的 3.02 版本下载地址 http://downloads.sourceforge.net/project/tesseract-ocr-alt/tesseract-ocr-setup-3.02.02.exe?r=https%3A%2F%2Fsourceforge.net%2Fprojects%2Ftesseract-ocr-alt%2Ffiles%2F&ts=1464880498&use_mirror=jaist
  2. 德国曼海姆大学发行的 3.05 版本下载地址 http://digi.bib.uni-mannheim.de/tesseract/tesseract-ocr-setup-3.05.00dev.exe
  3. imon Eigeldinger (@DomasoFan) 维护的另一个版本 > http://3.onj.me/tesseract/ 值得称道的是,这个网址里还有一个比较详细的说明

# 4. Tesseract ocr 使用

安装之后,默认目录 C:\Program Files (x86)\Tesseract-OCR,你需要把这个路径放到你操作系统的 path 搜索路径中,否则后面使用起来会不方便。

在安装目录 C:\Program Files (x86)\Tesseract-OCR 下可以看到 tesseract.exe 这个命令行执行程序

代码语言:javascript
复制
tesseract 1.png output-l eng -psm 7

-psm 7 表示用单行文本识别 pagesegmode 值:

  • 0 =定向和脚本检测(OSD)。
  • 1 =带 OSD 的自动页面分割。
  • 2 =自动页面分割,但没有 OSD 或 OCR
  • 3 =全自动页面分割,但没有 OSD。(默认)
  • 4 =假设一列可变大小的文本。
  • 5 =假设一个统一的垂直对齐文本块。
  • 6 =假设一个统一的文本块。
  • 7 =将图像作为单个文本行处理。
  • 8 =把图像当作一个单词。
  • 9 =把图像当作一个圆圈中的一个词来对待。
  • 10 =将图像作为单个字符处理

#-l eng 代表使用英语识别

本文参与?腾讯云自媒体分享计划,分享自作者个人站点/博客。
原始发表:2022-04-17,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客?前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与?腾讯云自媒体分享计划? ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • # 1. Tesseract 介绍
  • # 2. Tesseract 安装包下载
  • # 3. 小结
  • # 4. Tesseract ocr 使用
相关产品与服务
文字识别
文字识别(Optical Character Recognition,OCR)基于腾讯优图实验室的深度学习技术,将图片上的文字内容,智能识别成为可编辑的文本。OCR 支持身份证、名片等卡证类和票据类的印刷体识别,也支持运单等手写体识别,支持提供定制化服务,可以有效地代替人工录入信息。
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
http://www.vxiaotou.com