JAVA Tesseract OCR引擎

Tess4j是一个基于Tesseract OCR引擎的Java库, Tesseract库最初由惠普实验室于1985年开发，后来被Google收购并于2006年开源。识别效果不好，速度还慢，但是好早好早了。

一、POM依赖

   <!--OCR识别https://digi.bib.uni-mannheim.de/tesseract/tessdata_fast/ 训练文件下载--><dependency><groupId>net.sourceforge.tess4j</groupId><artifactId>tess4j</artifactId><version>5.12.0</version>            </dependency><dependency><groupId>net.java.dev.jna</groupId><artifactId>jna</artifactId><version>5.14.0</version></dependency>

记的要下载训练文件 chi_sim.traineddata

二、配置文件 TesseractOcrConfiguration

import cn.cakeerp.util.StrUtil;
import net.sourceforge.tess4j.Tesseract;
import org.springframework.context.annotation.Bean;
import org.springframework.context.annotation.Configuration;@Configuration
public class TesseractOcrConfiguration {@Beanpublic Tesseract tesseract() {Tesseract tesseract = new Tesseract();// 设置训练数据文件夹路径tesseract.setDatapath(StrUtil.erpConfig.getTraineddata());// 设置为中文简体tesseract.setLanguage("chi_sim");return tesseract;}
}

三、使用

    @Resourceprivate Tesseract tesseract;//直接就可以识别，也可以System.out.println(tesseract.doOCR(new File("d:\\2.jpg")));//也可以从 MultipartFile imageFile 里面识别InputStream is = null;try {is = new ByteArrayInputStream(imageFile.getBytes());BufferedImage bufferedImage = ImageIO.read(is);String textStr = tesseract.doOCR(bufferedImage);if (null == textStr || textStr.trim().equals("")) {return JsonResult.failed("识别失败,结果为空.");}          log.error("识别内容为:{}", textStr);return JsonResult.failed("未识别到订单号", -1);} catch (Exception e) {return JsonResult.failed(e.getMessage(), -1);} finally {if (null != is) {try {is.close();} catch (IOException e) {e.printStackTrace();}}}

后续在官方的仓库中下载到了最新的训练文件 50.2MB结果测试效果还是没啥变化，里面也没有什么可配置的参数。不知道别人怎么用呢。

tessdoc/Data-Files.md at main · tesseract-ocr/tessdoc · GitHub

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.rhkb.cn/news/372617.html

如若内容造成侵权/违法违规/事实不符，请联系长河编程网进行投诉反馈email:809451989@qq.com，一经查实，立即删除！