WikiDer > Tesseract (Software)
tesserakt | ||||
| Entwickler | Ray Smith, Hewlett Packard[1], zunächst, jetzt Google Code | |||
| Letzte Version | 4.1.0 (26. Mai 2019[1]) | |||
| Betriebssystem | Ubuntu 12.04 & 12.04 (32 & 64-Bit), Fenster (32 Bit) und inoffiziell Mac OS X (x86) & Linux (32- und 64-Bit) | |||
| Kategorie | Bildanalyse | |||
| Lizenz | Apache-Lizenz v2.0 | |||
| Versionskontrolle | github.com | |||
| Webseite | github.com/tesseract-ocr | |||
| ||||
tesserakt ist ein kostenlosComputer Programm vor dem optische Zeichenerkennung. Es wurde ursprünglich zwischen 1985 und 1995 unter Lizenz von . entwickelt Hewlett Packard. Nach zehn Jahren ohne Entwicklung haben Hewlett Packard und die Universität von Nevada (Las Vegas) hat es 2005 als Open Source veröffentlicht. Tesseract wird derzeit entwickelt von Google und ausgestellt unter dem Apache-Lizenz 2.0.[1][2][3]
Tesseract gilt als eine der genauesten kostenlosen OCR-Softwaremaschinen, die heute erhältlich sind.[3][4]
Über das Tesseract OCR-Gerät
Tesseract ist ein reines OCR-Gerät. Es hat keine Dokumentformatanalyse, keine Ausgabeformatierung und keine grafische Benutzeroberfläche. Das einzige Format, das es verarbeiten kann, ist a TIFF-Bild einer einzelnen Textspalte, aus der der Text erzeugt wird. Die TIFF-Komprimierung wird nur unterstützt, wenn libtiff ist installiert. Es kann erkennen, ob eine Schriftart proportional ist oder nicht. Die Maschine war 1995 in den Top 3 der Zeichnungsgenauigkeit. Es kann unter Linux, MS Windows und Mac OS X kompiliert und ausgeführt werden, jedoch aufgrund begrenzter Ressourcen nur MS Windows und Ubuntu-Linux sorgfältig von Entwicklern getestet.[2][3]
Tesseract kann Englisch, Französisch, Italienisch, Deutsch, Spanisch, Brasilianisches Portugiesisch und Niederländisch verarbeiten und kann trainiert werden, andere Sprachen zu erkennen.[3]
Tesseract eignet sich als Hintergrundprogramm und kann in Kombination mit a combination für komplexere OCR-Aufgaben, einschließlich Layoutanalysen, verwendet werden Benutzeroberfläche wie OCropus. Eine weitere Integration mit Programmen wie OCRopus zur Unterstützung komplexer Formatierungen ist in Vorbereitung.
Geschichte
Die Tesseract-Maschine wurde zwischen 1985 und 1994 bei Hewlett Packard Laboratories Bristol und bei Hewlett Packard Co, Greeley Colorado entwickelt, mit einigen Änderungen 1996, um sie mit MS Windows kompatibel zu machen, und einer teilweisen Migration von C zu C 1998. Ein Großteil des Quellcodes wurde in C geschrieben, und danach wurde noch mehr in C geschrieben. Anschließend wurde der gesamte Quellcode so konvertiert, dass er mit einem C-Compiler kompiliert werden kann.[2]
Heutzutage kann Tesseract unter Linux kompiliert werden mit GCC 2.95 oder höher und unter MS Windows mit Visual C 6. Der C-Quellcode macht stark von einem Listensystem Gebrauch, das Makros aufrufen. Dieser Code ist älter als der Standardvorlagenbibliothek (STL) von C und kann effizienter sein als die STL-Listen, soll aber im Fall von a . schwieriger zu debuggen sein Segmentierungsfehler. Ein weiterer Nebeneffekt der C/C-Aufteilung besteht darin, dass die C-Datenstrukturen in C-Datenstrukturen umgewandelt werden, um den tieferen C-Code aufzurufen. Die Migration zu C ist ein Schritt zur Beseitigung dieser Umstellung, aber sie ist noch nicht abgeschlossen.
Benutzen
Tesseract ist ein OCR-Gerät, und es hat keine grafische Benutzeroberfläche. Es muss über die Befehlszeile ausgeführt werden und kann mit diesem Befehl aufgerufen werden:[5]
tesseract image.tif-Ausgabe [Optionen]Tesseract liest Grafikdateien TIFF-Format (mit Dateierweiterung.tif);[5] andere Dateiformate müssen zuerst in TIFF konvertiert werden, bevor sie von Tesseract gelesen werden können.
Tesseract unterstützt keine Formatierungs-(Layout-)Analyse, was bedeutet, dass es keinen mehrspaltigen Text, Bilder oder Formeln interpretieren kann und in diesen Fällen zerbrochenen Text als Ausgabe erzeugt.[3]
Außerdem steht ein Python-Wrapper (pytesseract) zur Verfügung, mit dem in Kombination mit der OCR-Engine mit einfachen Python-Befehlen Text gelesen werden kann.
Externe Links
- (und) Tesseract OCR - Projektseite
- (und) Informationswissenschaftliches Forschungsinstitut der University of Nevada, Las Vegas
- (und) C/C-Struktur von Tesseract extrahiert aus Doxyfied-Quellcode (basierend auf Tesseract V1.03)
- (und) Archista-Box
- (und) Tesseract - Zusammenfassung
- (und) Tesseract OCR-Engine (automatischer PDF-Download)
- (und) VietOCR
Nüsse
- ↑ einbcGoogle, tesseract-ocr (2008). Zugegriffen unter 12. Juli 2008.
- ↑ einbcVincent, Luca, Ankündigung von Tesseract OCR (August 2006). Abgelegt am 26. Oktober 2010. Zugegriffen unter 26. Juni 2008.
- ↑ einbcdeCanonical Ltd., OCR (Juni 2008). Zugegriffen unter 12. Juli 2008.
- ↑Willis, Nathan, Googles Tesseract OCR-Engine ist ein Quantensprung nach vorne (September 2006). Abgelegt am 21. Februar 2009. Zugegriffen unter 18. Juli 2008.
- ↑ einbhttp://code.google.com/p/tesseract-ocr/wiki/ReadMe Google Code - Tesseract-Readme