Modulario by AMCEF
Demo
📖 Glossar · KI und Automatisierung

OCR

Optical Character Recognition

Technologie zur Texterkennung aus Bildern oder gescannten Dokumenten — wandelt Pixeldaten in Text um, der weiterverarbeitet werden kann.

Was ist OCR?

OCR (Optical Character Recognition) ist eine Technologie zur automatischen Erkennung von Text aus Bildern — gescannten Dokumenten, Fotos, PDF-Dateien (ohne maschinenlesbare Textschicht). OCR analysiert Pixel, identifiziert einzelne Zeichen und fügt sie zu Text zusammen, der weiterverarbeitet, durchsucht, kopiert oder an andere Systeme gesendet werden kann.

Unterschieden wird:

  • Klassisches OCR — Zeichenerkennung (Tesseract, ABBYY)
  • IDP (Intelligent Document Processing) — OCR + KI-Layoutverständnis, versteht auch die Struktur des Dokuments (Tabellen, Überschriften, Fußzeilen)
  • ICR (Intelligent Character Recognition) — Erkennung handgeschriebenen Texts

Modernes, auf Deep Learning basierendes OCR erreicht eine Genauigkeit von 98–99 % bei gedrucktem Text in guter Qualität. Probleme: schiefe Scans, Flecken, unleserliche Stempel, Tabellen ohne klare Linien — hier hilft eine KI/RAG-Kombination.

Im deutschen B2B-Unternehmen hilft OCR am meisten bei:

  • Eingehenden Rechnungen im PDF-Format — Extraktion von Steuernummer, Betrag, MwSt., Fälligkeitsdatum
  • Verträgen — Volltextsuche im Archiv
  • Reisekostenabrechnungen — Lesen von Belegen

Wann wird es eingesetzt

OCR ist der Input für praktisch jede KI-Automatisierung von Dokumenten. Ohne OCR könnte ein KI-Modell keine PDF-Rechnung oder einen gescannten Vertrag verarbeiten.

Siehe Modul Dokumentenextraktion und Modul Dateien.

Verwandte Begriffe

In Modulario

Das Modul Dokumentenextraktion in Modulario kombiniert OCR mit KI-Extraktion — eine PDF-Rechnung kommt per E-Mail an, das System führt OCR durch, das KI-Modell extrahiert alle relevanten Felder und erstellt automatisch einen Eintrag der eingegangenen Rechnung in der Buchhaltung.

Modulario nutzt eine geschichtete Architektur: Bei maschinenlesbaren PDFs wird der Text direkt extrahiert, bei gescannten oder PDFs mit Ebenen wird eine OCR-Engine gestartet, die auf deutschen Sonderzeichen und Umlauten trainiert ist. Die Extraktionsgenauigkeit für gängige Rechnungsfelder (Steuernummer, Betrag, Datum) liegt in Modulario bei ca. 98 %, unklare Fälle werden zur manuellen Überprüfung markiert.

Implementieren Sie OCR in Ihrem Unternehmen?

Modulario deckt die meisten B2B-Prozesse modular ab — setzen Sie nur das ein, was Sie jetzt brauchen, und wachsen Sie schrittweise. Buchen Sie eine kostenlose Beratung.

Dávid Bělousov

Dávid Bělousov

Sales Director

+421 902 826 802 sales@amcef.com
Beratung buchen