Was ist OCR (Texterkennung)?
OCR macht aus Scans und PDFs durchsuchbaren Text. Wo klassische Texterkennung an Grenzen stößt und wie KI aus einer Rechnung verwertbare Felder macht.
Oleksandr Grygoriev · Aktualisiert:
- EingabeOCR (Texterkennung)
- Wissen
- Sprachmodell
- Werkzeuge
- Ergebnis
Inhaltsverzeichnis
OCR (Optical Character Recognition, deutsch: optische Zeichenerkennung) ist eine Technik, die Buchstaben und Ziffern auf Bildern, Scans und PDFs erkennt und in bearbeitbaren Text umwandelt. Aus einem Foto einer Rechnung wird so Text, den ein Programm durchsuchen, kopieren und weiterverarbeiten kann.
OCR gibt es seit Jahrzehnten, viele Bürodrucker mit Scanfunktion bringen sie mit. Neu ist, was danach passiert: Mit KI versteht Software heute auch, welcher Teil des Textes die Rechnungsnummer ist und welcher der Bruttobetrag.
Wie OCR funktioniert
- Bild aufbereiten: Die Software richtet das Dokument gerade aus, erhöht den Kontrast und entfernt Flecken und Schatten.
- Layout erkennen: Sie findet Textblöcke, Zeilen, Tabellen und Bilder und legt die Lesereihenfolge fest.
- Zeichen erkennen: Jedes Zeichen wird mit gelernten Mustern verglichen. Moderne Verfahren lesen ganze Wörter und Zeilen auf einmal, was die Fehlerquote senkt.
- Korrigieren: Ein Wörterbuch und der Satzzusammenhang fangen typische Verwechsler ab, etwa „0“ und „O“ oder „1“ und „l“.
- Ausgeben: Das Ergebnis ist reiner Text oder ein durchsuchbares PDF, bei dem der Text unsichtbar hinter dem Bild liegt.
Wo klassische OCR an Grenzen stößt
Klassische Texterkennung liest Buchstaben, aber sie versteht nicht, was sie liest. Für ein Archiv reicht das: Man findet ein Dokument über die Volltextsuche wieder. Für die Weiterverarbeitung reicht es nicht, aus mehreren Gründen:
- Jeder Lieferant hat ein anderes Layout. Die Rechnungsnummer steht mal oben rechts, mal in einer Tabelle, mal im Fließtext.
- Vorlagen veralten. Ältere Systeme arbeiten mit festen Lesezonen pro Lieferant. Ändert dieser sein Briefpapier, liest das System ins Leere.
- Handschrift und schlechte Fotos treiben die Fehlerquote nach oben.
- Zahlen ohne Bedeutung: Auf einer Rechnung stehen oft zehn Beträge. Welcher ist der zu zahlende?
OCR mit KI: vom Buchstaben zum Datenfeld
Kombiniert man Texterkennung mit Sprachverarbeitung (NLP), liest die Software ein Dokument ähnlich wie ein Mensch. Sie erkennt am Zusammenhang, dass „Rg.-Nr.“, „Invoice No.“ und „Belegnummer“ dasselbe Feld meinen, und findet den Betrag auch dann, wenn er in keinem Standardfeld steht.
Wichtiger als die Erkennung ist die Prüfung danach: Stimmen Netto, Steuer und Brutto rechnerisch? Gibt es den Lieferanten schon? Passt die IBAN zu der, die bisher hinterlegt war? Solche Plausibilitätsprüfungen machen aus einer guten Erkennung einen verlässlichen Ablauf. Unsichere Felder markiert das System, statt zu raten.
Beispiel: eine Eingangsrechnung vom Postfach ins ERP
- Die Rechnung kommt als PDF per E-Mail oder als Foto vom Handy.
- OCR macht daraus Text, die KI zieht Lieferant, Rechnungsnummer, Datum, Positionen, Beträge und Bankverbindung heraus.
- Das System gleicht die Rechnung mit der Bestellung und dem Wareneingang ab.
- Passt alles, entsteht ein Buchungsvorschlag in der ERP-Software. Weicht etwas ab, landet die Rechnung mit markierter Abweichung bei der zuständigen Person.
- Nach der Freigabe wird das Original revisionssicher abgelegt.
Die Buchhaltung tippt nichts mehr ab. Sie kümmert sich nur noch um die Fälle, bei denen wirklich etwas nicht stimmt.
Braucht man OCR noch, wenn die E-Rechnung kommt?
Im B2B-Geschäft wird die elektronische Rechnung in Deutschland schrittweise Pflicht: Seit 2025 müssen Unternehmen E-Rechnungen empfangen können, die Pflicht zum Ausstellen folgt in Stufen bis 2028. Formate wie XRechnung und ZUGFeRD enthalten die Daten bereits maschinenlesbar — hier ist keine Texterkennung nötig. OCR bleibt trotzdem wichtig: für Kleinbetragsrechnungen, Belege aus dem Ausland, für Quittungen, Lieferscheine, Formulare, Verträge und alles, was noch auf Papier im Betrieb ankommt.
Tipps für bessere Erkennung
- Scannen Sie mit mindestens 300 dpi; Handyfotos bei Tageslicht und von oben aufnehmen.
- Lassen Sie sich PDFs direkt vom Lieferanten schicken, statt Ausdrucke wieder einzuscannen.
- Legen Sie einen festen Eingangskanal fest, etwa eine eigene Adresse für Rechnungen.
Nutzen und Risiken
Der Nutzen ist schnell gezählt: weniger Abtippen, weniger Tippfehler, schnellere Freigaben und Dokumente, die man per Suche findet. Die Risiken liegen im Detail. Eine falsch gelesene Ziffer in einer IBAN kann teuer werden, deshalb gehören Bankdaten und Beträge immer in eine Plausibilitätsprüfung. Außerdem gelten die Aufbewahrungsregeln der GoBD: Das Dokument selbst wird unverändert archiviert, der erkannte Text allein reicht dafür nicht.
In der Praxis: Belege lesen, Zahlungen zuordnen
Bei der Verarbeitung von Dokumenten und Daten ist OCR für uns der erste Schritt, nicht das Ziel. Belege werden aus Fotos und PDFs gelesen, danach ordnet das System Kontoauszüge den Rechnungen zu. In einem Kundenprojekt wurden so 1.051 von 1.268 Zahlungen automatisch der passenden Rechnung zugeordnet — über die Nummer im Verwendungszweck, auch bei Sammelüberweisungen. Von 1.723 scheinbar offenen Posten blieben 266 wirklich offene übrig.
Ihr Team prüft Abweichungen, statt abzutippen. Das erste Ergebnis sehen Sie nach etwa 14 Tagen.
Häufige Fragen
Was bedeutet OCR?
OCR steht für Optical Character Recognition, auf Deutsch optische Zeichenerkennung oder Texterkennung. Gemeint ist das Umwandeln von Text auf Bildern in bearbeitbaren Text.
Wie genau ist OCR?
Bei sauberen, maschinengeschriebenen Dokumenten erkennen gute Programme fast jedes Zeichen richtig. Bei Handschrift, schiefen Handyfotos und schlechten Kopien sinkt die Genauigkeit deutlich. Plausibilitätsprüfungen fangen die verbleibenden Fehler ab.
Kann OCR Handschrift lesen?
Moderne, KI-gestützte Verfahren lesen auch Handschrift, besonders Druckbuchstaben in Formularen. Bei flüssiger Schreibschrift bleibt eine menschliche Kontrolle sinnvoll.
Zusammenfassung
OCR wandelt Bilder von Text in echten Text um. Allein macht sie Dokumente durchsuchbar; zusammen mit KI und Plausibilitätsprüfungen macht sie aus Rechnungen, Belegen und Formularen Daten, die ohne Abtippen im ERP ankommen.
Brauchen Sie Unterstützung?
Unsere Experten helfen Ihnen, die richtigen SEO- und Digitalstrategien für Ihr Unternehmen umzusetzen.
Erstgespräch vereinbarenWeitere Artikel im Wiki-Lexikon
Was ist ein LLM (Large Language Model)?
LLM einfach erklärt: wie große Sprachmodelle Text erzeugen, was Tokens und Kontext sind, warum sie halluzinieren und was das für Ihr Unternehmen heißt.
Begriff öffnenWas ist RAG (Retrieval Augmented Generation)?
RAG einfach erklärt: wie eine KI vor der Antwort in Ihren Dokumenten nachschlägt. Vier Schritte, Beispiele aus dem Mittelstand und die Grenzen.
Begriff öffnenWas ist Agentic AI?
Agentic AI plant Arbeitsschritte selbst und nutzt Werkzeuge. Was agentische KI vom Chatbot trennt, welche Autonomiestufen es gibt und wo der Mensch bleibt.
Begriff öffnenWas ist das Model Context Protocol (MCP)?
Das Model Context Protocol verbindet KI-Assistenten mit CRM, ERP und Dateien. Was ein MCP-Server ist, der Unterschied zur API und die Risiken.
Begriff öffnen