Zum Inhalt springen

Business und Implementierungen20:04

Bereiten Sie PDF-Scans für KI vor: OCR-Parameter und Dateinamen bis Montag

So stellen Sie Scans auf 300–600 DPI ein, aktivieren die Textebene und benennen Dateien im Format Typ_Datum-Version_Status, bevor Sie Dokumente an den KI-Index anbinden.

Bild generiert durch KI.

Zusammenfassung des Artikels anhören

Synthetische Stimme.
0:00
0:00

Nutzen Sie diesen Text als kostenlose Praxisnotizen: Wir zeigen bewährte Standards, keine starren Vorgaben für jeden Einzelfall. Öffnen Sie Ihr OCR-Tool: Azure AI Document Intelligence, Google Document AI oder lokal OCRmyPDF. Am Ende erhalten Sie einen Ordner mit durchsuchbaren PDF-Scans inklusive Textebene und standardisierten Dateinamen, bereit für den KI-Index. Prüfen Sie vorab den Zugriff auf den Scan-Ordner und die Berechtigungen zur Einrichtung des OCR-Prozessors. In der Cloud erfordert dies einen kostenpflichtigen Plan, lokal genügt ein Benutzerkonto mit Schreibrechten.

OCR-Prozessor erstellen und Scan-Parameter konfigurieren (1–2 Stunden)

Öffnen Sie in der Azure-Konsole den Bereich Azure AI Document Intelligence und wählen Sie die Erstellung eines OCR-Prozessors. Finden Sie in den Verarbeitungseinstellungen das Feld für den Farbmodus und ändern Sie es auf Graustufen-/Schwarzweißmodus: Farbe verbessert die Erkennungsqualität nicht, verlängert jedoch die Verarbeitungszeit. Stellen Sie neben dem Auflösungsfeld einen Wert zwischen 300–600 DPI ein. Standardmäßig schlägt das System 300 DPI vor. Behalten Sie diesen Wert bei scharfen Scans bei und erhöhen Sie ihn auf 600 DPI, wenn Zeichen auf Stempeln oder Plänen verschwimmen. Details zu den Feldern finden Sie in der Dokumentation zu Document Intelligence.

Bild generiert durch KI.

Stichprobe von 5.000 Dateien verarbeiten und fehlenden Text messen (2–4 Wochen)

Starten Sie die Batch-Verarbeitung mit einer Stichprobe von 5.000 Dateien. Öffnen Sie nach Abschluss den Qualitätsbericht. Zählen Sie die Dokumente ohne Textebene: Der zulässige Anteil liegt bei unter 5%. Liegt das Ergebnis höher, kehren Sie zu den Prozessoreinstellungen zurück und erhöhen Sie die Auflösung auf 400 oder 600 DPI. In Google Cloud führen Sie den gleichen Schritt durch, indem Sie einen OCR-Prozessor aus der Liste wählen und das Feld mit dem Ausgabetext nach der Verarbeitung prüfen. Die Beschreibung finden Sie in der Dokumentation zu Document AI.

Dateien umbenennen und finale Versionen kennzeichnen (1 Woche)

Benennen Sie jede Datei mit korrekter Textebene nach dem Muster [Typ]_[ISO-Datum]_[Version]_[Status].pdf, zum Beispiel Rechnung_2025-01-15_v2_final.pdf. Markieren Sie Arbeitsversionen als draft und schließen Sie diese vom Index aus. Erkennen Sie Duplikate über den SHA-256-Hashwert: Weisen zwei Dateien denselben Hash auf, löschen Sie die neuere Datei. Verschieben Sie Entwürfe, die älter als 12 Monate nach Finalisierung sind, ins Archiv oder löschen Sie diese.

Bild generiert durch KI.

Final-Filter einrichten und Index aufbauen (1 Tag)

Wählen Sie im Indexierungswerkzeug den Ordner mit den vorbereiteten Dateien. Setzen Sie in der Indexierungsregel den Statusfilter auf final und schließen Sie Dateien mit draft aus. Starten Sie die erste Indexierung. Prüfen Sie anschließend anhand von drei Dokumenten aus unterschiedlichen Abteilungen, ob die Suche nach Eingabe eines Textfragments die richtige Rechnung oder den richtigen Vertrag liefert.

Einen Monat nach dem Rollout dauert die Rechnungssuche statt 40 Minuten nur noch 20 Sekunden, da das System Dokumente direkt über die Textebene findet. Ein Pilotprojekt mit 5.000 Dateien, umgesetzt von 2–3 Personen, spart im Vergleich zur manuellen Suche auf dem Netzlaufwerk rund 60 Stunden pro Jahr. Mehr über diese Implementierung erfahren Sie auf der HEXART-Leistungsseite.

Quellen

Quellen, die wir bei der Erstellung herangezogen haben. Der obige Text stammt von uns; die genannten Seiten haften nicht für den Inhalt und haben ihn nicht autorisiert.

Unverbindliches Gespräch

Workshop mit Paul vereinbaren

Dreißig Minuten oder ein kompletter Workshop: Sie entscheiden. Wählen Sie den Termin direkt im Kalender, die Bestätigung folgt sofort.

Paul Lazniak

Gründer von HEXART