Aller au contenu

Business et déploiements20:04

Préparez les scans PDF pour l'IA : paramètres OCR et noms de fichiers pour lundi

Jak ustawić skanowanie do 300–600 DPI, włączyć warstwę tekstową i nazwać pliki w formacie Typ_Data-Wersja_Status, zanim podłączysz dokumenty do indeksu AI.

Image générée par IA.

Écouter le résumé de l'article

Voix synthétique.
0:00
0:00

Traktuj ten tekst jak notatki praktyka udostępnione za darmo: pokazujemy, jak zwykle się to układa, a nie jak musi wyglądać akurat u Ciebie. Otwórz narzędzie do OCR — będzie to Azure AI Document Intelligence, Google Document AI albo lokalny OCRmyPDF. Na końcu otrzymasz folder ze skanami PDF wyposażonymi w warstwę tekstową i nazwami gotowymi do podpięcia pod indeks AI. Zanim zaczniesz, sprawdź dostęp do folderu ze skanami oraz uprawnienie do utworzenia procesora OCR — w chmurze wymaga to planu płatnego, a w lokalnej instalacji wystarczy konto z uprawnieniami zapisu na dysk.

Utwórz procesor OCR i ustaw parametry skanu (1–2 godziny)

W konsoli Azure otwórz sekcję Azure AI Document Intelligence i wybierz opcję utworzenia procesora OCR. W ustawieniach przetwarzania znajdź pole trybu koloru i zmień je na tryb grayscale/czarno-biały — kolor nie podnosi jakości odczytu, a wydłuża czas. Obok pola rozdzielczości ustaw wartość z przedziału 300–600 DPI. Domyślnie system proponuje 300 DPI; zostaw tę wartość, jeśli skany są ostre, a podnieś do 600 DPI, gdy litery zacierają się na pieczęciach lub planach. Szczegóły pól znajdziesz w dokumentacji Document Intelligence.

Image générée par IA.

Przetwórz próbkę 5 tysięcy plików i zmierz brak tekstu (2–4 tygodnie)

Uruchom przetwarzanie wsadowe na próbce 5 000 plików. Po zakończeniu otwórz raport jakości. Policz dokumenty bez warstwy tekstowej — dopuszczalny odsetek to mniej niż 5%. Jeśli wynik jest wyższy, wróć do ustawień procesora i podnieś rozdzielczość do 400 lub 600 DPI. W narzędziu Google Cloud analogiczną operację wykonasz, wybierając procesor OCR z listy i sprawdzając pole z tekstem wynikowym po przetworzeniu — opis znajdziesz w dokumentacji Document AI.

Przemianuj pliki i oznacz wersje finalne (1 tydzień)

Dla każdego pliku z poprawną warstwą tekstową ustaw nazwę według wzorca [typ]_[data-ISO]_[wersja]_[status].pdf, na przykład Faktura_2025-01-15_v2_final.pdf. Robocze wersje oznacz jako draft i wyklucz je z indeksu. Duplikaty wykrywaj przez wyliczenie hasha SHA-256 — jeśli dwa pliki mają ten sam hash, usuń młodszy. Wersje robocze starsze niż 12 miesięcy od finalizacji przenieś do archiwum lub usuń.

Image générée par IA.

Ustaw filtr final i zbuduj indeks (1 dzień)

W narzędziu indeksującym wybierz folder z przygotowanymi plikami. W regule indeksowania ustaw filtr statusu na final, a pliki z draft oznacz jako wykluczone. Uruchom pierwsze indeksowanie. Po zakończeniu sprawdź na trzech dokumentach z różnych działów, czy wyszukiwanie zwraca właściwą fakturę lub umowę po wpisaniu fragmentu treści.

Po miesiącu od wdrożenia szukanie faktury przestaje zajmować 40 minut, bo system zwraca dokument w 20 sekund na podstawie warstwy tekstowej. Pilotaż na 5 000 plików wykonany przez 2–3 osoby oszczędza około 60 godzin rocznie w porównaniu z ręcznym przeszukiwaniem dysku sieciowego. Więcej o takim wdrożeniu przeczytasz na stronie usług HEXART.

Sources

Documents consultés lors de la rédaction. Le texte ci-dessus est le nôtre; ces plateformes ne sont pas responsables de son contenu et ne l'ont pas validé.

Échange sans engagement

Réserver un atelier avec Paul

Trente minutes ou atelier complet, selon vos besoins. Choisissez votre créneau dans l'agenda, la confirmation est immédiate.

Paul Lazniak

Fondateur de HEXART