Posłuchaj skrótu artykułu (Audio)Lektor wygenerowany przez AI
Traktuj ten tekst jak notatki praktyka udostępnione za darmo: pokazujemy, jak zwykle się to układa, a nie jak musi wyglądać akurat u Ciebie. Otwórz narzędzie do OCR — będzie to Azure AI Document Intelligence, Google Document AI albo lokalny OCRmyPDF. Na końcu otrzymasz folder ze skanami PDF wyposażonymi w warstwę tekstową i nazwami gotowymi do podpięcia pod indeks AI. Zanim zaczniesz, sprawdź dostęp do folderu ze skanami oraz uprawnienie do utworzenia procesora OCR — w chmurze wymaga to planu płatnego, a w lokalnej instalacji wystarczy konto z uprawnieniami zapisu na dysk.
Utwórz procesor OCR i ustaw parametry skanu (1–2 godziny)
W konsoli Azure otwórz sekcję Azure AI Document Intelligence i wybierz opcję utworzenia procesora OCR. W ustawieniach przetwarzania znajdź pole trybu koloru i zmień je na tryb grayscale/czarno-biały — kolor nie podnosi jakości odczytu, a wydłuża czas. Obok pola rozdzielczości ustaw wartość z przedziału 300–600 DPI. Domyślnie system proponuje 300 DPI; zostaw tę wartość, jeśli skany są ostre, a podnieś do 600 DPI, gdy litery zacierają się na pieczęciach lub planach. Szczegóły pól znajdziesz w dokumentacji Document Intelligence.

Przetwórz próbkę 5 tysięcy plików i zmierz brak tekstu (2–4 tygodnie)
Uruchom przetwarzanie wsadowe na próbce 5 000 plików. Po zakończeniu otwórz raport jakości. Policz dokumenty bez warstwy tekstowej — dopuszczalny odsetek to mniej niż 5%. Jeśli wynik jest wyższy, wróć do ustawień procesora i podnieś rozdzielczość do 400 lub 600 DPI. W narzędziu Google Cloud analogiczną operację wykonasz, wybierając procesor OCR z listy i sprawdzając pole z tekstem wynikowym po przetworzeniu — opis znajdziesz w dokumentacji Document AI.
Przemianuj pliki i oznacz wersje finalne (1 tydzień)
Dla każdego pliku z poprawną warstwą tekstową ustaw nazwę według wzorca [typ]_[data-ISO]_[wersja]_[status].pdf, na przykład Faktura_2025-01-15_v2_final.pdf. Robocze wersje oznacz jako draft i wyklucz je z indeksu. Duplikaty wykrywaj przez wyliczenie hasha SHA-256 — jeśli dwa pliki mają ten sam hash, usuń młodszy. Wersje robocze starsze niż 12 miesięcy od finalizacji przenieś do archiwum lub usuń.

Ustaw filtr final i zbuduj indeks (1 dzień)
W narzędziu indeksującym wybierz folder z przygotowanymi plikami. W regule indeksowania ustaw filtr statusu na final, a pliki z draft oznacz jako wykluczone. Uruchom pierwsze indeksowanie. Po zakończeniu sprawdź na trzech dokumentach z różnych działów, czy wyszukiwanie zwraca właściwą fakturę lub umowę po wpisaniu fragmentu treści.
Po miesiącu od wdrożenia szukanie faktury przestaje zajmować 40 minut, bo system zwraca dokument w 20 sekund na podstawie warstwy tekstowej. Pilotaż na 5 000 plików wykonany przez 2–3 osoby oszczędza około 60 godzin rocznie w porównaniu z ręcznym przeszukiwaniem dysku sieciowego. Więcej o takim wdrożeniu przeczytasz na stronie usług HEXART.
Materiały, do których zaglądaliśmy przy pisaniu. Tekst powyżej jest nasz; te strony nie odpowiadają za jego treść ani jej nie autoryzowały.