Powrót do Aktualności

Przygotuj skany PDF do AI: parametry OCR i nazwy plików na poniedziałek

Jak ustawić skanowanie do 300–600 DPI, włączyć warstwę tekstową i nazwać pliki w formacie Typ_Data-Wersja_Status, zanim podłączysz dokumenty do indeksu AI.

Opublikowano16.09.2026
AutorDział Innowacji AI

Posłuchaj skrótu artykułu (Audio)Lektor wygenerowany przez AI

0:00
0:00

Traktuj ten tekst jak notatki praktyka udostępnione za darmo: pokazujemy, jak zwykle się to układa, a nie jak musi wyglądać akurat u Ciebie. Otwórz narzędzie do OCR — będzie to Azure AI Document Intelligence, Google Document AI albo lokalny OCRmyPDF. Na końcu otrzymasz folder ze skanami PDF wyposażonymi w warstwę tekstową i nazwami gotowymi do podpięcia pod indeks AI. Zanim zaczniesz, sprawdź dostęp do folderu ze skanami oraz uprawnienie do utworzenia procesora OCR — w chmurze wymaga to planu płatnego, a w lokalnej instalacji wystarczy konto z uprawnieniami zapisu na dysk.

Utwórz procesor OCR i ustaw parametry skanu (1–2 godziny)

W konsoli Azure otwórz sekcję Azure AI Document Intelligence i wybierz opcję utworzenia procesora OCR. W ustawieniach przetwarzania znajdź pole trybu koloru i zmień je na tryb grayscale/czarno-biały — kolor nie podnosi jakości odczytu, a wydłuża czas. Obok pola rozdzielczości ustaw wartość z przedziału 300–600 DPI. Domyślnie system proponuje 300 DPI; zostaw tę wartość, jeśli skany są ostre, a podnieś do 600 DPI, gdy litery zacierają się na pieczęciach lub planach. Szczegóły pól znajdziesz w dokumentacji Document Intelligence.

Zobrazowanie artykułu

Przetwórz próbkę 5 tysięcy plików i zmierz brak tekstu (2–4 tygodnie)

Uruchom przetwarzanie wsadowe na próbce 5 000 plików. Po zakończeniu otwórz raport jakości. Policz dokumenty bez warstwy tekstowej — dopuszczalny odsetek to mniej niż 5%. Jeśli wynik jest wyższy, wróć do ustawień procesora i podnieś rozdzielczość do 400 lub 600 DPI. W narzędziu Google Cloud analogiczną operację wykonasz, wybierając procesor OCR z listy i sprawdzając pole z tekstem wynikowym po przetworzeniu — opis znajdziesz w dokumentacji Document AI.

Przemianuj pliki i oznacz wersje finalne (1 tydzień)

Dla każdego pliku z poprawną warstwą tekstową ustaw nazwę według wzorca [typ]_[data-ISO]_[wersja]_[status].pdf, na przykład Faktura_2025-01-15_v2_final.pdf. Robocze wersje oznacz jako draft i wyklucz je z indeksu. Duplikaty wykrywaj przez wyliczenie hasha SHA-256 — jeśli dwa pliki mają ten sam hash, usuń młodszy. Wersje robocze starsze niż 12 miesięcy od finalizacji przenieś do archiwum lub usuń.

Zobrazowanie artykułu

Ustaw filtr final i zbuduj indeks (1 dzień)

W narzędziu indeksującym wybierz folder z przygotowanymi plikami. W regule indeksowania ustaw filtr statusu na final, a pliki z draft oznacz jako wykluczone. Uruchom pierwsze indeksowanie. Po zakończeniu sprawdź na trzech dokumentach z różnych działów, czy wyszukiwanie zwraca właściwą fakturę lub umowę po wpisaniu fragmentu treści.

Po miesiącu od wdrożenia szukanie faktury przestaje zajmować 40 minut, bo system zwraca dokument w 20 sekund na podstawie warstwy tekstowej. Pilotaż na 5 000 plików wykonany przez 2–3 osoby oszczędza około 60 godzin rocznie w porównaniu z ręcznym przeszukiwaniem dysku sieciowego. Więcej o takim wdrożeniu przeczytasz na stronie usług HEXART.

Materiały, do których zaglądaliśmy przy pisaniu. Tekst powyżej jest nasz; te strony nie odpowiadają za jego treść ani jej nie autoryzowały.

Gotowy wdrożyć te innowacje u siebie?

Skontaktuj się z ekspertami HEXART i zbudujmy prawdziwą High-Techową przewagę dla Twojej marki na rynku międzynarodowym.