Prejsť na obsah

Biznis a implementácie20:04

Pripravte skeny PDF pre AI: parametre OCR a názvy súborov na pondelok

Jak ustawić skanowanie do 300–600 DPI, włączyć warstwę tekstową i nazwać pliki w formacie Typ_Data-Wersja_Status, zanim podłączysz dokumenty do indeksu AI.

Obraz vygenerovaný cez AI.

Vypočujte si zhrnutie článku

Syntetický hlas.
0:00
0:00

Traktuj ten tekst jak notatki praktyka udostępnione za darmo: pokazujemy, jak zwykle się to układa, a nie jak musi wyglądać akurat u Ciebie. Otwórz narzędzie do OCR — będzie to Azure AI Document Intelligence, Google Document AI albo lokalny OCRmyPDF. Na końcu otrzymasz folder ze skanami PDF wyposażonymi w warstwę tekstową i nazwami gotowymi do podpięcia pod indeks AI. Zanim zaczniesz, sprawdź dostęp do folderu ze skanami oraz uprawnienie do utworzenia procesora OCR — w chmurze wymaga to planu płatnego, a w lokalnej instalacji wystarczy konto z uprawnieniami zapisu na dysk.

Utwórz procesor OCR i ustaw parametry skanu (1–2 godziny)

W konsoli Azure otwórz sekcję Azure AI Document Intelligence i wybierz opcję utworzenia procesora OCR. W ustawieniach przetwarzania znajdź pole trybu koloru i zmień je na tryb grayscale/czarno-biały — kolor nie podnosi jakości odczytu, a wydłuża czas. Obok pola rozdzielczości ustaw wartość z przedziału 300–600 DPI. Domyślnie system proponuje 300 DPI; zostaw tę wartość, jeśli skany są ostre, a podnieś do 600 DPI, gdy litery zacierają się na pieczęciach lub planach. Szczegóły pól znajdziesz w dokumentacji Document Intelligence.

Obraz vygenerovaný cez AI.

Przetwórz próbkę 5 tysięcy plików i zmierz brak tekstu (2–4 tygodnie)

Uruchom przetwarzanie wsadowe na próbce 5 000 plików. Po zakończeniu otwórz raport jakości. Policz dokumenty bez warstwy tekstowej — dopuszczalny odsetek to mniej niż 5%. Jeśli wynik jest wyższy, wróć do ustawień procesora i podnieś rozdzielczość do 400 lub 600 DPI. W narzędziu Google Cloud analogiczną operację wykonasz, wybierając procesor OCR z listy i sprawdzając pole z tekstem wynikowym po przetworzeniu — opis znajdziesz w dokumentacji Document AI.

Przemianuj pliki i oznacz wersje finalne (1 tydzień)

Dla każdego pliku z poprawną warstwą tekstową ustaw nazwę według wzorca [typ]_[data-ISO]_[wersja]_[status].pdf, na przykład Faktura_2025-01-15_v2_final.pdf. Robocze wersje oznacz jako draft i wyklucz je z indeksu. Duplikaty wykrywaj przez wyliczenie hasha SHA-256 — jeśli dwa pliki mają ten sam hash, usuń młodszy. Wersje robocze starsze niż 12 miesięcy od finalizacji przenieś do archiwum lub usuń.

Obraz vygenerovaný cez AI.

Ustaw filtr final i zbuduj indeks (1 dzień)

W narzędziu indeksującym wybierz folder z przygotowanymi plikami. W regule indeksowania ustaw filtr statusu na final, a pliki z draft oznacz jako wykluczone. Uruchom pierwsze indeksowanie. Po zakończeniu sprawdź na trzech dokumentach z różnych działów, czy wyszukiwanie zwraca właściwą fakturę lub umowę po wpisaniu fragmentu treści.

Po miesiącu od wdrożenia szukanie faktury przestaje zajmować 40 minut, bo system zwraca dokument w 20 sekund na podstawie warstwy tekstowej. Pilotaż na 5 000 plików wykonany przez 2–3 osoby oszczędza około 60 godzin rocznie w porównaniu z ręcznym przeszukiwaniem dysku sieciowego. Więcej o takim wdrożeniu przeczytasz na stronie usług HEXART.

Zdrojové materiály

Podklady, ktoré sme využili pri písaní. Text vyššie je náš, tieto stránky nezodpovedajú za jeho obsah ani ho neautorizovali.

Nezáväzný rozhovor

Dohodnúť workshop s Paulom

Tridsať minút alebo celý workshop, vyberte si sami. Termín si rezervujete v kalendári, potvrdenie príde okamžite.

Paul Lazniak

Zakladateľ HEXART