Liigu sisu juurde

Äri ja juurutused20:04

Valmistage PDF-skannid ette tehisintellekti jaoks: OCR-parameetrid ja failinimed esmaspäevaks

Jak ustawić skanowanie do 300–600 DPI, włączyć warstwę tekstową i nazwać pliki w formacie Typ_Data-Wersja_Status, zanim podłączysz dokumenty do indeksu AI.

Pilt on genereeritud tehisintellekti poolt.

Kuula artikli kokkuvõtet

Sünteetiline hääl.
0:00
0:00

Traktuj ten tekst jak notatki praktyka udostępnione za darmo: pokazujemy, jak zwykle się to układa, a nie jak musi wyglądać akurat u Ciebie. Otwórz narzędzie do OCR — będzie to Azure AI Document Intelligence, Google Document AI albo lokalny OCRmyPDF. Na końcu otrzymasz folder ze skanami PDF wyposażonymi w warstwę tekstową i nazwami gotowymi do podpięcia pod indeks AI. Zanim zaczniesz, sprawdź dostęp do folderu ze skanami oraz uprawnienie do utworzenia procesora OCR — w chmurze wymaga to planu płatnego, a w lokalnej instalacji wystarczy konto z uprawnieniami zapisu na dysk.

Utwórz procesor OCR i ustaw parametry skanu (1–2 godziny)

W konsoli Azure otwórz sekcję Azure AI Document Intelligence i wybierz opcję utworzenia procesora OCR. W ustawieniach przetwarzania znajdź pole trybu koloru i zmień je na tryb grayscale/czarno-biały — kolor nie podnosi jakości odczytu, a wydłuża czas. Obok pola rozdzielczości ustaw wartość z przedziału 300–600 DPI. Domyślnie system proponuje 300 DPI; zostaw tę wartość, jeśli skany są ostre, a podnieś do 600 DPI, gdy litery zacierają się na pieczęciach lub planach. Szczegóły pól znajdziesz w dokumentacji Document Intelligence.

Pilt on genereeritud tehisintellekti poolt.

Przetwórz próbkę 5 tysięcy plików i zmierz brak tekstu (2–4 tygodnie)

Uruchom przetwarzanie wsadowe na próbce 5 000 plików. Po zakończeniu otwórz raport jakości. Policz dokumenty bez warstwy tekstowej — dopuszczalny odsetek to mniej niż 5%. Jeśli wynik jest wyższy, wróć do ustawień procesora i podnieś rozdzielczość do 400 lub 600 DPI. W narzędziu Google Cloud analogiczną operację wykonasz, wybierając procesor OCR z listy i sprawdzając pole z tekstem wynikowym po przetworzeniu — opis znajdziesz w dokumentacji Document AI.

Przemianuj pliki i oznacz wersje finalne (1 tydzień)

Dla każdego pliku z poprawną warstwą tekstową ustaw nazwę według wzorca [typ]_[data-ISO]_[wersja]_[status].pdf, na przykład Faktura_2025-01-15_v2_final.pdf. Robocze wersje oznacz jako draft i wyklucz je z indeksu. Duplikaty wykrywaj przez wyliczenie hasha SHA-256 — jeśli dwa pliki mają ten sam hash, usuń młodszy. Wersje robocze starsze niż 12 miesięcy od finalizacji przenieś do archiwum lub usuń.

Pilt on genereeritud tehisintellekti poolt.

Ustaw filtr final i zbuduj indeks (1 dzień)

W narzędziu indeksującym wybierz folder z przygotowanymi plikami. W regule indeksowania ustaw filtr statusu na final, a pliki z draft oznacz jako wykluczone. Uruchom pierwsze indeksowanie. Po zakończeniu sprawdź na trzech dokumentach z różnych działów, czy wyszukiwanie zwraca właściwą fakturę lub umowę po wpisaniu fragmentu treści.

Po miesiącu od wdrożenia szukanie faktury przestaje zajmować 40 minut, bo system zwraca dokument w 20 sekund na podstawie warstwy tekstowej. Pilotaż na 5 000 plików wykonany przez 2–3 osoby oszczędza około 60 godzin rocznie w porównaniu z ręcznym przeszukiwaniem dysku sieciowego. Więcej o takim wdrożeniu przeczytasz na stronie usług HEXART.

Allikmaterjalid

Materjalid, mida kasutasime kirjutamisel. Ülaltoodud tekst on meie oma; need veebilehed ei vastuta selle sisu eest ega ole seda autoriseerinud.

Kohustusteta konsultatsioon

Broneerige töötuba Pauliga

Kolmkümmend minutit või terve töötuba, valik on teie. Broneerige aeg kalendris, kinnitus saabub kohe.

Paul Lazniak

HEXART asutaja