Byznys a implementace20:04
Připravte skeny PDF pro AI: parametry OCR a názvy souborů na pondělí
Jak nastavit skenování na 300–600 DPI, zapnout textovou vrstvu a pojmenovat soubory ve formátu Typ_Datum-Verze_Stav před připojením dokumentů do AI indexu.

Poslechněte si shrnutí článku
Syntetický hlas.Berte tento text jako bezplatné poznámky z praxe: ukazujeme obvyklý postup, ne jediné možné řešení pro vaši firmu. Otevřete nástroj pro OCR: Azure AI Document Intelligence, Google Document AI nebo lokální OCRmyPDF. Výsledkem bude složka se skeny PDF včetně textové vrstvy a s názvy připravenými pro indexaci v AI. Než začnete, zkontrolujte přístup ke složce se skeny a oprávnění k vytvoření OCR procesoru. V cloudu je vyžadován placený tarif, při lokální instalaci stačí účet s právy zápisu na disk.
Vytvořte procesor OCR a nastavte parametry skenování (1–2 hodiny)
V konzoli Azure otevřete sekci Azure AI Document Intelligence a zvolte vytvoření OCR procesoru. V nastavení zpracování vyhledejte režim barev a přepněte jej na stupně šedi / černobíle: barva nezvyšuje přesnost rozpoznávání, pouze prodlužuje čas. U rozlišení nastavte hodnotu v rozsahu 300–600 DPI. Výchozí hodnota je 300 DPI. Ponechte ji, pokud jsou skeny ostré, a zvyšte na 600 DPI, pokud jsou písmena rozmazaná na razítkách nebo nákresech. Podrobnosti k polím najdete v dokumentaci Document Intelligence.

Zpracujte vzorek 5 tisíc souborů a změřte absenci textu (2–4 týdny)
Spusťte dávkové zpracování na vzorku 5 000 souborů. Po dokončení otevřete report kvality. Spočítejte dokumenty bez textové vrstvy: přípustný podíl je méně než 5 %. Pokud je podíl vyšší, vraťte se do nastavení procesoru a zvyšte rozlišení na 400 nebo 600 DPI. V Google Cloud provedete stejnou operaci výběrem OCR procesoru ze seznamu a kontrolou výsledného textového pole po zpracování. Popis najdete v dokumentaci Document AI.
Přejmenujte soubory a označte finální verze (1 týden)
Každý soubor se správnou textovou vrstvou pojmenujte podle vzoru [typ]_[datum-ISO]_[verze]_[stav].pdf, například Faktura_2025-01-15_v2_final.pdf. Pracovní verze označte jako draft a vylučte je z indexace. Duplicity detekujte výpočtem hashe SHA-256: pokud mají dva soubory stejný hash, odstraňte novější. Pracovní verze starší než 12 měsíců od dokončení přesuňte do archivu nebo smažte.

Nastavte filtr final a sestavte index (1 den)
V indexačním nástroji vyberte složku s připravenými soubory. V pravidle indexace nastavte filtr stavu na final a soubory s označením draft vylučte. Spusťte první indexaci. Po dokončení ověřte na třech dokumentech z různých oddělení, zda vyhledávání vrátí správnou fakturu nebo smlouvu po zadání části textu.
Po měsíci od nasazení už hledání faktury netrvá 40 minut, protože systém vrátí dokument za 20 sekund na základě textové vrstvy. Pilotní projekt na 5 000 souborech zpracovaný 2–3 lidmi ušetří přibližně 60 hodin ročně ve srovnání s ručním prohledáváním síťového disku. Více informací o této implementaci najdete na stránce služeb HEXART.
Zdrojové materiály
Materiály, ze kterých jsme čerpali při psaní. Výše uvedený text je náš, tyto stránky neodpovídají za jeho obsah ani jej neautorizovaly.
