Sari la conținut

Business și implementări20:04

Pregătiți scanările PDF pentru AI: parametri OCR și denumiri de fișiere pentru luni

Cum să setați scanarea la 300–600 DPI, să activați stratul de text și să denumiți fișierele în formatul Tip_Dată-Versiune_Status înainte de a conecta documentele la indexul AI.

Imagine generată de AI.

Ascultați rezumatul articolului

Voce sintetică.
0:00
0:00

Tratați acest text ca pe notițele unui practician oferite gratuit: vă arătăm cum se organizează de obicei lucrurile, nu cum trebuie neapărat să arate în cazul dumneavoastră. Deschideți instrumentul de OCR: acesta poate fi Azure AI Document Intelligence, Google Document AI sau o instalare locală OCRmyPDF. La final veți obține un folder cu scanări PDF dotate cu strat de text și denumiri pregătite pentru conectarea la indexul AI. Înainte de a începe, verificați accesul la folderul cu scanări și permisiunea de a crea un procesor OCR: în cloud este necesar un plan plătit, iar într-o instalare locală este suficient un cont cu permisiuni de scriere pe disc.

Creați procesorul OCR și setați parametrii de scanare (1–2 ore)

În consola Azure deschideți secțiunea Azure AI Document Intelligence și alegeți opțiunea de creare a unui procesor OCR. În setările de procesare căutați câmpul modului de culoare și comutați-l pe modul grayscale/alb-negru: culoarea nu crește calitatea recunoașterii, ci doar prelungește timpul de lucru. Lângă câmpul de rezoluție setați o valoare din intervalul 300–600 DPI. În mod implicit sistemul propune 300 DPI; păstrați această valoare dacă scanările sunt clare și creșteți-o la 600 DPI când caracterele sunt greu lizibile pe ștampile sau planuri. Detalii despre fiecare câmp găsiți în documentația Document Intelligence.

Imagine generată de AI.

Procesați eșantionul de 5.000 de fișiere și măsurați lipsa textului (2–4 săptămâni)

Rulați procesarea în loturi pe un eșantion de 5.000 de fișiere. După finalizare deschideți raportul de calitate. Numărați documentele fără strat de text: procentul acceptabil este de sub 5%. Dacă rezultatul este mai mare, reveniți la setările procesorului și ridicați rezoluția la 400 sau 600 DPI. În instrumentul Google Cloud efectuați o operațiune similară selectând procesorul OCR din listă și verificând câmpul cu textul rezultat după procesare; descrierea este disponibilă în documentația Document AI.

Redenumiți fișierele și marcați versiunile finale (1 săptămână)

Pentru fiecare fișier cu strat de text valid setați denumirea conform șablonului [tip]_[dată-ISO]_[versiune]_[status].pdf, de exemplu Factură_2025-01-15_v2_final.pdf. Marcați versiunile de lucru ca draft și excludeți-le din index. Detectați duplicatele prin calcularea valorii hash SHA-256: dacă două fișiere au același hash, ștergeți fișierul mai recent. Versiunile de lucru mai vechi de 12 luni de la finalizare trebuie arhivate sau șterse.

Imagine generată de AI.

Setați filtrul final și construiți indexul (1 zi)

În instrumentul de indexare selectați folderul cu fișierele pregătite. În regula de indexare setați filtrul de status pe final, iar fișierele marcate cu draft setați-le ca excluse. Rulați prima indexare. După finalizare verificați pe trei documente din departamente diferite dacă funcția de căutare returnează factura sau contractul corect la introducerea unui fragment de text.

La o lună de la implementare căutarea unei facturi nu mai durează 40 de minute, deoarece sistemul returnează documentul în 20 de secunde pe baza stratului de text. Un proiect pilot pe 5.000 de fișiere realizat de 2–3 persoane economisește aproximativ 60 de ore pe an comparativ cu căutarea manuală pe unitatea de rețea. Citiți mai multe despre o astfel de implementare pe pagina de servicii HEXART.

Surse de informare

Surse consultate pentru redactare. Textul de mai sus ne aparține; aceste pagini nu răspund de conținutul său și nu l-au autorizat.

Discuție fără obligații

Programați un workshop cu Paul

Treizeci de minute sau un workshop complet, alegeți dumneavoastră. Rezervați intervalul în calendar, confirmarea sosește imediat.

Paul Lazniak

Fondator HEXART