Pāriet uz saturu

Bizness un ieviešana20:04

Sagatavojiet PDF skenējumus AI: OCR parametri un failu nosaukumi pirmdienai

Kā iestatīt skenēšanu uz 300–600 DPI, ieslēgt teksta slāni un nosaukt failus formātā Tips_Datums-Versija_Statuss, pirms pievienojat dokumentus AI indeksam.

Attēls ģenerēts ar AI.

Klausīties raksta kopsavilkumu

Sintētiskā balss.
0:00
0:00

Uztveriet šo tekstu kā praktiķa piezīmes, kas pieejamas bez maksas: parādām, kā tas parasti darbojas, nevis kā tam obligāti jābūt tieši jūsu gadījumā. Atveriet OCR rīku: tas būs Azure AI Document Intelligence, Google Document AI vai lokālais OCRmyPDF. Rezultātā iegūsiet mapi ar skenētiem PDF failiem ar teksta slāni un nosaukumiem, kas gatavi pievienošanai AI indeksam. Pirms sākat, pārbaudiet piekļuvi skenēto failu mapei un tiesības izveidot OCR procesoru: mākonī tam nepieciešams maksas plāns, bet lokālajā instalācijā pietiek ar kontu, kam ir rakstīšanas tiesības diskā.

Izveidojiet OCR procesoru un iestatiet skenēšanas parametrus (1–2 stundas)

Azure konsolē atveriet sadaļu Azure AI Document Intelligence un izvēlieties OCR procesora izveidi. Apstrādes iestatījumos atrodiet krāsu režīma lauku un nomainiet to uz pelēktoņu/melnbalto režīmu: krāsa neuzlabo nolasīšanas kvalitāti, bet palielina apstrādes laiku. Blakus izšķirtspējas laukam iestatiet vērtību diapazonā 300–600 DPI. Pēc noklusējuma sistēma piedāvā 300 DPI; atstājiet šo vērtību, ja skenējumi ir asi, un palieliniet līdz 600 DPI, ja burti saplūst zīmogos vai plānos. Detalizētu lauku aprakstu atradīsiet Document Intelligence dokumentācijā.

Attēls ģenerēts ar AI.

Apstrādājiet 5 tūkstošu failu paraugu un izmēriet teksta trūkumu (2–4 nedēļas)

Palaidiet pakešapstrādi 5 000 failu izlasei. Pēc pabeigšanas atveriet kvalitātes pārskatu. Saskaitiet dokumentus bez teksta slāņa: pieļaujamais īpatsvars ir mazāk par 5%. Ja rādītājs ir augstāks, atgriezieties procesora iestatījumos un palieliniet izšķirtspēju līdz 400 vai 600 DPI. Google Cloud rīkā analoģisku darbību veiksiet, sarakstā izvēloties OCR procesoru un pēc apstrādes pārbaudot iegūtā teksta lauku: apraksts pieejams Document AI dokumentācijā.

Pārdēvējiet failus un atzīmējiet gala versijas (1 nedēļa)

Katram failam ar derīgu teksta slāni iestatiet nosaukumu pēc šablona [tips]_[datums-ISO]_[versija]_[statuss].pdf, piemēram, Faktura_2025-01-15_v2_final.pdf. Darba versijas atzīmējiet kā draft un izslēdziet no indeksa. Dublikātus nosakiet, aprēķinot SHA-256 jaucējkodu: ja diviem failiem ir vienāds jaucējkods, dzēsiet jaunāko. Darba versijas, kas ir vecākas par 12 mēnešiem no pabeigšanas brīža, pārvietojiet uz arhīvu vai dzēsiet.

Attēls ģenerēts ar AI.

Iestatiet filtru final un izveidojiet indeksu (1 diena)

Indeksēšanas rīkā izvēlieties mapi ar sagatavotajiem failiem. Indeksēšanas kārtulā iestatiet statusa filtru uz final, bet failus ar draft atzīmējiet kā izslēgtus. Palaidiet pirmo indeksēšanu. Pēc pabeigšanas pārbaudiet trīs dažādu nodaļu dokumentus, vai meklēšana atgriež pareizo rēķinu vai līgumu pēc teksta fragmenta ievadīšanas.

Mēnesi pēc ieviešanas rēķina meklēšana vairs neaizņem 40 minūtes, jo sistēma atgriež dokumentu 20 sekundēs, balstoties uz teksta slāni. Pilots ar 5 000 failiem, ko veic 2–3 cilvēki, ietaupa apmēram 60 stundas gadā, salīdzinot ar manuālu tīkla diska pārmeklēšanu. Vairāk par šādu ieviešanu lasiet HEXART pakalpojumu lapā.

Avota materiāli

Materiāli, kurus izmantojām rakstīšanas laikā. Iepriekš minētais teksts ir mūsu; šīs vietnes neatbild par tā saturu un nav to autorizējušas.

Saruna bez saistībām

Pieteikt darbnīcu ar Paul

Trīsdesmit minūtes vai pilna darbnīca, izvēlieties paši. Rezervējiet laiku kalendārā, apstiprinājums pienāk uzreiz.

Paul Lazniak

HEXART dibinātājs