Перейти до вмісту

Бізнес і впровадження20:04

Підготуйте скани PDF для AI: параметри OCR і назви файлів на понеділок

Як налаштувати сканування на 300–600 DPI, увімкнути текстовий шар і назвати файли у форматі Тип_Дата-Версія_Статус перед підключенням документів до індексу AI.

Зображення згенероване AI.

Слухати стислий зміст статті

Синтетичний голос.
0:00
0:00

Сприймайте цей текст як безкоштовні нотатки практика: показуємо, як це зазвичай працює, а не як має бути саме у вас. Відкрийте інструмент для OCR: Azure AI Document Intelligence, Google Document AI або локальний OCRmyPDF. На виході отримаєте папку зі сканами PDF із текстовим шаром і назвами, готовими до підключення до індексу AI. Перед початком перевірте доступ до папки зі сканами та права на створення процесора OCR: у хмарі потрібен платний тариф, а для локального встановлення достатньо облікового запису з правами запису на диск.

Створіть процесор OCR і налаштуйте параметри сканування (1–2 години)

У консолі Azure відкрийте розділ Azure AI Document Intelligence і виберіть створення процесора OCR. У налаштуваннях обробки знайдіть поле режиму кольору та перемкніть його на режим grayscale/чорно-білий: колір не покращує якість розпізнавання, але збільшує час. Поруч із полем роздільної здатності встановіть значення з діапазону 300–600 DPI. За замовчуванням система пропонує 300 DPI; залиште це значення, якщо скани чіткі, або підвищіть до 600 DPI, якщо літери зливаються на печатках чи схемах. Детальний опис полів наведено в документації Document Intelligence.

Зображення згенероване AI.

Обробіть вибірку з 5 тисяч файлів і виміряйте відсутність тексту (2–4 тижні)

Запустіть пакетну обробку на вибірці з 5 000 файлів. Після завершення відкрийте звіт про якість. Підрахуйте документи без текстового шару: допустима частка становить менше ніж 5%. Якщо показник вищий, поверніться до налаштувань процесора та підвищіть роздільну здатність до 400 або 600 DPI. В інструменті Google Cloud аналогічну дію можна виконати, вибравши процесор OCR зі списку та перевіривши поле з вихідним текстом після обробки; опис доступний у документації Document AI.

Перейменуйте файли та позначте фінальні версії (1 тиждень)

Для кожного файлу з коректним текстовим шаром установіть назву за шаблоном [тип]_[дата-ISO]_[версія]_[статус].pdf, наприклад Faktura_2025-01-15_v2_final.pdf. Робочі версії позначте як draft і виключіть їх з індексу. Дублікати виявляйте за допомогою хешу SHA-256: якщо два файли мають однаковий хеш, видаліть новіший. Чернетки, створені понад 12 місяців тому після фіналізації, перемістіть в архів або видаліть.

Зображення згенероване AI.

Встановіть фільтр final і побудуйте індекс (1 день)

В інструменті індексації виберіть папку з підготовленими файлами. У правилі індексації встановіть фільтр статусу на final, а файли з draft позначте як виключені. Запустіть першу індексацію. Після завершення перевірте на трьох документах з різних відділів, чи повертає пошук правильний рахунок або договір після введення фрагмента тексту.

Через місяць після впровадження пошук рахунку перестає займати 40 хвилин, адже система повертає документ за 20 секунд на основі текстового шару. Пілот на 5 000 файлів, виконаний 2–3 людьми, заощаджує близько 60 годин на рік порівняно з ручним пошуком на мережевому диску. Більше про таке впровадження читайте на сторінці послуг HEXART.

Джерела інформації

Матеріали, які ми використовували під час написання. Текст вище належить нам. Ці сайти не несуть відповідальності за його зміст і не авторизували його.

Розмова без зобов'язань

Запланувати воркшоп із Paul

Тридцять хвилин або повноцінний воркшоп: оберіть самі. Бронюйте час у календарі, підтвердження надходить одразу.

Paul Lazniak

Засновник HEXART