Дослідження та моделі20:08
RAG чи донавчання LLM за тиждень, перш ніж витратите 15 тисяч
Від 500 пар інструкція–відповідь до 50 000 прикладів: пороги, витрати на QLoRA, варіант API та тест за тиждень, який визначає: RAG чи донавчання.

Слухати стислий зміст статті
Синтетичний голос.Сприймайте це як безкоштовний посібник від практиків: корисний на старті та для обговорення в команді, але недостатній як єдина основа для серйозного рішення. Ранок понеділка, юридична компанія на 180 осіб, в архіві 900 тисяч договорів та висновків. Хмарний провайдер презентує пропозицію: донавчимо LLM під вашу термінологію, старт від 15 тисяч PLN. Перш ніж будь-хто погодить бюджет, потрібен тиждень внутрішньої роботи, який покаже, чи є взагалі сенс змінювати ваги моделі замість того, щоб просто краще шукати.

Донавчання не є запам'ятовуванням документів. Навчання змінює ваги моделі, тому система починає інакше добирати стиль і формат, але факти все одно мусить брати ззовні. Якщо понад 90% завдань це пошук фрагмента, цитування та підсумовування наявного тексту, зазвичай вистачає RAG: модель отримує документ у контексті та вказує джерело. Підстави для обробки персональних даних описує RODO, а зобов'язання з документування для систем високого ризику: AI Act.
Що можна зробити цього тижня
По-перше: оберіть один повторюваний процес, де важливий формат, а не пошук: попередня версія додаткової угоди, щомісячний звіт з аудиту, технічний опис пропозиції. Це займе 2 години директора департаменту. По-друге: зберіть 80 пар інструкція–відповідь за останні три місяці, без персональних даних; 6 годин роботи одного аналітика. По-третє: підготуйте 20 тестових випадків і просту шкалу: відповідність формату, коректність джерела, час виправлення; 2 години спеціаліста QA. По-четверте: запустіть базовий RAG на цих 20 випадках, використовуючи наявну базу документів і безкоштовний векторний рушій; 8 годин інженера IT. По-п'яте: порахуйте токени з 80 пар і масштабуйте витрати на QLoRA та API до 500 пар; 1 година CTO. Разом 19 годин роботи, 0 PLN нового бюджету.
Чого не робити одразу
Перший порив, це надіслати весь архів до API для донавчання. Зазвичай це помилка: персональні дані та комерційна таємниця потрапляють до зовнішньої системи, а після навчання видалити окремі записи з ваг технічно складно. У випадку персональних даних часто потрібно пройти оцінку впливу, яку описує UODO. Fine-tuning не є фактографічною пам'яттю: модель після донавчання все ще може вигадувати факти, просто у вашому стилі. Карта A100 перед тестом RAG, це передчасні витрати, а постійна вартість підтримки версії моделі буває вищою за саме GPU. Обіцянка, що модель «вивчить документи», веде до розчарування, бо це завдання векторної бази даних. Старт із 50 тисяч прикладів до того, як 500 пар пройдуть валідацію, створює борг у даних, а не перевагу.

Як перевірити ефективність за два тижні
Після двох тижнів тестів RAG на 20 документах рахуйте один показник: частку документів, які проходять без змістовної корекції. Якщо результат становить 80% або більше і кожна відповідь має правильне джерело, донавчання поки що не має підстав: проблему вирішив retrieval, а не нова модель. Якщо показник падає нижче 60%, це сигнал, що причина полягає в даних, а не в архітектурі. Тоді замість подальшого навчання повертаються до очищення бази та усунення двозначності в документах.
Якщо після тесту виявиться, що RAG достатньо, HEXART допомагає створити векторну базу даних і документообіг із цитуванням джерел. Якщо показники схиляються до донавчання, ми готуємо навчальний набір, версіонування метрик та пакет оцінювання, щоб зміна базової моделі не зірвала впровадження. Перелік послуг знайдете на hexart.pl.
Джерела інформації
Матеріали, які ми використовували під час написання. Текст вище належить нам. Ці сайти не несуть відповідальності за його зміст і не авторизували його.
- Kiedy fine-tuning ma sens (a kiedy wystarczy RAG)
- Opodatkowanie przychodów z działalności gospodarczej związanej z rozwojem modeli AI w formie ryczałtu 8,5% - Interpretacja indywidualna z dnia 29 kwietnia 2025 r., Dyrektor Krajowej Informacji Skarbowej, sygn. 0115-KDST2-2.4011.130.2025.2.AP - INFORLEX Freemium
