Перейти до вмісту

Клієнтський сервіс20:04

Вимірювання якості асистента AI на 500 тестових парах і панелі зі 100 відповідей

Як поєднати автоматичну оцінку з людською експертизою: 8–14 інтенцій, 500–1000 тестових пар, 100 відповідей кожні 2 тижні та аудит раз на 3 місяці.

Зображення згенероване AI.

Слухати стислий зміст статті

Синтетичний голос.
0:00
0:00

Тут ми фіксуємо наш практичний досвід впроваджень: це відкритий посібник, а не висновок під вашу компанію, тому остаточне рішення за вашим юристом. На внутрішніх зустрічах щодо якості асистента все частіше лунає фраза, що автоматичної оцінки достатньо. Вмикаєте RAGAS або Trulens, бачите faithfulness 0,92, answer relevancy 0,87 і оголошуєте, що бот відповідає добре. Це звучить переконливо: ви отримуєте стабільні цифри, які не залежать від втоми рев'юера і здатні пройти всю історію розмов за одну ніч. У цьому є сенс. Проблема починається, коли результат судді LLM сприймається як єдиний доказ безпеки асистента.

Найсильніший аргумент іншої сторони

Прихильники точних метрик мають рацію в одному: за умови 10 000 розмов на день людина не прочитає й 1% логів, тоді як алгоритм порівняє кожну відповідь із контекстом з бази знань. Інструменти на зразок RAGAS і Trulens перевіряють, чи спирається відповідь на джерела та чи відповідає вона запитанню. У наших тестах такий моніторинг виявляє регресію після оновлення бази знань за 30–40 хвилин, ще до того, як її побачить бодай один користувач. Якщо асистент опрацює 1 000 запитів і 920 отримають правильну відповідь, точність становить 92%, а такі показники можна показати керівництву.

Зображення згенероване AI.

Чого цей аргумент не охоплює

Автоматичні метрики перевіряють відповідність отриманому контексту, а не правдивість самого контексту. Якщо база знань містить стару таблицю тарифів або застарілий термін доставки, faithfulness 0,94 означає, що система точно відтворила помилку. Друга сліпа зона полягає в надмірній ініціативності: відповідь може звучати переконливо і водночас гарантувати повернення коштів, не передбачене регламентом. Цього не зафіксує жоден показник LLM-as-a-judge. В e-commerce одна помилкова обіцянка щодо доставки спричиняє десятки повернень; у банку неправильна відповідь про комісію призводить до скарги, яку аналітик розбирає 2 години. До цього додаються втрати від зниження довіри: після однієї невдалої відповіді користувач рідко повертається до бота, а CSAT після взаємодії падає на кільканадцять процентних пунктів до того, як проблему помітить автоматика.

Наша позиція

Якісне вимірювання це гібрид: автоматичне оцінювання після кожної зміни, людська панель кожні 2 тижні та щоквартальний аудит на 500–1000 парах запитання–критерій прийняття. У нас це працює так: автоматика охоплює 100% логів, але рішення про підтримку системи приймаємо лише після панелі. Тестовий набір формуємо з 8–14 найчастіших інтенцій у продакшені, а для кожної інтенції збираємо від 40 до 120 запитань. При цьому 30–35 прикладів на клас це межа, від якої можна говорити про похибку близько 10 відсоткових пунктів із довірчим інтервалом 95%. Нижче цієї вибірки різниця між 85% та 88% влучності є статистичним шумом.

Крім влучності, ми вимірюємо рівень ескалації на людину, час до вирішення, чистий CSAT і вартість звернення. Показник понад 25% або падіння CSAT більше ніж на 10 пунктів за однакової влучності це сигнал: автоматика занадто часто перенаправляє до людей або користувач не отримує очікуваного. До цього додається регуляторний аспект: AI Act вимагає моніторингу якості даних і прозорості, а логи розмов ми псевдонімізуємо перед передачею на людську оцінку, адже аналіз повідомлень користувачів є обробкою персональних даних згідно з GDPR.

Зображення згенероване AI.

Для рішень у цьому кварталі це означає одне: разового звіту з RAGAS недостатньо. Варто сформувати набір із 500–1000 пар із продакшену, запустити двотижневу панель на 100 відповідей і запланувати перший щоквартальний аудит. Лише тоді видно, зростає точність чи дрейфує разом із сезонними акціями. Ми змінили б цю позицію, якби асистент працював у замкненому домені, наприклад, статус замовлення з однієї системи, де кожну відповідь можна перевірити детерміновано і автоматика повністю замінює людину. Для відкритих запитань про продукти, тарифи та терміни це не працює.

Джерела інформації

Матеріали, які ми використовували під час написання. Текст вище належить нам. Ці сайти не несуть відповідальності за його зміст і не авторизували його.

Розмова без зобов'язань

Запланувати воркшоп із Paul

Тридцять хвилин або повноцінний воркшоп: оберіть самі. Бронюйте час у календарі, підтвердження надходить одразу.

Paul Lazniak

Засновник HEXART