Sari la conținut

Serviciul clienți20:04

Măsurarea calității asistentului AI pe 500 de perechi de test și un panel de 100 de răspunsuri

Cum să combinați evaluarea automată cu un juriu uman: 8–14 intenții, 500–1000 de perechi de test, 100 de răspunsuri la fiecare 2 săptămâni și audit la fiecare 3 luni.

Imagine generată de AI.

Ascultați rezumatul articolului

Voce sintetică.
0:00
0:00

Prezentăm aici abordarea noastră practică din implementări: este un ghid deschis, nu o consultanță juridică dedicată companiei dumneavoastră, deci lăsați decizia finală juriștilor. În ședințele interne privind calitatea asistentului se aude tot mai des că evaluarea automată este suficientă. Porniți RAGAS sau TruLens, citiți fidelitatea de 0,92, relevanța răspunsului de 0,87 și declarați că botul răspunde corect. Pare convingător: primiți cifre concrete, reproductibile, independente de oboseala evaluatorilor, capabile să analizeze întregul istoric al conversațiilor într-o singură noapte. Există o logică clară aici. Problema apare atunci când considerăm verdictul unui LLM evaluator drept singura dovadă că asistentul nu generează erori dăunătoare.

Cel mai solid argument al celeilalte părți

Susținătorii metricilor stricte au dreptate într-un punct: la 10 000 de conversații pe zi, un om nu poate parcurge nici măcar 1% din loguri, în timp ce un sistem automat compară fiecare răspuns cu datele preluate din baza de cunoștințe. Instrumente precum RAGAS și TruLens măsoară conformitatea răspunsului cu sursele și relevanța lui față de întrebare. În testele noastre, această monitorizare identifică regresia după modificarea bazei de cunoștințe în 30–40 de minute, înainte ca eroarea să ajungă la utilizatori. Dacă asistentul gestionează 1000 de solicitări și 920 primesc răspunsuri corecte, acuratețea este de 92%, o cifră direct raportabilă către conducere.

Imagine generată de AI.

Ce nu acoperă acest argument

Metricile automate măsoară coerența cu datele preluate, nu validitatea datelor în sine. Dacă baza de cunoștințe conține o listă de prețuri depășită sau un termen de livrare incorect, o fidelitate de 0,94 arată doar că sistemul a reprodus fidel o eroare. Al doilea punct vulnerabil este excesul de zel: un răspuns poate părea credibil, dar poate promite o returnare neprevăzută în regulament. Niciun indicator de tip LLM-as-a-judge nu detectează acest aspect. În e-commerce, o promisiune eronată privind livrarea generează zeci de retururi; în bănci, o informație greșită despre comisioane aduce reclamații complexe care consumă ore de analiză. La acestea se adaugă pierderea încrederii: utilizatorul dezamăgit evită interacțiunile viitoare, iar scorul CSAT scade considerabil înainte ca sistemul automat să semnaleze problema.

Poziția noastră

O evaluare eficientă este hibridă: verificare automată după fiecare modificare, revizuire umană la fiecare 2 săptămâni și un audit trimestrial pe 500–1000 de perechi întrebare-criteriu de acceptare. În practica noastră, automatizarea acoperă 100% din loguri, dar decizia de menținere a sistemului depinde de evaluarea umană. Setul de testare include 8–14 dintre cele mai frecvente intenții din producție, cu 40 până la 120 de întrebări pentru fiecare intenție. Pragul de 30–35 de exemple pe categorie permite menținerea marjei de eroare la circa 10 puncte procentuale, cu un interval de încredere de 95%. Sub acest volum, diferența dintre o acuratețe de 85% și 88% reprezintă doar o variație statistică nesemnificativă.

Pe lângă acuratețe, măsurăm și rata de escaladare către operator uman, timpul până la rezolvare, CSAT brut și costul apelului. O rată de peste 25% sau o scădere a CSAT cu mai mult de 10 puncte la aceeași acuratețe semnalează faptul că sistemul automat redirecționează prea des către oameni sau că utilizatorul nu primește răspunsul așteptat. Se adaugă aspectul de conformitate: AI Act impune monitorizarea calității datelor și transparența, iar logurile conversațiilor le pseudonimizăm înainte de evaluarea umană, deoarece analiza mesajelor utilizatorilor constituie prelucrare de date cu caracter personal conform GDPR.

Imagine generată de AI.

Pentru decizia din acest trimestru, concluzia este clară: un raport unic RAGAS nu este suficient. Recomandăm crearea unui set de 500–1000 de perechi din producție, lansarea unui panel bilunar pe 100 de răspunsuri și programarea primului audit trimestrial. Abia atunci se observă dacă acuratețea crește sau deviază odată cu promoțiile de sezon. Ne-am schimba această poziție dacă asistentul ar funcționa într-un domeniu închis, de exemplu verificarea statusului unei comenzi dintr-un singur sistem, unde fiecare răspuns poate fi validat deterministic, iar sistemul automat înlocuiește complet omul. În cazul întrebărilor deschise despre produse, comisioane și termene, situația este diferită.

Surse de informare

Surse consultate pentru redactare. Textul de mai sus ne aparține; aceste pagini nu răspund de conținutul său și nu l-au autorizat.

Discuție fără obligații

Programați un workshop cu Paul

Treizeci de minute sau un workshop complet, alegeți dumneavoastră. Rezervați intervalul în calendar, confirmarea sosește imediat.

Paul Lazniak

Fondator HEXART