Pāriet uz saturu

Klientu apkalpošana20:04

AI asistenta kvalitātes mērīšana 500 testa pāros un 100 atbilžu panelī

Kā apvienot automātisko novērtēšanu ar cilvēku paneli: 8–14 nodomi, 500–1000 testa pāri, 100 atbildes ik pēc 2 nedēļām un audits ik pēc 3 mēnešiem.

Attēls ģenerēts ar AI.

Klausīties raksta kopsavilkumu

Sintētiskā balss.
0:00
0:00

Šeit aprakstām, kā šādas lietas izskatās mūsu ieviešanas projektos: tas ir atvērts ceļvedis, nevis atzinums, kas sagatavots tieši jūsu uzņēmumam, tāpēc gala vārdu atstājiet savam juristam. Iekšējās sapulcēs par asistenta kvalitāti arvien biežāk izskan apgalvojums, ka pietiek ar automātisko novērtēšanu. Ieslēdzat RAGAS vai Trulens, redzat faithfulness 0,92, answer relevancy 0,87 un paziņojat, ka bots atbild labi. Tas izklausās pārliecinoši: iegūstat skaitļus, tie ir atkārtojami, nav atkarīgi no recenzenta noguruma un spēj iziet cauri visai sarunu vēsturei vienā naktī. Tam ir pamatots iemesls. Problēma sākas tad, kad LLM tiesneša rezultātu uztveram kā vienīgo pierādījumu tam, ka asistents nerada kaitējumu.

Otrās puses spēcīgākais arguments

Stingro metriku atbalstītājiem ir taisnība vienā lietā: pie 10 000 sarunām dienā cilvēks neizlasīs pat 1% ierakstu, bet automāts salīdzinās katru atbildi ar kontekstu, kas iegūts no bāzes. Rīki kā RAGAS un Trulens mēra, vai atbilde atbilst avotiem un vai tā ir adekvāta jautājumam. Mūsu testos šāds monitorings fiksē regresiju pēc zināšanu bāzes maiņas 30–40 minūtēs, pirms tā paspēj sasniegt kaut vienu lietotāju. Ja asistents apkalpo 1 000 vaicājumu un 920 beidzas ar pareizu atbildi, precizitāte ir 92%, un tas ir variants, ko var rādīt valdei.

Attēls ģenerēts ar AI.

Ko šis arguments neietver

Automātiskās metrikas mēra saskaņotību ar iegūto kontekstu, nevis paša konteksta patiesumu. Ja zināšanu bāze satur vecu tarifu tabulu vai neaktuālu piegādes laiku, faithfulness 0,94 nozīmē, ka sistēma precīzi atkārtoja kļūdu. Otrs aklais punkts ir pārlieku liela centība: atbilde var būt ticama, bet vienlaikus solīt naudas atgriešanu, kas nav paredzēta noteikumos. To nepamanīs neviens LLM-as-a-judge rādītājs. E-komercijā viens pārāk pašpārliecināts piegādes solījums var radīt vairākus desmitus atgriešanu; bankā kļūdaina atbilde par komisijas maksu beidzas ar pretenziju, ko analītiķis pēta 2 stundas. Tam pievienojas uzticības zaudēšanas izmaksas: lietotājs pēc vienas sliktas atbildes reti atgriežas pie bota, un CSAT pēc mijiedarbības nokrītas par vairākiem procentpunktiem, pirms jebkurš automāts pamana problēmu.

Mūsu nostāja

Laba mērīšana ir hibrīds: automātiska novērtēšana pēc katrām izmaiņām, cilvēku panelis ik pēc 2 nedēļām un ceturkšņa audits ar 500–1000 jautājuma un pieņemšanas kritērija pāriem. Pie mums tas darbojas šādi: automātika aptver 100% žurnālu, bet lēmumu par sistēmas uzturēšanu pieņemam tikai pēc paneļa. Testa kopu veidojam no 8–14 biežākajiem produkcijas nolūkiem, un katram nolūkam apkopojam no 40 līdz 120 jautājumiem, turklāt 30–35 piemēri katrai klasei ir robeža, no kuras var runāt par 10 procentpunktu kļūdu ar 95% ticamības intervālu. Zem šīs izlases starpība starp 85% un 88% precizitāti ir statistiskais troksnis.

Papildus precizitātei mēram arī eskalācijas rādītāju cilvēkam, laiku līdz atrisinājumam, tīro CSAT un atsaukuma izmaksas. Rādītājs virs 25% vai CSAT kritums par vairāk nekā 10 punktiem pie tās pašas precizitātes liecina, ka automātika pārāk bieži novirza pie cilvēkiem vai arī lietotājs nesaņem to, ko gaidīja. Tam pievienojas regulatīvais aspekts: AI Act pieprasa datu kvalitātes un caurspīdīguma uzraudzību, un sarunu žurnālus pseidonimizējam, pirms tie nonāk cilvēku novērtēšanā, jo lietotāju izteikumu analīze ir personas datu apstrāde VDAR izpratnē.

Attēls ģenerēts ar AI.

Lēmumam šajā ceturksnī tas nozīmē vienu: ar vienreizēju RAGAS ziņojumu nepietiek. Ir vērts izveidot 500–1000 pāru kopu no produkcijas, palaist divu nedēļu paneli ar 100 atbildēm un ieplānot pirmo ceturkšņa auditu. Tikai tad kļūst redzams, vai precizitāte pieaug, vai dreifē līdzi sezonālajām akcijām. Mēs mainītu šo nostāju, ja asistents darbotos slēgtā domēnā, piemēram, pasūtījuma statuss no vienas sistēmas, kur katru atbildi var pārbaudīt deterministiski un automātika pilnībā aizstāj cilvēku. Atvērtu jautājumu gadījumā par produktiem, maksām un termiņiem tas tā nav.

Avota materiāli

Materiāli, kurus izmantojām rakstīšanas laikā. Iepriekš minētais teksts ir mūsu; šīs vietnes neatbild par tā saturu un nav to autorizējušas.

Saruna bez saistībām

Pieteikt darbnīcu ar Paul

Trīsdesmit minūtes vai pilna darbnīca, izvēlieties paši. Rezervējiet laiku kalendārā, apstiprinājums pienāk uzreiz.

Paul Lazniak

HEXART dibinātājs