Přejít k obsahu

Zákaznická podpora20:04

Měření kvality asistenta AI v 500 testovacích párech a panelu 100 odpovědí

Jak propojit automatické vyhodnocování s lidským panelem: 8–14 záměrů, 500–1000 testovacích párů, 100 odpovědí každé 2 týdny a audit každé 3 měsíce.

Obraz vygenerovaný přes AI.

Poslechněte si shrnutí článku

Syntetický hlas.
0:00
0:00

Zaznamenáváme zde naše zkušenosti z implementací: jde o otevřený návod, nikoli o právní posouzení na míru vaší firmě, konečné rozhodnutí proto konzultujte s právníkem. Na interních schůzkách o kvalitě asistenta stále častěji zaznívá, že automatické vyhodnocení stačí. Spustíte RAGAS nebo Trulens, odečtete faithfulness 0,92, answer relevancy 0,87 a prohlásíte, že bot odpovídá správně. Zní to přesvědčivě: získáte čísla, jsou reprodukovatelná, nezávisí na únavě hodnotitele a zvládnou projít celou historii konverzací za jedinou noc. Má to svou logiku. Problém nastává, když výsledek z LLM soudce bereme jako jediný důkaz, že asistent nezpůsobuje škody.

Nejsilnější protiargument

Zastánci tvrdých metrik mají v jednom pravdu: při 10 000 konverzacích denně člověk nepřečte ani 1 % logů, zatímco automat porovná každou odpověď s kontextem načteným z databáze. Nástroje jako RAGAS a Trulens měří, zda se odpověď drží zdrojů a odpovídá položené otázce. V našich testech takový monitoring odhalí regresi po změně znalostní báze za 30–40 minut, dříve než zasáhne jediného uživatele. Pokud asistent odbaví 1 000 dotazů a 920 skončí správnou odpovědí, úspěšnost činí 92 %, a to je výsledek vhodný pro vedení společnosti.

Obraz vygenerovaný přes AI.

Co tento argument nezahrnuje

Automatické metriky měří shodu s načteným kontextem, nikoli pravdivost samotného kontextu. Obsahuje-li znalostní báze zastaralý ceník nebo neplatnou dobu doručení, hodnota faithfulness 0,94 znamená, že systém chybu věrně zopakoval. Druhým slepým místem je přílišná horlivost: odpověď může působit důvěryhodně, ale přitom slibovat vrácení peněz v rozporu s obchodními podmínkami. To žádná metrika LLM-as-a-judge neodhalí. V e-commerce může jeden příliš sebevědomý slib doručení vygenerovat desítky vratek; v bance nesprávná informace o poplatku končí reklamací, kterou analytik řeší 2 hodiny. K tomu přistupuje ztráta důvěry: uživatel se po jedné špatné odpovědi k botovi vrací jen zřídka a CSAT po interakci klesá o desítky procentních bodů dříve, než jakýkoli automat problém zaznamená.

Naše stanovisko

Správné měření představuje hybrid: automatická evaluace po každé změně, lidský panel každé 2 týdny a kvartální audit na 500–1000 párech otázka–akceptační kritérium. U nás to funguje takto: automat pokrývá 100 % logů, ale rozhodnutí o dalším provozu systému přijímáme až po panelu. Testovací sadu stavíme z 8–14 nejčastějších produkčních záměrů. Pro každý záměr sbíráme 40 až 120 dotazů, přičemž 30–35 příkladů na třídu tvoří hranici, od které lze počítat s chybou okolo 10 procentních bodů při 95% intervalu spolehlivosti. Pod touto velikostí vzorku je rozdíl mezi 85% a 88% přesností pouhým statistickým šumem.

Kromě přesnosti měříme také míru eskalace na člověka, čas do vyřešení, čisté CSAT a náklady na odvolání. Poměr nad 25 % nebo pokles CSAT o více než 10 bodů při stejné přesnosti signalizuje, že automat příliš často předává dotazy lidem, případně uživatel nedostává očekávaný výsledek. K tomu přistupují regulatorní požadavky: AI Act vyžaduje sledování kvality dat a transparentnost. Logy z konverzací pseudonymizujeme ještě před předáním k lidskému posouzení, protože analýza uživatelských projevů představuje zpracování osobních údajů podle GDPR.

Obraz vygenerovaný přes AI.

Pro rozhodování v tomto kvartálu to znamená jediné: jednorázový report z RAGAS nestačí. Vyplatí se vytvořit sadu 500–1000 párů z produkce, zavést čtrnáctidenní panel na 100 odpovědích a naplánovat první kvartální audit. Teprve pak uvidíte, zda přesnost roste, nebo driftuje společně se sezónními promoakcemi. Tento postoj bychom přehodnotili pouze tehdy, pokud by asistent fungoval v uzavřené doméně: například stav objednávky z jediného systému, kde lze každou odpověď ověřit deterministicky a automat plně nahradí člověka. U otevřených dotazů na produkty, poplatky a termíny tomu tak není.

Zdrojové materiály

Materiály, ze kterých jsme čerpali při psaní. Výše uvedený text je náš, tyto stránky neodpovídají za jeho obsah ani jej neautorizovaly.

Nezávazná konzultace

Domluvit workshop s Paulem

Třicet minut nebo celý workshop, volba je na vás. Termín rezervujete v kalendáři, potvrzení přijde okamžitě.

Paul Lazniak

Zakladatel HEXART