Zákaznická podpora20:04
Měření kvality asistenta AI v 500 testovacích párech a panelu 100 odpovědí
Jak propojit automatické vyhodnocování s lidským panelem: 8–14 záměrů, 500–1000 testovacích párů, 100 odpovědí každé 2 týdny a audit každé 3 měsíce.

Poslechněte si shrnutí článku
Syntetický hlas.Zaznamenáváme zde naše zkušenosti z implementací: jde o otevřený návod, nikoli o právní posouzení na míru vaší firmě, konečné rozhodnutí proto konzultujte s právníkem. Na interních schůzkách o kvalitě asistenta stále častěji zaznívá, že automatické vyhodnocení stačí. Spustíte RAGAS nebo Trulens, odečtete faithfulness 0,92, answer relevancy 0,87 a prohlásíte, že bot odpovídá správně. Zní to přesvědčivě: získáte čísla, jsou reprodukovatelná, nezávisí na únavě hodnotitele a zvládnou projít celou historii konverzací za jedinou noc. Má to svou logiku. Problém nastává, když výsledek z LLM soudce bereme jako jediný důkaz, že asistent nezpůsobuje škody.
Nejsilnější protiargument
Zastánci tvrdých metrik mají v jednom pravdu: při 10 000 konverzacích denně člověk nepřečte ani 1 % logů, zatímco automat porovná každou odpověď s kontextem načteným z databáze. Nástroje jako RAGAS a Trulens měří, zda se odpověď drží zdrojů a odpovídá položené otázce. V našich testech takový monitoring odhalí regresi po změně znalostní báze za 30–40 minut, dříve než zasáhne jediného uživatele. Pokud asistent odbaví 1 000 dotazů a 920 skončí správnou odpovědí, úspěšnost činí 92 %, a to je výsledek vhodný pro vedení společnosti.

Co tento argument nezahrnuje
Automatické metriky měří shodu s načteným kontextem, nikoli pravdivost samotného kontextu. Obsahuje-li znalostní báze zastaralý ceník nebo neplatnou dobu doručení, hodnota faithfulness 0,94 znamená, že systém chybu věrně zopakoval. Druhým slepým místem je přílišná horlivost: odpověď může působit důvěryhodně, ale přitom slibovat vrácení peněz v rozporu s obchodními podmínkami. To žádná metrika LLM-as-a-judge neodhalí. V e-commerce může jeden příliš sebevědomý slib doručení vygenerovat desítky vratek; v bance nesprávná informace o poplatku končí reklamací, kterou analytik řeší 2 hodiny. K tomu přistupuje ztráta důvěry: uživatel se po jedné špatné odpovědi k botovi vrací jen zřídka a CSAT po interakci klesá o desítky procentních bodů dříve, než jakýkoli automat problém zaznamená.
Naše stanovisko
Správné měření představuje hybrid: automatická evaluace po každé změně, lidský panel každé 2 týdny a kvartální audit na 500–1000 párech otázka–akceptační kritérium. U nás to funguje takto: automat pokrývá 100 % logů, ale rozhodnutí o dalším provozu systému přijímáme až po panelu. Testovací sadu stavíme z 8–14 nejčastějších produkčních záměrů. Pro každý záměr sbíráme 40 až 120 dotazů, přičemž 30–35 příkladů na třídu tvoří hranici, od které lze počítat s chybou okolo 10 procentních bodů při 95% intervalu spolehlivosti. Pod touto velikostí vzorku je rozdíl mezi 85% a 88% přesností pouhým statistickým šumem.
Kromě přesnosti měříme také míru eskalace na člověka, čas do vyřešení, čisté CSAT a náklady na odvolání. Poměr nad 25 % nebo pokles CSAT o více než 10 bodů při stejné přesnosti signalizuje, že automat příliš často předává dotazy lidem, případně uživatel nedostává očekávaný výsledek. K tomu přistupují regulatorní požadavky: AI Act vyžaduje sledování kvality dat a transparentnost. Logy z konverzací pseudonymizujeme ještě před předáním k lidskému posouzení, protože analýza uživatelských projevů představuje zpracování osobních údajů podle GDPR.

Pro rozhodování v tomto kvartálu to znamená jediné: jednorázový report z RAGAS nestačí. Vyplatí se vytvořit sadu 500–1000 párů z produkce, zavést čtrnáctidenní panel na 100 odpovědích a naplánovat první kvartální audit. Teprve pak uvidíte, zda přesnost roste, nebo driftuje společně se sezónními promoakcemi. Tento postoj bychom přehodnotili pouze tehdy, pokud by asistent fungoval v uzavřené doméně: například stav objednávky z jediného systému, kde lze každou odpověď ověřit deterministicky a automat plně nahradí člověka. U otevřených dotazů na produkty, poplatky a termíny tomu tak není.
Zdrojové materiály
Materiály, ze kterých jsme čerpali při psaní. Výše uvedený text je náš, tyto stránky neodpovídají za jeho obsah ani jej neautorizovaly.
