Kundenservice20:04
Qualitätsmessung des KI-Assistenten anhand von 500 Testpaaren und einem Panel von 100 Antworten
Automatische Evaluation mit menschlichem Prüfpanel kombinieren: 8–14 Intentionen, 500–1000 Testpaare, 100 Antworten alle 2 Wochen und Quartalsaudits.

Zusammenfassung des Artikels anhören
Synthetische Stimme.Wir beschreiben hier unsere Praxis aus Kundenprojekten: als offener Leitfaden, nicht als Rechtsberatung für Ihr Unternehmen; übergeben Sie juristische Detailfragen Ihrer Rechtsabteilung. In internen Qualitätsrunden heißt es oft, eine automatische Evaluation genüge. Sie starten RAGAS oder TruLens, lesen Faithfulness 0,92 sowie Answer Relevancy 0,87 ab und erklären die Antworten für gut. Das klingt überzeugend: Die Kennzahlen liegen vor, sind reproduzierbar, unabhängig von menschlicher Ermüdung und verarbeiten ganze Chat-Verläufe über Nacht. Das Verfahren ist valide. Kritisch wird es, wenn das Urteil des LLM-Judges als alleiniger Nachweis gilt, dass der Assistent keine Fehlleistungen erzeugt.
Das stärkste Gegenargument
Befürworter harter Metriken haben in einem Punkt recht: Bei 10.000 Konversationen täglich liest kein Mensch auch nur 1% der Logs, während eine Automatisierung jede Antwort mit dem abgerufenen Datenbankkontext abgleicht. Werkzeuge wie RAGAS und Trulens messen, ob die Antwort quellentreu bleibt und zur Frage passt. In unseren Tests deckt dieses Monitoring Regressionen nach dem Austausch der Wissensbasis in 30–40 Minuten auf, bevor ein einziger Nutzer betroffen ist. Bedient der Assistent 1.000 Anfragen und 920 enden mit einer korrekten Antwort, liegt die Trefferquote bei 92%, ein Wert, den Sie dem Vorstand präsentieren können.

Was dieses Argument übersieht
Automatische Metriken erfassen die Konsistenz mit dem abgerufenen Kontext, nicht den Wahrheitsgehalt des Kontexts selbst. Enthält die Wissensbasis alte Gebührentabellen oder falsche Lieferzeiten, bedeutet ein Faithfulness-Wert von 0,94 lediglich: Das System hat den Fehler präzise wiederholt. Der zweite blinde Fleck ist Übereifer: Eine Antwort klingt plausibel, verspricht jedoch eine Rückerstattung außerhalb der Richtlinien. Kein LLM-as-a-Judge erkennt das. Im E-Commerce verursacht eine vorschnelle Lieferzusage schnell Dutzende Retouren. In der Bank führt eine falsche Auskunft zu Gebühren zu einer Beschwerde, die ein Analyst zwei Stunden lang prüft. Hinzu kommt der Vertrauensverlust: Nach einer falschen Antwort kehren Nutzer selten zum Bot zurück. Der CSAT nach der Interaktion sinkt um zweistellige Prozentpunkte, lange bevor eine Automatisierung das Problem erfasst.
Unser Standpunkt
Eine verlässliche Messung ist ein Hybrid: automatische Evaluierung nach jeder Änderung, ein menschliches Panel alle 2 Wochen und ein quartalsweises Audit mit 500–1000 Paaren aus Frage und Akzeptanzkriterium. Unser Ablauf: Die Automatisierung deckt 100% der Logs ab, die finale Freigabe erfolgt nach dem Panel. Den Testdatensatz bilden wir aus den 8–14 häufigsten Produktionsintentionen mit 40 bis 120 Fragen pro Intention. 30–35 Beispiele pro Klasse markieren die Schwelle für eine Fehlertoleranz von 10 Prozentpunkten bei einem Konfidenzintervall von 95%. Darunter ist der Unterschied zwischen 85% und 88% Genauigkeit statistisches Rauschen.
Neben der Trefferquote erfassen wir die Eskalationsrate an Menschen, die Lösungszeit, den Roh-CSAT und die Kosten pro Eskalation. Eine Rate über 25% oder ein CSAT-Rückgang um mehr als 10 Punkte bei unveränderter Trefferquote zeigen: Das System leitet zu oft weiter oder verfehlt die Erwartung des Nutzers. Hinzu kommt die Regulierung: Der AI Act verlangt Qualitätsmonitoring und Transparenz. Konversationslogs pseudonymisieren wir vor der manuellen Prüfung, da die Analyse von Nutzereingaben die Verarbeitung personenbezogener Daten nach DSGVO darstellt.

Für die Entscheidung in diesem Quartal folgt daraus: Ein einzelner RAGAS-Bericht genügt nicht. Bauen Sie einen Datensatz aus 500–1000 Paaren aus dem Live-Betrieb auf, etablieren Sie ein zweiwöchentliches Panel für 100 Antworten und planen Sie das erste Quartalsaudit. Erst dann wird sichtbar, ob die Treffsicherheit steigt oder mit saisonalen Aktionen abdriftet. Diese Einschätzung griffe nicht, agierte der Assistent in einer geschlossenen Domäne, etwa für den Bestellstatus aus einem Einzelsystem, in dem sich jede Antwort deterministisch prüfen lässt und Software den Menschen vollständig ersetzt. Bei offenen Fragen zu Produkten, Konditionen und Fristen greift das nicht.
Quellen
Quellen, die wir bei der Erstellung herangezogen haben. Der obige Text stammt von uns; die genannten Seiten haften nicht für den Inhalt und haben ihn nicht autorisiert.
