Ga naar inhoud

Marketing en reclame20:00

Ile może trwać odpowiedź czatu, zanim klient wyjdzie

Google za dobrą reakcję strony uznaje 200 milisekund. Żaden model tyle nie potrzebuje na odpowiedź — i nie musi, jeśli w tym czasie pokaże cokolwiek. Skąd bierze się opóźnienie i co da się z nim zrobić.

Afbeelding gegenereerd door AI.

To poradnik z własnego podwórka — liczby progowe pochodzą z dokumentacji Google, reszta z naszych wdrożeń. Wasze pomiary zależą od łącza użytkowników.

Oczekiwania wobec czasu reakcji strony nie są kwestią gustu — są zmierzone i opublikowane. W ramach podstawowych wskaźników internetowych Google używa miary reakcji na działanie użytkownika i podaje progi wprost: do 200 milisekund to reakcja dobra, od 200 do 500 wymaga poprawy, powyżej 500 jest zła. To dotyczy interakcji ze stroną, a nie odpowiedzi modelu — ale ustawia poprzeczkę, przy której użytkownik przestaje mieć wrażenie, że coś działa.

Afbeelding gegenereerd door AI.

Model nie zmieści się w 200 milisekundach

I nie musi. Rzecz w tym, żeby coś pojawiło się w tym czasie. Odpowiedź strumieniowana, czyli wypisywana słowo po słowie w miarę powstawania, sprawia, że liczy się moment pierwszego znaku, a nie moment ostatniego. Różnica w odbiorze między „cztery sekundy pustego pola” a „tekst zaczyna się po pół sekundy i płynie przez cztery” jest ogromna, choć całkowity czas jest ten sam. To najtańsza poprawa, jaka jest w tym miejscu dostępna, i najczęściej pomijana.

Skąd bierze się reszta opóźnienia, w kolejności od największego udziału. Długość odpowiedzi — model wypisuje ją po kolei, więc dwa razy dłuższa odpowiedź powstaje mniej więcej dwa razy dłużej; skrócenie polecenia „odpowiadaj zwięźle” bywa skuteczniejsze niż zmiana modelu. Rozmiar pakietu wysyłanego do modelu — cała historia rozmowy i dołączone dokumenty muszą zostać przetworzone, zanim padnie pierwsze słowo. Kroki przed modelem — wyszukiwanie w bazie wiedzy, sprawdzenie uprawnień, zapytanie do systemu; każdy z nich dokłada swoje, zanim model w ogóle wystartuje.

Co da się z tym zrobić bez przebudowy

Włączyć strumieniowanie, jeśli jeszcze nie działa — to zwykle jedna flaga. Skrócić polecenie systemowe, które przez pół roku urosło do trzech stron; każde zdanie w nim jest przetwarzane przy każdej odpowiedzi. Rozdzielić modele według zadania — klasyfikacja pytania nie wymaga największego modelu, a stanowi zauważalną część czasu. Pokazać, co się dzieje — komunikat „szukam w bazie wiedzy” w miejsce kręcącego się kółka nie skraca czekania, ale zmienia je z pustego w zrozumiałe, a to wystarcza, żeby ludzie nie zamykali okna.

Afbeelding gegenereerd door AI.

Warto też zmierzyć to, co widzi użytkownik, a nie to, co pokazuje serwer. Podstawowe wskaźniki internetowe są zbierane z prawdziwych sesji właśnie dlatego, że pomiar u siebie na szybkim łączu nie ma nic wspólnego z telefonem w terenie. Ten sam czat potrafi odpowiadać w sekundę w biurze i w pięć u klienta — i to ta druga liczba decyduje o rozmowie.

Kiedy czas NIE jest problemem

W narzędziach wewnętrznych, gdzie pracownik czeka na odpowiedź, bo alternatywą jest przejrzenie trzydziestu stron regulaminu. Tam kilkanaście sekund jest bez znaczenia, a liczy się wyłącznie trafność. Optymalizowanie takiego narzędzia pod czas odpowiedzi to marnowanie budżetu — cała różnica gra na stronie publicznej, gdzie użytkownik nie ma żadnego powodu, żeby czekać.

Afbeelding gegenereerd door AI.

Jak stawiamy asystentów na stronie i czym je zasilamy, opisujemy przy prywatnej bazie wiedzy. Widełki kosztów są na stronie o cenach wdrożeń AI.

Bronmateriaal

Bronnen die we hebben geraadpleegd bij het schrijven. Bovenstaande tekst is van ons; deze websites zijn niet verantwoordelijk voor de inhoud en hebben deze niet geautoriseerd.

Vrijblijvend gesprek

Plan een workshop met Paul

Dertig minuten of een volledige workshop, de keuze is aan u. Reserveer direct een moment in de agenda en ontvang meteen een bevestiging.

Paul Lazniak

Oprichter van HEXART