Markkinointi ja mainonta20:00
Ile może trwać odpowiedź czatu, zanim klient wyjdzie
Google za dobrą reakcję strony uznaje 200 milisekund. Żaden model tyle nie potrzebuje na odpowiedź — i nie musi, jeśli w tym czasie pokaże cokolwiek. Skąd bierze się opóźnienie i co da się z nim zrobić.

To poradnik z własnego podwórka — liczby progowe pochodzą z dokumentacji Google, reszta z naszych wdrożeń. Wasze pomiary zależą od łącza użytkowników.
Oczekiwania wobec czasu reakcji strony nie są kwestią gustu — są zmierzone i opublikowane. W ramach podstawowych wskaźników internetowych Google używa miary reakcji na działanie użytkownika i podaje progi wprost: do 200 milisekund to reakcja dobra, od 200 do 500 wymaga poprawy, powyżej 500 jest zła. To dotyczy interakcji ze stroną, a nie odpowiedzi modelu — ale ustawia poprzeczkę, przy której użytkownik przestaje mieć wrażenie, że coś działa.

Model nie zmieści się w 200 milisekundach
I nie musi. Rzecz w tym, żeby coś pojawiło się w tym czasie. Odpowiedź strumieniowana, czyli wypisywana słowo po słowie w miarę powstawania, sprawia, że liczy się moment pierwszego znaku, a nie moment ostatniego. Różnica w odbiorze między „cztery sekundy pustego pola” a „tekst zaczyna się po pół sekundy i płynie przez cztery” jest ogromna, choć całkowity czas jest ten sam. To najtańsza poprawa, jaka jest w tym miejscu dostępna, i najczęściej pomijana.
Skąd bierze się reszta opóźnienia, w kolejności od największego udziału. Długość odpowiedzi — model wypisuje ją po kolei, więc dwa razy dłuższa odpowiedź powstaje mniej więcej dwa razy dłużej; skrócenie polecenia „odpowiadaj zwięźle” bywa skuteczniejsze niż zmiana modelu. Rozmiar pakietu wysyłanego do modelu — cała historia rozmowy i dołączone dokumenty muszą zostać przetworzone, zanim padnie pierwsze słowo. Kroki przed modelem — wyszukiwanie w bazie wiedzy, sprawdzenie uprawnień, zapytanie do systemu; każdy z nich dokłada swoje, zanim model w ogóle wystartuje.
Co da się z tym zrobić bez przebudowy
Włączyć strumieniowanie, jeśli jeszcze nie działa — to zwykle jedna flaga. Skrócić polecenie systemowe, które przez pół roku urosło do trzech stron; każde zdanie w nim jest przetwarzane przy każdej odpowiedzi. Rozdzielić modele według zadania — klasyfikacja pytania nie wymaga największego modelu, a stanowi zauważalną część czasu. Pokazać, co się dzieje — komunikat „szukam w bazie wiedzy” w miejsce kręcącego się kółka nie skraca czekania, ale zmienia je z pustego w zrozumiałe, a to wystarcza, żeby ludzie nie zamykali okna.

Warto też zmierzyć to, co widzi użytkownik, a nie to, co pokazuje serwer. Podstawowe wskaźniki internetowe są zbierane z prawdziwych sesji właśnie dlatego, że pomiar u siebie na szybkim łączu nie ma nic wspólnego z telefonem w terenie. Ten sam czat potrafi odpowiadać w sekundę w biurze i w pięć u klienta — i to ta druga liczba decyduje o rozmowie.
Kiedy czas NIE jest problemem
W narzędziach wewnętrznych, gdzie pracownik czeka na odpowiedź, bo alternatywą jest przejrzenie trzydziestu stron regulaminu. Tam kilkanaście sekund jest bez znaczenia, a liczy się wyłącznie trafność. Optymalizowanie takiego narzędzia pod czas odpowiedzi to marnowanie budżetu — cała różnica gra na stronie publicznej, gdzie użytkownik nie ma żadnego powodu, żeby czekać.

Jak stawiamy asystentów na stronie i czym je zasilamy, opisujemy przy prywatnej bazie wiedzy. Widełki kosztów są na stronie o cenach wdrożeń AI.
Lähdemateriaalit
Materiaaleja, joihin viittasimme kirjoittaessamme. Yllä oleva teksti on omamme. Nämä sivustot eivät vastaa sen sisällöstä eivätkä ole sitä valtuuttaneet.
