Posłuchaj skrótu artykułu (Audio)Lektor wygenerowany przez AI
Zbieramy tu doświadczenia z wdrożeń i dajemy je za darmo — nie zastąpią spojrzenia prawnika ani księgowej na Twoją indywidualną sprawę. Na grupach administratorów krąży teza, że do 200 e-maili dziennie w 70-osobowej firmie wystarczy zwykły komputer z używaną RTX 3060 12 GB. Brzmi to przekonująco, bo kwantyzowany model 13B w wersji Q4 zajmuje 8–10 GB VRAM, a oficjalna dokumentacja Ollamy podaje minimum 16 GB RAM dla 13B. Ktoś, kto wieczorem odpalił model na domowym PC, łatwo uwierzy, że firmowe streszczenia to ten sam scenariusz.
Najmocniejszy argument drugiej strony
Zwolennik taniego zestawu ma trochę racji: używana karta z 12 GB VRAM kosztuje 900–1 200 zł, a wraz z 32 GB RAM i półterabajtowym dyskiem da się złożyć maszynę poniżej 4 000 zł. Pojedyncza wiadomość w modelu 13B Q4 generuje się w 15–20 sekund, więc 200 streszczeń to 50–65 minut czystego generowania. Karta pobiera pod obciążeniem ok. 170 W, więc miesięczny koszt prądu wygląda na 60–90 zł. To uczciwa wersja tej tezy: dla jednego użytkownika testującego Ollamę po godzinach to naprawdę działa.

Czego ten argument nie obejmuje
Po pierwsze, 70-osobowa firma to nie jeden użytkownik uruchamiający prompt wieczorem. 200 e-maili dziennie oznacza poranny szczyt: 60–80 wiadomości wpływa między 8:00 a 10:00, a streszczenia mają być gotowe przed spotkaniem. Kolejka na pojedynczej karcie 12 GB potrafi się rozciągnąć do 2–3 godzin, bo system musi obsłużyć dłuższe wątki i załączniki. Po drugie, wersja Q4 przy umowach i ofertach gubi daty i kwoty; dlatego u nas minimum to Q5_K_M. Po trzecie, tani zestaw nie ma 64 GB RAM ECC, redundantnego NVMe ani wentylacji pod pracę 24/7. Gdy 70 osób zaczyna wrzucać 40-załącznikowe wątki, system zaczyna swapować. Dochodzi jeszcze tryb ciągły: serwer pracuje także w nocy, a rachunek za prąd dotyczy całości, nie tylko karty.
Nasze stanowisko
U nas minimalny sensowny serwer pod 13B to 1x RTX 4090 24 GB, 64 GB RAM, procesor 12-rdzeniowy, 2 TB NVMe i zasilacz 850 W. Używane RTX 3090 po 2 500–3 500 zł za sztukę bywają tańsze w zakupie, ale dwie karty w trybie 24/7 mają wyższy pobór w spoczynku. W teście na partii 500 wiadomości pojedyncza karta przetworzyła 200 streszczeń w 41 minut, przy 300 W pod obciążeniem i 70 W w spoczynku. Miesięczny koszt energii przy stawce 1,2 zł/kWh zamknął się u nas w przedziale 120–150 zł dla jednej karty; dla dwóch RTX 3090 wraca w okolice 180–200 zł. Cały zestaw z nową kartą, płytą, RAM i dyskiem to 18 500–21 000 zł brutto. To też mniej ryzyka transferu danych niż zewnętrzne API, co potwierdza podejście UODO.

Instalacja w poniedziałek rano
Kolejność jest zwykle taka: sterownik NVIDIA, CUDA, Ollama z repozytorium, `ollama pull` model 13B w wersji Q5_K_M i test na 50 wiadomościach. Dopiero potem integrujemy IMAP i szablon streszczenia. To, co z tego wynika na ten kwartał: jeśli macie 200 e-maili dziennie i dane wrażliwe, jedna karta RTX 4090 z 64 GB RAM schodzi poniżej 21 000 zł i mieści się w decyzji budżetowej, a prąd kosztuje ok. 130 zł miesięcznie. Zmienilibyśmy to dopiero wtedy, gdy liczba wiadomości przekroczy 500 dziennie albo cena energii spadnie na tyle, że utrzymanie dwóch używanych 3090 przestanie się różnić od jednej 4090.
Materiały, do których zaglądaliśmy przy pisaniu. Tekst powyżej jest nasz; te strony nie odpowiadają za jego treść ani jej nie autoryzowały.