Přejít k obsahu

Výzkum a modely20:08

RAG, nebo dotrénování LLM za týden, než utratíte 15 tisíc

Od 500 párů instrukce-odpověď po 50 000 příkladů: prahové hodnoty, náklady na QLoRA, varianta API a týdenní test, který rozhodne mezi RAG a dotrénováním.

Obraz vygenerovaný přes AI.

Poslechněte si shrnutí článku

Syntetický hlas.
0:00
0:00

Berte tento text jako bezplatný návod od praktiků: poslouží na začátek i pro týmovou diskusi, ale nestačí jako jediný podklad pro zásadní rozhodnutí. Pondělí ráno, advokátní kancelář se 180 lidmi, v archivu 900 tisíc smluv a stanovisek. Cloudový dodavatel představuje nabídku: dotrénujeme LLM na vaši terminologii, start od 15 tisíc PLN. Než kdokoli schválí rozpočet, přichází týden interní práce, který ukáže, zda má vůbec smysl měnit váhy modelu místo prostého zpřesnění vyhledávání.

Obraz vygenerovaný přes AI.

Dotrénování neznamená zapamatování dokumentů. Trénink mění váhy modelu, takže systém začne jinak volit styl a formát, ale fakta musí i nadále čerpat z externích zdrojů. Pokud více než 90 % úkolů tvoří vyhledání pasáže, citace a shrnutí existujícího textu, obvykle stačí RAG: model obdrží dokument v kontextu a odkáže na zdroj. Právní základ pro zpracování osobních údajů definuje GDPR a dokumentační povinnosti pro vysoce rizikové systémy AI Act.

Co lze zvládnout ještě tento týden

Zaprvé: vyberte jeden opakovatelný proces, kde rozhoduje formát, nikoli vyhledávání: návrh dodatku, měsíční zpráva z auditu, technický popis nabídky. Řediteli oddělení to zabere 2 hodiny. Zadruhé: shromážděte 80 párů instrukce-odpověď za poslední tři měsíce, bez osobních údajů; 6 hodin práce jednoho analytika. Zatřetí: připravte 20 testovacích případů a jednoduchá hodnoticí kritéria: dodržení formátu, správnost zdroje, čas korektury; 2 hodiny práce QA specialisty. Začtvrté: nasaďte základní RAG na těchto 20 případů s využitím stávající databáze dokumentů a bezplatného vektorového enginu; 8 hodin práce IT inženýra. Zapáté: spočítejte tokeny z 80 párů a přepočítejte náklady na QLoRA a API pro 500 párů; 1 hodina práce CTO. Celkem 19 hodin práce, 0 PLN nového rozpočtu.

Co nedělat hned na začátku

První reflex velí poslat celý archiv do API k dotrénování. Většinou jde o chybu: osobní údaje a obchodní tajemství směřují do externího systému a odstranění jednotlivých záznamů z vah po tréninku je technicky náročné. U osobních údajů je navíc často nutné projít posouzením vlivu, které popisuje UODO. Fine-tuning není faktografická paměť: model si po dotrénování může dál vymýšlet fakta, jen vaším stylem. Karta A100 před testem RAG představuje předčasný výdaj a průběžné náklady na údržbu verzí modelu bývají vyšší než samotné GPU. Příslib, že model „pozná dokumenty“, vede ke zklamání, protože to je úkolem vektorové databáze. Start s 50 tisíci příklady před validací 500 párů vytváří datový dluh, nikoli výhodu.

Obraz vygenerovaný přes AI.

Jak po dvou týdnech ověřit, že systém funguje

Po dvou týdnech testů RAG na 20 dokumentech sledujte jediný ukazatel: podíl dokumentů, které projdou bez věcné korekce. Pokud výsledek činí 80 % nebo více a každá odpověď má správný zdroj, dotrénování zatím postrádá opodstatnění. Problém vyřešil retrieval, nikoli nový model. Klesne-li ukazatel pod 60 %, příčina tkví v datech, nikoli v architektuře. Místo dalšího trénování se vraťte k čištění databáze a jednoznačnosti dokumentů.

Pokud test prokáže, že RAG stačí, HEXART pomůže vybudovat vektorovou databázi a oběh dokumentů s citacemi zdrojů. Překročí-li výsledky práh pro dotrénování, připravíme trénovací sadu, verzování metrik a evaluační balíček, aby změna základního modelu neohrozila nasazení. Rozsah služeb najdete na hexart.pl.

Zdrojové materiály

Materiály, ze kterých jsme čerpali při psaní. Výše uvedený text je náš, tyto stránky neodpovídají za jeho obsah ani jej neautorizovaly.

Nezávazná konzultace

Domluvit workshop s Paulem

Třicet minut nebo celý workshop, volba je na vás. Termín rezervujete v kalendáři, potvrzení přijde okamžitě.

Paul Lazniak

Zakladatel HEXART