Onderzoek en modellen20:08
RAG of finetuning van LLM in een week, voordat u 15 duizend uitgeeft
Van 500 instructie-antwoordparen tot 50.000 voorbeelden: drempelwaarden, QLoRA-kosten, de API-variant en een test van één week die de keuze tussen RAG of finetuning beslist.

Beluister de samenvatting van het artikel
Synthetische stem.Beschouw dit als een gratis gids van praktijkexperts: goed als startpunt en voor intern overleg, te beknopt als enige basis voor een ingrijpende beslissing. Maandagochtend, een advocatenkantoor met 180 medewerkers, een archief met 900.000 contracten en adviezen. Een cloudleverancier doet een voorstel: wij finetunen een LLM op uw terminologie, vanaf 15.000 PLN. Voordat iemand een budget goedkeurt, volgt er een week intern werk. Dat toont aan of het überhaupt zin heeft modelgewichten aan te passen in plaats van simpelweg beter te zoeken.

Finetuning is geen documentopslag. Training wijzigt de modelgewichten, waardoor het systeem stijl en structuur aanpast, maar feiten moet het nog steeds extern ophalen. Gaat meer dan 90% van de taken om het zoeken van passages, citeren en samenvatten van bestaande tekst, dan volstaat RAG meestal: het model ontvangt het document in de context en vermeldt de bron. De grondslag voor de verwerking van persoonsgegevens staat in de AVG, en de documentatieverplichtingen voor hoogrisicosystemen in de AI Act.
Wat er deze week al mogelijk is
Stap 1: kies één repeterend proces waarin format leidend is, niet zoekwerk. Denk aan een eerste versie van een addendum, een maandelijks auditrapport of een technische offertebeschrijving. Dit kost de afdelingsdirecteur 2 uur. Stap 2: verzamel 80 instructie-antwoordparen van de afgelopen 3 maanden, zonder persoonsgegevens. 6 uur werk voor één analist. Stap 3: stel 20 testcases en een eenvoudig beoordelingskader op: formatspecificaties, broncorrectheid, correctietijd. 2 uur voor een QA-specialist. Stap 4: draai een basis-RAG op deze 20 cases met de bestaande documentbasis en een open-source vectorengine. 8 uur voor een IT engineer. Stap 5: bereken de tokens van 80 paren en schaal de kosten van QLoRA en de API door naar 500 paren. 1 uur voor de CTO. Totaal 19 werkuren, 0 PLN extra budget.
Wat u niet direct moet doen
De eerste impuls is vaak om het complete archief naar de API te sturen voor training. Dat is meestal een fout: persoonsgegevens en bedrijfsgeheimen belanden in een extern systeem, en na training is het verwijderen van individuele records uit de gewichten technisch complex. Bij persoonsgegevens is vaak een gegevensbeschermingseffectbeoordeling vereist, zoals beschreven door de UODO. Finetuning is geen feitelijk geheugen: na training kan het model nog steeds feiten verzinnen, maar dan in uw stijl. Een A100-kaart aanschaffen vóór een RAG-test is voorbarig, en de doorlopende kosten voor het versiebeheer van het model zijn vaak hoger dan de GPU zelf. De belofte dat het model documenten leert kennen leidt tot teleurstelling: dat is de taak van een vectordatabase. Starten met 50.000 voorbeelden voordat 500 paren gevalideerd zijn, levert dataschuld op in plaats van voorsprong.

Hoe u na twee weken controleert of het werkt
Meet na twee weken RAG-testen op 20 documenten één parameter: het percentage documenten dat zonder inhoudelijke correctie voldoet. Is de score 80% of hoger en bevat elk antwoord de juiste bron, dan is finetuning voorlopig niet rendabel: retrieval loste het probleem op, niet een nieuw model. Zakt de score onder de 60%, dan ligt de oorzaak in de data en niet in de architectuur. Ga in dat geval niet verder trainen, maar schonere data leveren en documenten eenduidig maken.
Blijkt na de test dat RAG volstaat, dan bouwt HEXART de vectordatabase en de documentstroom met bronvermelding. Wijst de uitkomst op finetuning, dan leveren we de trainingset, het versiebeheer van metrieken en een evaluatiepakket, zodat een wissel van het basismodel de implementatie niet verstoort. Bekijk het dienstenaanbod op hexart.pl.
Bronmateriaal
Bronnen die we hebben geraadpleegd bij het schrijven. Bovenstaande tekst is van ons; deze websites zijn niet verantwoordelijk voor de inhoud en hebben deze niet geautoriseerd.
- Kiedy fine-tuning ma sens (a kiedy wystarczy RAG)
- Opodatkowanie przychodów z działalności gospodarczej związanej z rozwojem modeli AI w formie ryczałtu 8,5% - Interpretacja indywidualna z dnia 29 kwietnia 2025 r., Dyrektor Krajowej Informacji Skarbowej, sygn. 0115-KDST2-2.4011.130.2025.2.AP - INFORLEX Freemium
