Forschung und Modelle20:08
RAG oder LLM-Finewisening in einer Woche, bevor Sie 15.000 ausgeben
Von 500 Instruktionspaaren bis 50.000 Beispielen: Schwellenwerte, QLoRA-Kosten, API-Optionen und ein Sieben-Tage-Test zur Entscheidung zwischen RAG und Fine-Tuning.

Zusammenfassung des Artikels anhören
Synthetische Stimme.Nutzen Sie dies als praxisnahen Leitfaden: ideal für den Einstieg und die interne Diskussion, zu kurz gegriffen als alleinige Entscheidungsgrundlage. Montagmorgen, Wirtschaftskanzlei mit 180 Mitarbeitenden, 900.000 Verträge und Gutachten im Archiv. Ein Cloud-Anbieter legt ein Angebot vor: Wir trainieren ein LLM auf Ihre Terminologie ein, Start ab 15.000 PLN. Bevor jemand das Budget freigibt, klärt eine Woche interne Vorarbeit, ob eine Anpassung der Modellgewichte überhaupt sinnvoll ist oder eine optimierte Suche genügt.

Fine-Tuning speichert keine Dokumente im Gedächtnis. Das Training verändert die Modellgewichte. Das System passt Stil und Format an, muss Fakten aber weiterhin extern abrufen. Bestehen über 90% der Aufgaben im Auffinden von Passagen, Zitieren und Zusammenfassen bestehender Texte, reicht meist RAG: Das Modell erhält das Dokument im Kontext und verweist auf die Quelle. Die Rechtsgrundlage für die Verarbeitung personenbezogener Daten regelt die DSGVO, Dokumentationspflichten für Hochrisikosysteme definiert der AI Act.
Was sich diese Woche umsetzen lässt
Erstens: Wählen Sie einen wiederholbaren Prozess, bei dem das Format und nicht die Suche zählt: Vorabversion eines Nachtrags, monatlicher Auditbericht, technische Angebotsbeschreibung. Das erfordert 2 Stunden des Abteilungsleiters. Zweitens: Sammeln Sie 80 Instruktion-Antwort-Paare aus den letzten drei Monaten ohne personenbezogene Daten; 6 Arbeitsstunden eines Analysten. Drittens: Bereiten Sie 20 Testfälle und eine einfache Bewertungsmatrix vor: Formatkonformität, Quellengenauigkeit, Korrekturzeit; 2 Stunden eines QA-Spezialisten. Viertens: Starten Sie ein Basis-RAG auf diesen 20 Fällen unter Verwendung der vorhandenen Dokumentenbasis und einer kostenlosen Vektorengine; 8 Stunden eines IT-Ingenieurs. Fünftens: Zählen Sie die Tokens aus 80 Paaren und skalieren Sie die Kosten für QLoRA sowie die API auf 500 Paare; 1 Stunde des CTO. Insgesamt 19 Arbeitsstunden, 0 PLN neues Budget.
Was Sie nicht sofort tun sollten
Der erste Reflex ist oft, das gesamte Archiv zur Feinabstimmung an eine API zu senden. Das ist meist ein Fehler: Personenbezogene Daten und Geschäftsgeheimnisse gelangen in ein externes System, und nach dem Training ist das Entfernen einzelner Datensätze aus den Gewichten technisch schwierig. Bei personenbezogenen Daten ist oft eine Datenschutz-Folgenabschätzung erforderlich, wie sie die UODO beschreibt. Fine-Tuning ist kein Faktengedächtnis: Das Modell kann nach dem Nachtrainieren weiterhin Fakten erfinden, nur in Ihrem Stil. Eine A100-GPU vor dem RAG-Test ist eine verfrühte Ausgabe, und die laufenden Kosten für die Pflege von Modellversionen übersteigen oft die GPU-Kosten. Das Versprechen, das Modell werde „die Dokumente kennenlernen“, führt zu Enttäuschungen, da dies die Aufgabe einer Vektordatenbank ist. Der Start mit 50.000 Beispielen, bevor 500 Paare validiert sind, erzeugt Datenschulden statt eines Vorsprungs.

Wie Sie nach zwei Wochen den Erfolg prüfen
Messen Sie nach zwei Wochen RAG-Tests an 20 Dokumenten eine einzige Kennzahl: den Anteil der Dokumente, die ohne inhaltliche Korrektur durchgehen. Liegt das Ergebnis bei 80% oder mehr und jede Antwort weist eine korrekte Quelle aus, ist ein Nachtraining vorerst nicht gerechtfertigt: Retrieval hat das Problem gelöst, nicht ein neues Modell. Fällt der Wert unter 60%, liegt die Ursache in den Daten, nicht in der Architektur. Statt weiter zu trainieren, bereinigt man in diesem Fall die Datenbasis und beseitigt Unstimmigkeiten in den Dokumenten.
Reicht RAG nach dem Test aus, unterstützt HEXART beim Aufbau der Vektordatenbank und des Dokumenten-Workflows mit Quellenzitaten. Erfordert das Ergebnis ein Nachtraining, erstellen wir den Trainingsdatensatz, die Metrik-Versionierung und das Evaluierungspaket, damit ein Wechsel des Basismodells die Implementierung nicht gefährdet. Den Leistungsumfang finden Sie auf hexart.pl.
Quellen
Quellen, die wir bei der Erstellung herangezogen haben. Der obige Text stammt von uns; die genannten Seiten haften nicht für den Inhalt und haben ihn nicht autorisiert.
- Kiedy fine-tuning ma sens (a kiedy wystarczy RAG)
- Opodatkowanie przychodów z działalności gospodarczej związanej z rozwojem modeli AI w formie ryczałtu 8,5% - Interpretacja indywidualna z dnia 29 kwietnia 2025 r., Dyrektor Krajowej Informacji Skarbowej, sygn. 0115-KDST2-2.4011.130.2025.2.AP - INFORLEX Freemium
