Zum Inhalt springen

Forschung und Modelle20:08

RAG oder LLM-Finewisening in einer Woche, bevor Sie 15.000 ausgeben

Von 500 Instruktionspaaren bis 50.000 Beispielen: Schwellenwerte, QLoRA-Kosten, API-Optionen und ein Sieben-Tage-Test zur Entscheidung zwischen RAG und Fine-Tuning.

Bild generiert durch KI.

Zusammenfassung des Artikels anhören

Synthetische Stimme.
0:00
0:00

Nutzen Sie dies als praxisnahen Leitfaden: ideal für den Einstieg und die interne Diskussion, zu kurz gegriffen als alleinige Entscheidungsgrundlage. Montagmorgen, Wirtschaftskanzlei mit 180 Mitarbeitenden, 900.000 Verträge und Gutachten im Archiv. Ein Cloud-Anbieter legt ein Angebot vor: Wir trainieren ein LLM auf Ihre Terminologie ein, Start ab 15.000 PLN. Bevor jemand das Budget freigibt, klärt eine Woche interne Vorarbeit, ob eine Anpassung der Modellgewichte überhaupt sinnvoll ist oder eine optimierte Suche genügt.

Bild generiert durch KI.

Fine-Tuning speichert keine Dokumente im Gedächtnis. Das Training verändert die Modellgewichte. Das System passt Stil und Format an, muss Fakten aber weiterhin extern abrufen. Bestehen über 90% der Aufgaben im Auffinden von Passagen, Zitieren und Zusammenfassen bestehender Texte, reicht meist RAG: Das Modell erhält das Dokument im Kontext und verweist auf die Quelle. Die Rechtsgrundlage für die Verarbeitung personenbezogener Daten regelt die DSGVO, Dokumentationspflichten für Hochrisikosysteme definiert der AI Act.

Was sich diese Woche umsetzen lässt

Erstens: Wählen Sie einen wiederholbaren Prozess, bei dem das Format und nicht die Suche zählt: Vorabversion eines Nachtrags, monatlicher Auditbericht, technische Angebotsbeschreibung. Das erfordert 2 Stunden des Abteilungsleiters. Zweitens: Sammeln Sie 80 Instruktion-Antwort-Paare aus den letzten drei Monaten ohne personenbezogene Daten; 6 Arbeitsstunden eines Analysten. Drittens: Bereiten Sie 20 Testfälle und eine einfache Bewertungsmatrix vor: Formatkonformität, Quellengenauigkeit, Korrekturzeit; 2 Stunden eines QA-Spezialisten. Viertens: Starten Sie ein Basis-RAG auf diesen 20 Fällen unter Verwendung der vorhandenen Dokumentenbasis und einer kostenlosen Vektorengine; 8 Stunden eines IT-Ingenieurs. Fünftens: Zählen Sie die Tokens aus 80 Paaren und skalieren Sie die Kosten für QLoRA sowie die API auf 500 Paare; 1 Stunde des CTO. Insgesamt 19 Arbeitsstunden, 0 PLN neues Budget.

Was Sie nicht sofort tun sollten

Der erste Reflex ist oft, das gesamte Archiv zur Feinabstimmung an eine API zu senden. Das ist meist ein Fehler: Personenbezogene Daten und Geschäftsgeheimnisse gelangen in ein externes System, und nach dem Training ist das Entfernen einzelner Datensätze aus den Gewichten technisch schwierig. Bei personenbezogenen Daten ist oft eine Datenschutz-Folgenabschätzung erforderlich, wie sie die UODO beschreibt. Fine-Tuning ist kein Faktengedächtnis: Das Modell kann nach dem Nachtrainieren weiterhin Fakten erfinden, nur in Ihrem Stil. Eine A100-GPU vor dem RAG-Test ist eine verfrühte Ausgabe, und die laufenden Kosten für die Pflege von Modellversionen übersteigen oft die GPU-Kosten. Das Versprechen, das Modell werde „die Dokumente kennenlernen“, führt zu Enttäuschungen, da dies die Aufgabe einer Vektordatenbank ist. Der Start mit 50.000 Beispielen, bevor 500 Paare validiert sind, erzeugt Datenschulden statt eines Vorsprungs.

Bild generiert durch KI.

Wie Sie nach zwei Wochen den Erfolg prüfen

Messen Sie nach zwei Wochen RAG-Tests an 20 Dokumenten eine einzige Kennzahl: den Anteil der Dokumente, die ohne inhaltliche Korrektur durchgehen. Liegt das Ergebnis bei 80% oder mehr und jede Antwort weist eine korrekte Quelle aus, ist ein Nachtraining vorerst nicht gerechtfertigt: Retrieval hat das Problem gelöst, nicht ein neues Modell. Fällt der Wert unter 60%, liegt die Ursache in den Daten, nicht in der Architektur. Statt weiter zu trainieren, bereinigt man in diesem Fall die Datenbasis und beseitigt Unstimmigkeiten in den Dokumenten.

Reicht RAG nach dem Test aus, unterstützt HEXART beim Aufbau der Vektordatenbank und des Dokumenten-Workflows mit Quellenzitaten. Erfordert das Ergebnis ein Nachtraining, erstellen wir den Trainingsdatensatz, die Metrik-Versionierung und das Evaluierungspaket, damit ein Wechsel des Basismodells die Implementierung nicht gefährdet. Den Leistungsumfang finden Sie auf hexart.pl.

Quellen

Quellen, die wir bei der Erstellung herangezogen haben. Der obige Text stammt von uns; die genannten Seiten haften nicht für den Inhalt und haben ihn nicht autorisiert.

Unverbindliches Gespräch

Workshop mit Paul vereinbaren

Dreißig Minuten oder ein kompletter Workshop: Sie entscheiden. Wählen Sie den Termin direkt im Kalender, die Bestätigung folgt sofort.

Paul Lazniak

Gründer von HEXART