Reinike AI
Research Paper

On-Policy oder Off-Policy? Warum die Datenquelle beim KI-Training weniger zählt als gedacht

Effiziente KI-Modelle: Muss es immer On-Policy sein?

In der Welt der Künstlichen Intelligenz gilt oft ein ungeschriebenes Gesetz: Wenn man ein kleineres, effizienteres Modell (den „Studenten“) aus einem großen, leistungsstarken Modell (dem „Lehrer“) ableiten möchte, erzielt man die besten Ergebnisse, wenn der Student aus seinen eigenen Fehlern lernt. Dieser Ansatz, bekannt als On-Policy-Learning, wird oft als Heilmittel gegen das Vergessen von Wissen und für eine bessere Generalisierung gepriesen. Doch eine aktuelle Forschungsarbeit von Piskorz et al. rüttelt nun an diesem Fundament.

Die Entzauberung eines KI-Mythos

Die Forscher untersuchten systematisch, wie sich die Datenquelle – also ob das Modell mit eigenen Textentwürfen (On-Policy) oder mit vorgegebenen Texten des Lehrers (Off-Policy) trainiert wird – auf die Leistung auswirkt. Getestet wurde dies an modernen Modellfamilien wie Llama 3 und Qwen 2.5 in anspruchsvollen Bereichen wie Medizin, Wissenschaft und Mathematik. Das überraschende Ergebnis: Die Herkunft der Daten spielt oft eine untergeordnete Rolle. Viel entscheidender ist, wie der mathematische Vergleich zwischen Lehrer und Student – die sogenannte KL-Divergenz – konfiguriert ist.

Mathematik schlägt Datenquelle: Forward vs. Reverse KL

Die Studie zeigt, dass die Wahl der Optimierungsfunktion den größten Einfluss auf die Stabilität des Modells hat. Die sogenannte „Forward KL“-Divergenz erwies sich als bemerkenswert robust. Modelle, die damit trainiert wurden, zeigten eine konstant starke Leistung, völlig unabhängig davon, ob sie On-Policy- oder Off-Policy-Daten nutzten. Im Gegensatz dazu reagierte die „Reverse KL“-Variante sehr empfindlich und funktionierte fast nur mit On-Policy-Daten gut. Für Unternehmen bedeutet das: Wer die richtige Mathematik wählt, gewinnt an Flexibilität bei der Datenauswahl und spart potenziell teure Rechenressourcen für die Generierung eigener Trainingspfade.

Praktische Implikationen für die Modelloptimierung

Ein weiteres wichtiges Ergebnis betrifft das „katastrophale Vergessen“ – das Phänomen, bei dem eine KI während der Feinabstimmung altes Wissen verliert. Hier stellte sich heraus, dass nicht die Datenquelle, sondern die Lernrate und die Optimierungsparameter die Hauptverantwortlichen sind. Werden diese Parameter falsch gewählt, nützt auch das beste On-Policy-Training nichts. On-Policy-Daten boten lediglich bei sehr komplexen logischen Aufgaben (wie dem „Countdown“-Arithmetik-Task) einen leichten Vorteil bei der Generalisierung, der jedoch in späteren Trainingsphasen oft wieder verschwand.

Was bedeutet das für Business-Entscheider?

Die Ergebnisse sind eine gute Nachricht für die praktische Anwendung von KI in Unternehmen. Erstens zeigt die Forschung, dass die Wissensdestillation weniger „magisch“ und stärker von klassischen Optimierungsparametern abhängig ist, als bisher angenommen. Zweitens können Entwickler oft auf stabilere Off-Policy-Verfahren setzen, ohne Leistungseinbußen befürchten zu müssen, solange die Zielmetriken korrekt definiert sind. Die Studie mahnt zur Vorsicht vor pauschalen Empfehlungen für On-Policy-Verfahren, die oft mit einem deutlich höheren Rechenaufwand verbunden sind. In der Praxis zählt am Ende die Balance zwischen mathematischer Präzision und effizientem Ressourceneinsatz.