🟡 🏥 In der Praxis Veröffentlicht: · 2 Min. Lesezeit ·

AWS: Self-Distilled Reasoning stellt mathematische Genauigkeit von Amazon Nova 2 nach Fine-Tuning von 6 % auf rund 68 % wieder her

Diagramm zum Fine-Tuning des Amazon-Nova-2-Modells mit Gedankenkette und Grafik zur Genauigkeitswiederherstellung

AWS hat Self-Distilled Reasoning (SDR) vorgestellt, eine Technik für überwachtes Fine-Tuning von Amazon-Nova-2-Modellen, wenn Trainingsdaten keine Gedankenkette enthalten. Die Methode nutzt das Basismodell Nova 2 Lite zur Erzeugung von Chain-of-Thought-Spuren, erzielt über 6,5 % relative Verbesserung der Zielleistung und stellt die allgemeine mathematische Genauigkeit von 6 % auf rund 68 % wieder her, getestet an drei Benchmarks ohne menschliche Annotation.

🤖

Dieser Artikel wurde mithilfe von künstlicher Intelligenz aus Primärquellen erstellt.

Was ist Self-Distilled Reasoning und welches Problem löst es?

AWS hat Self-Distilled Reasoning (SDR) vorgestellt, eine Technik für Supervised Fine-Tuning (überwachtes Fine-Tuning, zusätzliches Training eines Modells anhand gekennzeichneter Beispiele) von Amazon-Nova-2-Modellen in Situationen, in denen die Trainingsdaten keine Chain-of-Thought (Gedankenkette) enthalten — die Schritte des Denkprozesses, die ein Modell vor der endgültigen Antwort durchläuft. Solche Daten sind in der Praxis häufig: Unternehmen verfügen über Frage-Antwort-Paare ohne aufgezeichneten Schlussfolgerungsweg, was es erschwert, ein Modell zum selbstständigen Schlussfolgern zu trainieren.

Warum zerstört Vanilla-Fine-Tuning die allgemeine Leistung?

Wird ein Modell direkt auf enge Daten ohne Reasoning-Spuren fine-getuned (Vanilla SFT), fällt die allgemeine mathematische Leistung des Modells von 70 % beim Basismodell auf lediglich 6 % — ein Phänomen, das als Catastrophic Forgetting (katastrophales Vergessen) bekannt ist, der Verlust zuvor erlernter Fähigkeiten durch zu enges Nachtraining. Das Modell wird gut in der engen Aufgabe, verliert dabei aber die zuvor vorhandene Fähigkeit, mathematische Probleme zu lösen.

SDR nutzt das Modell, um eigene Trainingsdaten zu erzeugen

Die von AWS vorgeschlagene Lösung nutzt das Basismodell Nova 2 Lite, um selbstständig Chain-of-Thought-Spuren für bestehende Trainingsdaten zu erzeugen, denen diese fehlen, ohne dass menschliche Annotation nötig ist. Die so angereicherten Daten werden anschließend für das Fine-Tuning des Zielmodells verwendet. Ergebnis: SDR erzielt über 6,5 % relative Verbesserung der Leistung bei der Zielaufgabe und stellt gleichzeitig die allgemeine mathematische Genauigkeit von 6 % auf rund 68 % wieder her — ein Unterschied, der zeigt, wie stark der Erhalt der Reasoning-Fähigkeit während des Fine-Tunings den Kollateralschaden an den übrigen Fähigkeiten des Modells verringert.

Getestet an drei unterschiedlichen Benchmarks

AWS hat die Methode an drei Benchmarks aus unterschiedlichen Bereichen getestet: MedMCQA (medizinische Fragen), CoCoHD und Invoice-OCR (Rechnungsverarbeitung). Die Konsistenz der Ergebnisse über drei voneinander unabhängige Aufgaben hinweg deutet darauf hin, dass SDR keine enge Lösung für einen Datentyp ist, sondern ein allgemeiner Ansatz für Fine-Tuning, wenn Reasoning-Spuren in den ursprünglichen Daten schlicht fehlen.

Häufig gestellte Fragen

Was ist Supervised Fine-Tuning (SFT)?
Supervised Fine-Tuning ist zusätzliches überwachtes Training eines bereits trainierten Modells anhand einer spezifischen Menge gekennzeichneter Beispiele, damit es eine bestimmte Aufgabe besser bewältigt.
Was ist Catastrophic Forgetting und wie löst SDR es?
Catastrophic Forgetting (katastrophales Vergessen) ist der Verlust der allgemeinen Fähigkeit eines Modells nach engem Fine-Tuning; bei Vanilla SFT fiel die allgemeine mathematische Leistung von Amazon Nova 2 von 70 % auf 6 %, während die SDR-Technik sie auf rund 68 % wiederherstellt.
Wie erzeugt Self-Distilled Reasoning Trainingsdaten?
SDR nutzt das Basismodell Amazon Nova 2 Lite, um selbstständig Chain-of-Thought-Spuren für bestehende Trainingsdaten zu erzeugen, denen diese fehlen, ohne dass menschliche Annotation nötig ist.

📬 KI-News in dein Postfach

Ein täglicher Digest nach deinen Regeln — Themen, Quellen und Rhythmus wählbar. Abmeldung mit einem Klick.