AWS: Self-Distilled Reasoning vraća matematičku točnost Amazon Nova 2 sa 6% na oko 68% nakon fine-tuninga
AWS je predstavio Self-Distilled Reasoning (SDR), tehniku nadziranog fine-tuninga Amazon Nova 2 modela kad trening podaci nemaju lanac razmišljanja. Metoda koristi bazni Nova 2 Lite za generiranje chain-of-thought tragova, postiže preko 6,5% relativno poboljšanje ciljne performanse i vraća opću matematičku točnost sa 6% na oko 68%, testirano na tri benchmarka bez ljudske anotacije.
Ovaj članak generiran je uz pomoć umjetne inteligencije na temelju primarnih izvora.
Što je Self-Distilled Reasoning i koji problem rješava?
AWS je predstavio Self-Distilled Reasoning (SDR), tehniku za supervised fine-tuning (nadzirani fine-tuning, dodatno treniranje modela na označenim primjerima) Amazon Nova 2 modela u situacijama kad trening podaci nemaju chain-of-thought (lanac razmišljanja) — korake rezoniranja koje model prolazi prije konačnog odgovora. Takvi podaci česti su u praksi: tvrtke imaju parove pitanje-odgovor bez zabilježenog puta zaključivanja, što otežava treniranje modela da samostalno rezonira.
Zašto vanilla fine-tuning uništava opću performansu?
Kad se model fine-tunea izravno na uske podatke bez reasoning tragova (vanilla SFT), opća matematička performansa modela pada sa 70% baznog modela na svega 6% — pojava poznata kao catastrophic forgetting (katastrofalno zaboravljanje), gubitak prethodno naučenih sposobnosti zbog preuskog naknadnog treninga. Model postaje dobar na uskom zadatku, ali gubi sposobnost rješavanja matematičkih problema koju je prethodno imao.
SDR koristi model da generira vlastite podatke za trening
Rješenje koje AWS predlaže koristi bazni Nova 2 Lite model da samostalno generira chain-of-thought tragove za postojeće trening podatke kojima ti tragovi nedostaju, bez potrebe za ljudskom anotacijom. Tako obogaćeni podaci potom se koriste za fine-tuning ciljanog modela. Rezultat: SDR postiže preko 6,5% relativno poboljšanje performanse na ciljanom zadatku i istovremeno vraća opću matematičku točnost sa 6% na oko 68% — razlika koja pokazuje koliko čuvanje reasoning sposobnosti tijekom fine-tuninga smanjuje kolateralnu štetu na ostale vještine modela.
Testirano na tri različita benchmarka
AWS je metodu testirao na tri benchmarka iz različitih domena: MedMCQA (medicinska pitanja), CoCoHD i Invoice-OCR (obrada računa). Dosljednost rezultata kroz tri nepovezana zadatka sugerira da SDR nije uskogrudno rješenje za jedan tip podataka, nego općenit pristup fine-tuningu kad reasoning tragovi u originalnim podacima jednostavno ne postoje.
Česta pitanja
- Što je supervised fine-tuning (SFT)?
- Supervised fine-tuning je nadzirano dodatno treniranje već istreniranog modela na specifičnom skupu označenih primjera kako bi bolje obavljao određeni zadatak.
- Što je catastrophic forgetting i kako ga SDR rješava?
- Catastrophic forgetting (katastrofalno zaboravljanje) je gubitak opće sposobnosti modela nakon uskog fine-tuninga; kod vanilla SFT-a opća matematička performansa Amazon Nova 2 pala je sa 70% na 6%, dok je SDR tehnika vraća na oko 68%.
- Kako Self-Distilled Reasoning generira podatke za trening?
- SDR koristi bazni model Amazon Nova 2 Lite da samostalno generira chain-of-thought (lanac razmišljanja) tragove za postojeće trening podatke kojima ti tragovi nedostaju, bez potrebe za ljudskom anotacijom.
📬 AI vijesti u tvoj inbox
Dnevni digest po tvojoj mjeri — biraš teme, izvore i ritam. Odjava jednim klikom.
Povezane vijesti
Anthropic: Claude Code v2.1.217 popravlja memory leak kod MCP-a i uvodi limit od 20 konkurentnih subagenata
arXiv:2607.16122: CRAFT metoda klasterira kriterije ocjenjivanja i otkriva slabosti kod jezičnih modela
Anthropic: Claude Code v2.1.215 i v2.1.216 popravljaju performanse, OAuth grešku i worktree izolaciju agenta