arXiv:2607.16122: CRAFT metoda klasterira kriterije ocjenjivanja i otkriva slabosti kod jezičnih modela
Vipul Gupta i suradnici predstavljaju CRAFT, metodu koja rubric-based evaluacijske podatke pretvara u model-specifičnu dijagnozu slabih sposobnosti LLM-a klasteriranjem kriterija u hijerarhijsko stablo. Testirano na 4 modela, 2 domene i 13 benchmarkova, CRAFT postiže najjači prosjek u financijama za sva 4 modela, a u pravu za 3 od 4.
Ovaj članak generiran je uz pomoć umjetne inteligencije na temelju primarnih izvora.
Kako CRAFT dijagnosticira slabosti jezičnog modela?
Vipul Gupta i suradnici u radu “CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data” (arXiv:2607.16122) predlažu metodu koja postojeće rubric-based evaluacijske podatke pretvara u model-specifičnu dijagnozu. Rubrika je kriterij ocjenjivanja koji definira što odgovor modela mora sadržavati da bi bio ocijenjen točnim ili potpunim. CRAFT klasterira te kriterije u hijerarhijsko stablo sposobnosti, pa umjesto jednog zbirnog rezultata otkriva točno koji su čvorovi tog stabla najslabiji za pojedini model.
Od dijagnoze do ciljanih fine-tuning podataka
Nakon što identificira najslabije čvorove, CRAFT za njih generira ciljane podatke za fine-tuning — dodatno treniranje modela na uskom skupu primjera osmišljenih da poprave upravo tu slabost. Metoda je testirana na 4 open-source modela, u 2 profesionalne domene (financije i pravo) te na 13 held-out benchmarkova, odnosno testnih skupova koje modeli nisu vidjeli tijekom treniranja niti tijekom kreiranja rubrika.
Financije 4/4 naspram prava 3/4
CRAFT postiže najjači prosjek rezultata u financijskoj domeni kod svih 4 testirana modela, dok u pravnoj domeni ostvaruje najjači prosjek kod 3 od 4 modela. Ta razlika sugerira da je pristup klasteriranja rubrika u financijskoj domeni dosljedniji neovisno o odabranom modelu, dok u pravnoj domeni jedan model odstupa od uzorka koji vrijedi za ostale.
Česta pitanja
- Kako CRAFT pronalazi slabe sposobnosti LLM-a?
- CRAFT klasterira rubrike, odnosno kriterije ocjenjivanja iz rubric-based evaluacijskih podataka, u hijerarhijsko stablo sposobnosti modela, a zatim za svaki model prepoznaje koji su čvorovi tog stabla najslabiji te za njih ciljano generira fine-tuning podatke.
- Zašto CRAFT postiže bolje rezultate u financijama nego u pravu?
- Na 13 held-out benchmarkova CRAFT ostvaruje najjači prosjek u financijskoj domeni kod svih 4 testirana open-source modela, dok u pravnoj domeni ostvaruje najjači prosjek kod 3 od 4 modela, što upućuje na razlike u strukturi rubrika između domena.
Izvori
📬 AI vijesti u tvoj inbox
Dnevni digest po tvojoj mjeri — biraš teme, izvore i ritam. Odjava jednim klikom.
Povezane vijesti
Anthropic: Claude Code v2.1.215 i v2.1.216 popravljaju performanse, OAuth grešku i worktree izolaciju agenta
CNCF: Goodput metrika otkriva gotovo 10× lošiju p95 latenciju kod throughput-optimiziranog LLM servinga
GitHub: Code Quality dostiže Generally Available status uz CodeQL analizu i Copilot Autofix popravke