🟡 ⚖️ Regulacija Objavljeno: · 2 min čitanja ·

arXiv:2607.16112: Znanstvenici predlažu usklađivanje sigurnosnih pragova kapabilnosti frontier AI kompanija

arXiv:2607.16112 ↗

Apstraktni prikaz ljestvice s više različitih crta praga koje simboliziraju neusklađene sigurnosne pragove

Wilber Sean Anterola, Matthew Ball, Luis F. Lafuerza i Markov Grey razvijaju metodologiju za usklađivanje sigurnosnih pragova kapabilnosti frontier AI kompanija, koji se danas bitno razlikuju i otežavaju vanjsku provjeru prekoračenja. Za rizike zlouporabe koriste očekivanu štetu, a za AI R&D promatranu stopu napretka, uz upozorenje na moguću utrku prema dnu.

🤖

Ovaj članak generiran je uz pomoć umjetne inteligencije na temelju primarnih izvora.

Zašto se sigurnosni pragovi frontier AI kompanija toliko razlikuju?

Rad “Harmonizing AI Safety Thresholds” (arXiv:2607.16112), čiji su autori Wilber Sean Anterola, Matthew Ball, Luis F. Lafuerza i Markov Grey, upozorava da frontier AI kompanije danas postavljaju bitno različite sigurnosne pragove (safety threshold) za kapabilnosti svojih modela. Safety prag je unaprijed određena razina sposobnosti modela pri kojoj kompanija mora uvesti dodatne zaštitne mjere ili odgoditi objavu. Razlike u definicijama i metodologiji onemogućuju trećim stranama — regulatorima, istraživačima, revizorima — da provjere je li neka kompanija doista prekoračila vlastiti prag, jer svaka kompanija koristi vlastite, nerijetko nejavne kriterije.

Dva različita pristupa: zlouporaba naspram AI R&D

Autori predlažu da se pragovi za rizike zlouporabe, poput cyber napada ili biološkog oružja, temelje na risk-modeliranju očekivane štete (expected harm) i uvjetima pod kojima se model uopće smije objaviti javnosti. Nasuprot tome, prag za automatizirani AI istraživanje i razvoj (R&D) autori temelje na promatranoj stopi napretka AI sustava, a ne na procjeni očekivane štete — jer se šteta od ubrzanog samostalnog AI razvoja teže unaprijed kvantificira nego šteta od konkretnog cyber ili biološkog napada. Frontier AI je pojam za najnaprednije modele na granici trenutnih mogućnosti industrije.

Prijeti li industriji “utrka prema dnu”?

Rad ističe empirijske praznine u postojećim pristupima procjeni rizika te upozorava na mogućnost “utrke prema dnu” (race to the bottom) — scenarija u kojem kompanije, bez zajedničkih minimalnih pragova, postupno spuštaju vlastite sigurnosne kriterije kako bi brže objavljivale modele i ostale konkurentne na tržištu. Harmonizirana metodologija, prema autorima, treba spriječiti upravo takvu dinamiku uvođenjem usporedivih, provjerljivih pragova diljem industrije, čime bi treće strane dobile stvaran alat za neovisnu reviziju umjesto oslanjanja na samoprocjene pojedinih kompanija.

Česta pitanja

Zašto trećim stranama treba zajednička metodologija sigurnosnih pragova?
Jer frontier AI kompanije danas postavljaju bitno različite sigurnosne pragove kapabilnosti prema vlastitim, često nejavnim kriterijima, pa regulatori, istraživači i revizori ne mogu pouzdano provjeriti je li neka kompanija doista prekoračila vlastiti prag.
Kako se razlikuje pristup za rizike zlouporabe od pristupa za AI R&D prag?
Za rizike poput cyber napada ili biološkog oružja autori koriste risk-modeliranje temeljeno na očekivanoj šteti i uvjetima objave modela, dok prag za automatizirani AI istraživanje i razvoj temelje na promatranoj stopi AI napretka, a ne na procjeni štete.
Što je 'utrka prema dnu' u kontekstu sigurnosnih pragova?
To je scenarij u kojem kompanije, bez zajedničkih minimalnih pragova, postupno spuštaju vlastite sigurnosne kriterije kako bi brže objavljivale modele i ostale konkurentne, a rad upozorava da postojeći pristupi imaju empirijske praznine koje takvu dinamiku olakšavaju.

📬 AI vijesti u tvoj inbox

Dnevni digest po tvojoj mjeri — biraš teme, izvore i ritam. Odjava jednim klikom.