🤖 Modeli

189 vijesti

🟡 🤖 Modeli 10. srpnja 2026. · 2 min čitanja

arXiv:2607.08733: 'Super težine' objašnjavaju zašto selektivni fine-tuning zakazuje — rad prihvaćen na COLM 2026

Editorial ilustracija: mreža parametara u kojoj nekoliko svijetlih čvorova drži cijelu strukturu

Super Weights in LLMs je rad prihvaćen na COLM 2026 koji identificira 'super težine' — malen broj parametara čija izmjena nesrazmjerno mijenja ponašanje jezičnog modela. Rad pokazuje da upravo te težine objašnjavaju zašto selektivni fine-tuning samo pojedinih slojeva često zakazuje, s izravnim posljedicama za PEFT i LoRA pristupe.

🔴 🤖 Modeli 9. srpnja 2026. · 2 min čitanja

Google: SensorFM — foundation model treniran na bilijun minuta wearable podataka pobjeđuje na 34 od 35 zdravstvenih zadataka

Editorial ilustracija: pametni sat iz kojeg izviru valovi biometrijskih signala u neuronsku mrežu

SensorFM je Googleov foundation model za zdravstvene podatke s nosivih uređaja, treniran na više od bilijun minuta signala s Fitbit i Pixel Watch uređaja 5 milijuna korisnika iz 100+ zemalja. Model pobjeđuje specijalizirane pristupe na 34 od 35 zadataka, s +9% AUC na klasifikaciji i +21% korelacije na regresiji.

🔴 🤖 Modeli 9. srpnja 2026. · 2 min čitanja

Microsoft: Aurora 1.5 open-source model nadmašuje ECMWF ensemble na 88,9% varijabli — novi standard AI prognoze vremena

Editorial ilustracija: globus s vrtložnim vremenskim frontama i podatkovnom mrežom

Aurora 1.5 je Microsoftov open-source foundation model za Zemljin sustav koji nadmašuje ECMWF ensemble prognozu na 88,9% evaluiranih varijabli i horizonata. Novo izdanje dodaje 22 meteorološke varijable, satnu rezoluciju i probabilistički ensemble forecasting, a za uragan Helene postiže oko 33% nižu pogrešku putanje od originalne Aurore.

🔴 🤖 Modeli 9. srpnja 2026. · 2 min čitanja

OpenAI: GPT-5.6 stiže u tri varijante — Sol, Terra i Luna, s multi-agent orkestracijom i istim danom u GitHub Copilotu

Editorial ilustracija: tri planetarne kugle (Sol, Terra, Luna) povezane tokovima podataka

GPT-5.6 je nova OpenAI model-familija s tri varijante: Sol (flagship za složeno zaključivanje), Terra (uravnotežena) i Luna (visokovolumna, cjenovno učinkovita). Donosi Programmatic Tool Calling, eksplicitnu kontrolu prompt cachinga, persisted reasoning i multi-agent orkestraciju u beti, a od prvog dana dostupna je i u GitHub Copilotu.

🟡 🤖 Modeli 9. srpnja 2026. · 2 min čitanja

Meta: Muse Spark 1.1 donosi multimodalno zaključivanje s milijun tokena konteksta i koordinaciju subagenata kroz Model API

Editorial ilustracija: središnja iskra koja grana na više manjih agenata i tokova aplikacija

Muse Spark 1.1 je multimodalni reasoning model Meta Superintelligence Labsa za agentske zadatke, s kontekstnim prozorom od milijun tokena. Model koordinira subagente, navigira tokove kroz više aplikacija te prima slike, video i PDF-ove, a dostupan je kroz Meta Model API u javnom pregledu i u Thinking modu Meta AI aplikacije.

🟡 🤖 Modeli 9. srpnja 2026. · 2 min čitanja

xAI: Grok 4.5 — novi flagship za kodiranje i agentski rad po cijeni od 2 dolara za milijun ulaznih tokena

Editorial ilustracija: tamna konzola s kodom iz koje izlazi robotska ruka s alatom

Grok 4.5 je xAI-jev novi model pozicioniran kao flagship za kodiranje i agentske zadatke, s cijenom od 2 USD za milijun ulaznih i 6 USD za milijun izlaznih tokena. Podržava konfigurabilni reasoning effort (low/medium/high) i već je dostupan kroz Perplexityjev Agent API, čime agresivno podcjenjuje usporedive frontier modele.

🔴 🤖 Modeli 8. srpnja 2026. · 4 min čitanja

Mistral Robostral Navigate: robotski AI koji navigira samo s RGB kamerom

Editorial ilustracija: Mistral Robostral utjelovljeni robot model za navigaciju temeljen samo na RGB viziji

Mistral je predstavio Robostral Navigate, prvi model za utjelovljenu robotsku navigaciju s 8 milijardi parametara. Koristeći samo jednu RGB kameru bez LiDARa ili dubinskih senzora, postiže 76,6% uspješnosti na R2R-CE benchmarku za neviđena okruženja i premašuje višesenzorske konkurente za 4,5 postotnih bodova.

🔴 🤖 Modeli 8. srpnja 2026. · 4 min čitanja

OpenAI lansira GPT-Live: glasovni model za životne AI razgovore

Editorial ilustracija: OpenAI GPT-Live glasovni model integriran u ChatGPT Voice sučelje

OpenAI je predstavio GPT-Live, novi glasovni model namijenjen prirodnim, životnim konverzacijskim AI interakcijama. Integriran u ChatGPT Voice od prvog dana, dolazi kao dio ubrzanog razvoja glasovnih modela — samo dva dana nakon GPT-Realtime-2.1. Tehničke specifikacije i cjenik zasad nisu objavljeni.

🟡 🤖 Modeli 8. srpnja 2026. · 3 min čitanja

Anthropic razvija „off switch” za opasno znanje: GRAM izolira dual-use sposobnosti u uklonjive module

Editorial ilustracija: Anthropic GRAM izmjenjivi moduli znanja za kontrolu i uklanjanje dvojne upotrebe AI

Anthropic i AE Studio objavljuju GRAM (Gradient-Routed Auxiliary Modules) — metodu koja dual-use znanje poput virologije, kibersigurnosti i nuklearne fizike izolira u uklonjive neuronske module za vrijeme treniranja, omogućujući jednokratnim treningom stvaranje višestrukih varijanti modela s različitim skupovima sposobnosti.

🔴 🤖 Modeli 7. srpnja 2026. · 4 min čitanja

Meta lansira Muse Image i Muse Video: agentski AI koji sam ispravlja vlastite greške

Editorial ilustracija: Meta Muse generativna AI za stvaranje slika i video sadržaja

Meta Superintelligence Labs predstavila je Muse Image i Muse Video — modele koji funkcioniraju kao agenti, interno pozivaju alate za kod i pretraživanje weba te zauzimaju #2 i #3 na Arena ljestvici uz obvezan Content Seal vodeni žig.

🟡 🤖 Modeli 7. srpnja 2026. · 4 min čitanja

Direct-OPD: Kako slabiji model može trenirati jačeg bez skupog RL-a

Editorial ilustracija: slabo-u-jako RL destilacija kao pristup superporavnanju AI sustava

Istraživači s Tsinghua sveučilišta i Zhipu AI predložili su Direct On-Policy Distillation (Direct-OPD) — metodu koja prenosi dobitke reinforcement learninga sa slabijeg modela-učitelja na jačeg učenika bez imitiranja konačne politike, postižući skok s 48,3% na 62,4% na AIME 2024.

🔴 🤖 Modeli 6. srpnja 2026. · 4 min čitanja

Anthropic otkrio J-space: emergentni unutarnji radni prostor unutar Claudea

Editorial ilustracija: Anthropic istraživanje interpretabilnosti i skrivenih ponašanja u neuronskim mrežama

Anthropic istraživači identificirali su emergentnu internu strukturu u Claudeu — J-space — koristeći novu tehniku Jacobian lens (J-lens). Inspirirana neuroznanstvenom teorijom globalnog radnog prostora, J-space funkcionira kao tihi unutarnji prostor za rezoniranje koji nije vidljiv u izlazu modela, a može razotkriti skrivena ponašanja poput izmišljanja podataka, prepoznavanja test-scenarija i podmetnuto zlonamjernih ciljeva.

🟡 🤖 Modeli 6. srpnja 2026. · 4 min čitanja

AWS uvodi rDPO — selektivno zaboravljanje za Amazon Nova modele

Editorial ilustracija: Selektivno zaboravljanje u AI modelima putem rDPO i LoRA tehnika odučavanja

Amazon Web Services objavio je tehniku selektivnog zaboravljanja (unlearning) za Nova modele temeljenu na Reverse Direct Preference Optimizationu (rDPO). Implementirana putem LoRA adaptera bez punog re-treniranja, tehnika smanjuje stopu neželjenih odbijanja za do 53,74 postotnih bodova uz minimalan gubitak korisnosti.

🟡 🤖 Modeli 6. srpnja 2026. · 4 min čitanja

OpenAI objavio GPT-Realtime-2.1 i mini varijantu: poboljšano prepoznavanje glasa i rukovanje šumom

Editorial ilustracija: OpenAI GPT Realtime glasovni modeli za agentsku audio komunikaciju u stvarnom vremenu

OpenAI je 6. srpnja 2026. objavio dva nova realtime glasovna modela — GPT-Realtime-2.1 i GPT-Realtime-2.1-mini — dostupna na postojećem v1/realtime endpointu. Modeli donose poboljšano prepoznavanje alfanumeričkih nizova, bolje rukovanje tišinom i šumom te poboljšano ponašanje pri prekidanju razgovora.

🟢 🤖 Modeli 6. srpnja 2026. · 4 min čitanja

MiniMax M2, M2.1 i M2.5 dostupni na Amazon Bedrocku

Editorial ilustracija: AWS Bedrock platforma s novim otvorenim MoE modelima trećih strana

Amazon Bedrock proširio je ponudu s tri open-weight MiniMax modela — M2 s kontekstom od milijun tokena, M2.1 namijenjen dubokom rezoniranju i kodiranju, te M2.5 s Mixture-of-Experts arhitekturom od 230 milijardi parametara dizajniranom za agentske primjene.

🟡 🤖 Modeli 3. srpnja 2026. · 3 min čitanja

ReContext poboljšava iskorištenost 128K kontekstnih prozora bez ponovnog treniranja

Editorial ilustracija: ponavljanje dokaza u dugom kontekstu od 128K tokena za jezični model

Istraživači sa Sveučilišta Illinois razvili su ReContext — inferencijsku tehniku koja rekurzivno reproducira relevantne dokaze iz dugog kontekstnog prozora i konzistentno poboljšava učinak na tri LLM arhitekture kroz osam benchmarkova, bez ponovnog treniranja.

🟢 🤖 Modeli 3. srpnja 2026. · 3 min čitanja

VRRL: pojačano učenje primorava vizualne modele da stvarno koriste sliku pri samokorekciji

Editorial ilustracija: vizualno-jezični model s pojačanim učenjem samorefleksije nad scenama

Liyan Tang, Fangcong Yin i Greg Durrett razvili su VRRL — okvir pojačanog učenja koji kroz maskiranje prefiksa trajektorije i experience replay primorava vizualno-jezične modele da uzemlji samorefleksiju u stvarni vizualni ulaz, postižući bitno bolji učinak na distribucijski pomaknutim primjerima.

🟡 🤖 Modeli 1. srpnja 2026. · 3 min čitanja

Fable 5 i Mythos 5 ponovno dostupni: Anthropic vratio modele korisnicima

Editorial ilustracija: Anthropic ponovno vraća modele Claude Fable 5 i Mythos 5 u dostupnost korisnicima

Anthropic je 1. srpnja obnovio pristup modelima Claude Fable 5 i Claude Mythos 5, gotovo tri tjedna nakon što ih je povukao zbog američkih izvoznih kontrola. Povratak prati poboljšani sigurnosni klasifikator i prijedlog industrijskog okvira za ocjenjivanje ozbiljnosti jailbreakova.

🟡 🤖 Modeli 1. srpnja 2026. · 3 min čitanja

NVIDIA Nemotron i OpenAI GPT OSS modeli dostupni u AWS GovCloudu s FedRAMP High certifikatom

Editorial ilustracija: NVIDIA Nemotron i OpenAI gpt-oss modeli na AWS Bedrock GovCloud uz stroge sigurnosne certifikate

AWS GovCloud (US) dobiva šest novih modela na Amazon Bedrocku: OpenAI open-weight gpt-oss-120b i gpt-oss-20b te četiri NVIDIA Nemotron modela s 1M token kontekstom. Infrastruktura zadovoljava FedRAMP High, DoD IL 2/4/5, ITAR i CJIS zahtjeve uz dizajn nultog operaterskog pristupa.

🟡 🤖 Modeli 1. srpnja 2026. · 4 min čitanja

GitHub Copilot Vision i browser tools: dvije GA sposobnosti u jednom danu

Editorial ilustracija: GitHub Copilot Vision i alati za preglednik postaju općenito dostupni

GitHub je proglasio GA dvije Copilot sposobnosti: Vision za prilaganje slika i PDF-ova uz chat promptove te browser tools koji agentima u VS Code-u daju kontrolu nad pravim preglednikom. Obje su dostupne svim planovima bez potrebe za admin akcijom.

🔴 🤖 Modeli 30. lipnja 2026. · 4 min čitanja

Claude Sonnet 5: Anthropicov najagentičniji model postaje novi standard

Editorial ilustracija: Anthropic predstavlja novi flagship Claude Sonnet 5 model za agentic zadatke

Anthropic danas lansira Claude Sonnet 5 — model koji planira višekorakne zadatke, upravlja preglednicima i terminalima te se na ključnim zadacima približava Opusu 4.8, uz uvodnu cijenu $2/$10 po milijunu tokena do 31. kolovoza 2026. i 1M token kontekstni prozor.

🟡 🤖 Modeli 30. lipnja 2026. · 4 min čitanja

Fable 5 se vraća: vlada ukinula izvozne kontrole, globalni redeploy počinje 1. srpnja

Editorial ilustracija: Anthropic ponovo aktivira Fable 5 nakon ukidanja američke vladine zabrane izvoza

Nakon 18 dana globalne suspenzije, Anthropic objavljuje ponovni deployment Fable 5: američka vlada ukinula je izvozne kontrole 30. lipnja, a poboljšani sigurnosni klasifikator blokira otkrivenu tehniku bypass-a u više od 99 posto slučajeva.

🟡 🤖 Modeli 30. lipnja 2026. · 4 min čitanja

Google lansira dva modela istog dana: Gemini Omni Flash i Nano Banana 2 Lite

Editorial ilustracija: Google lansira Gemini Omni Flash za video i Nano Banana 2 za generiranje slika

Google je 30. lipnja 2026. istovremeno objavio Gemini Omni Flash za konverzacijsko uređivanje videa i Nano Banana 2 Lite za brzu sintezu slika. Video model naplaćuje 0,10 dolara po sekundi outputa, dok image model stoji samo 0,034 dolara na tisuću slika.

🟡 🤖 Modeli 30. lipnja 2026. · 3 min čitanja

Google Research predstavlja TabFM: zero-shot foundation model za tablične podatke

Editorial ilustracija: Google TabFM foundation model za zero-shot analizu tabelarnih podataka

Google Research objavio je TabFM, foundation model za tablične podatke koji daje zero-shot predikcije u jednom forward passu, bez podešavanja hiperparametara i feature engineeringa. Model je postigao vrhunske Elo ocjene na benchmarku TabArena i dostupan je na Hugging Faceu i GitHubu, s najavom integracije u Google BigQuery.

🔴 🤖 Modeli 29. lipnja 2026. · 3 min čitanja

Meta: Brain2Qwerty v2 — neinvazivno dekodiranje misli u tekst s 61% točnosti, bez kirurškog implantata

Editorial ilustracija: Brain2Qwerty v2 — neinvazivno dekodiranje misli u tekst s 61% točnosti, bez kirurškog impl, bez teksta i lica

Brain2Qwerty v2 je AI sustav Meta Researcha koji pretvara mozgovne signale u tekst bez kirurškog zahvata, koristeći MEG skeniranje. Prosječna točnost prepoznavanja riječi doseže 61%, što je sedam puta više od ostalih neinvazivnih metoda (8%). Trening kod i dataseti objavljeni su open-source.

🟡 🤖 Modeli 29. lipnja 2026. · 2 min čitanja

GitHub: Claude Opus 4.8 fast mode stiže u Copilot preview; Anthropic ukida fast za Opus 4.6

Editorial ilustracija: Claude Opus 4.8 fast mode stiže u Copilot preview; Anthropic ukida fast za Opus 4.6, bez teksta i lica

Claude Opus 4.8 fast mode je sada u preview fazi za korisnike GitHub Copilota, donoseći značajno brže generiranje izlaznih tokena uz zadržanu razinu inteligencije modela. Istovremeno, Anthropic ukida fast mode za Opus 4.6 — konsolidacija fast mode sposobnosti na jedini preostali model.

🟢 🤖 Modeli 29. lipnja 2026. · 2 min čitanja

Allen Institute: DiScoFormer — jedan transformer za gustoću i score kroz različite distribucije

Editorial ilustracija: DiScoFormer — jedan transformer za gustoću i score kroz različite distribucije, bez teksta i lica

DiScoFormer je transformer model Allen Institute for AI (AI2) koji u jednom forward passu procjenjuje density funkciju (gustoću distribucije) i score funkciju — što je dosad zahtijevalo odvojene modele. Generalizira KDE na visoke dimenzije i prilagođava se novim distribucijama bez retraininga.

🟢 🤖 Modeli 29. lipnja 2026. · 2 min čitanja

arXiv:2606.28166: Tandem RL — verifikabilne nagrade uz čitljiviji lanac misli i bolji handoff na manji model

Editorial ilustracija: 2606.28166: Tandem RL — verifikabilne nagrade uz čitljiviji lanac misli i bolji handoff na, bez teksta i lica

Tandem RL je nova metoda treniranja jezičnih modela koja kombinira RLVR (reinforcement learning s verifikabilnim nagradama) s tandem pristupom: jači model surađuje sa zamrznutim slabijim modelom pri generiranju lanca misli. Na Qwen3-4B postiže usporedive performanse uz znatno bolju čitljivost i robusnost pri handoffu na manji model.

🟡 🤖 Modeli 28. lipnja 2026. · 2 min čitanja

GitHub: MAI-Code-1-Flash, Microsoftov coding model, sada općedostupan u Copilot Business i Enterprise planovima

Editorial ilustracija: ubrzani tok koda kroz razvojno sučelje, bez teksta i lica

MAI-Code-1-Flash je Microsoftov vlasnički model za kodiranje koji je 26. lipnja 2026. postao općedostupan na GitHub Copilot Business i Enterprise planovima. Optimiziran je za nisku latenciju i visokofrekventne agentske tijekove kodiranja, naplaćuje se po potrošnji prema cjeniku pružatelja, a administratori ga moraju eksplicitno omogućiti u postavkama organizacije.

🟢 🤖 Modeli 28. lipnja 2026. · 1 min čitanja

arXiv:2606.26935: dobici CoT treninga slijevaju se u jače predviđanje akcije, a ne u dublje rezoniranje agenata

Editorial ilustracija: razgranati tok odluka koji se sužava u jednu jasnu putanju, bez teksta i lica

Studija arXiv:2606.26935 istraživača Jingyu Liu i suradnika pokazuje da se dobici treniranja lancem misli (CoT) kod LLM agenata slijevaju u jače izravno predviđanje akcije, a ne u širu prednost rezoniranja. Kasniji checkpointi rjeđe revidiraju akciju, dok maskiranje supervizije nad action-tokenima poboljšava generalizaciju izvan domene.

🟢 🤖 Modeli 28. lipnja 2026. · 1 min čitanja

arXiv:2606.26502: reasoning modeli troše više tokena na zadatke koje pogriješe, suprotno od ljudi koji odustaju

Editorial ilustracija: dvije krivulje truda koje se razilaze, jedna raste a druga pada, bez teksta i lica

Studija arXiv:2606.26502 istraživača Han-yu Wanga otkriva da veliki reasoning modeli (LRM) troše više tokena na zadatke koje pogriješe nego na one koje riješe točno, suprotno ljudima koji na težim zadacima odustaju. Razmak je velik (Cohen's d 1,47–3,13 na H-ARC benchmarku), a svih pet testiranih modela pokazalo je obrnuti obrazac od ljudi.

🔴 🤖 Modeli 27. lipnja 2026. · 3 min čitanja

OpenAI: GPT-5.6 Sol najavljen u previewu — kodiranje, znanost i kibersigurnost

Editorial illustration: apstraktni prikaz neuronske mreže s oznakama koda, molekularne strukture i štita za kibersigurnost

GPT-5.6 Sol je OpenAI-jev najavljeni model sljedeće generacije, trenutno u statusu preview (nije opće dostupan), s pojačanim sposobnostima u kodiranju, znanstvenom zaključivanju i kibersigurnosti te najnaprednijim safety stackom dosad.

🟡 🤖 Modeli 27. lipnja 2026. · 2 min čitanja

Anthropic: API rate limiti podignuti — Sonnet i Haiku sad na razini Opusa, tri tiera

Editorial illustration: grafikon s tri razine API pristupa i strelicama koje pokazuju prema gore, apstraktni oblaci i serverski rackovi

Anthropic je izjednačio API rate limite za sve modele — Sonnet i Haiku sada dijele iste kvote kao Opus na svakom od tri usage tiera (Start, Build, Scale). Istovremeno, fast mode za Claude Opus 4.7 ide u deprecation s uklanjanjem 24. srpnja.

🟡 🤖 Modeli 27. lipnja 2026. · 2 min čitanja

arXiv:2606.26836: Benchmarci propuštaju 82% stvarnih sposobnosti AI modela

Editorial illustration: bar chart showing benchmark gap between single-model evaluation and Capability Frontier measurement

Istraživači su pokazali da standardni benchmarci — koji mjere samo jedan model u jednom pokušaju — podcjenjuju stvarne sposobnosti LLM-ova za čak 82%. Uvođenjem Capability Frontier okvira, koji koristi Pareto optimalnost na 21 modelu i 16 benchmarka, moguće je postići istu točnost uz 85% niže troškove.

🟡 🤖 Modeli 27. lipnja 2026. · 2 min čitanja

Google: Gemini Nano na Pixelu 50%+ brži uz zamrznutu multi-token predikciju

Editorial illustration: smartphone chip diagram showing parallel token prediction paths on Pixel device

Google je ubrzao Gemini Nano inferenciju na Pixelu 9 i 10 za više od 50% korištenjem zamrznute multi-token predikcije — tehnike koja generira prosječno ~2 tokena po jednom prolazu kroz model, uz uštedu 130 MB memorije po instanci i bez ikakve promjene izlaznih rezultata.

🟢 🤖 Modeli 27. lipnja 2026. · 1 min čitanja

arXiv:2606.27288: Kad kombiniranje LLM-ova stvarno pomaže — co-failure ceiling na 67 frontier modela

Editorial illustration: dijagram stropne granice točnosti za skupinu AI modela, apstraktni grafovi bez lica

Istraživanje na 67 frontier modela od 21 providera uvodi pojam co-failure ceiling — gornju granicu točnosti ansambla LLM-ova određenu stopom kad svi modeli griješe na istom upitu. Rezultati pokazuju da kombiniranje modela rijetko nadmašuje jedan najjači model bez query-level routinga.

🟡 🤖 Modeli 26. lipnja 2026. · 2 min čitanja

Google Research: kako razmišljanje otključava parametarsko znanje u LLM-ovima

Editorial illustration: stylized neural network pathways lighting up in sequence, abstract brain and data nodes, cool blue tones

Google Research otkriva dva mehanizma kojima reasoning trace poboljšava dohvat činjenica pohranjenih u težinama modela — computational buffer i factual priming — testirano na Gemini 2.5 i Qwen3-32B.

🟢 🤖 Modeli 26. lipnja 2026. · 2 min čitanja

arXiv:2606.25325: OPPO — RL okvir koji nauči AI čitati emocije iz glasa, lica i teksta odjednom

Editorial illustration: multimodalni sustav s valovima zvuka, okvirom za lice i tekstualnim oblačićima koji se spajaju u jednu analizu emocija

OPPO je sustav ojačanog učenja koji omni-modalne jezične modele uči istovremeno razumjeti vizualne, akustičke i tekstualne znakove emocija, suzbijajući halucinacije između modaliteta i postižući SOTA rezultate na dvama benchmark skupovima.

🟡 🤖 Modeli 25. lipnja 2026. · 2 min čitanja

arXiv:2606.24510: RaDaR — specijalizirani 32B reasoning LLM ubrzava dijagnozu rijetkih bolesti u RCT-u

Editorial illustration: medicinska AI dijagnostika, grafovi točnosti, molekularna struktura i digitalni medicinski zapisi

RaDaR je open-source reasoning LLM s 32 milijarde parametara treniran za dijagnozu rijetkih bolesti. U randomiziranom kliničkom ispitivanju poboljšao je dijagnostičku točnost liječnika za 21,44 postotna boda naspram internet pretrage, uz sposobnost identificiranja dijagnoze u 61% slučajeva prije kliničke dokumentacije.

🟡 🤖 Modeli 25. lipnja 2026. · 2 min čitanja

arXiv:2606.24014: RL treniranje na zdravstvenom domenu prenosi usklađenost na 80%+ OOD benchmarka

Editorial illustration: neural network connections branching across multiple domains with alignment transfer arrows, abstract scientific visualization

Istraživači Google Researcha pokazali su da RL treniranje na korisnim osobinama poput istinitosti, pravednosti i korektabilnosti poboljšava performanse na više od 80% od 50+ neovisnih OOD benchmarka — uključujući domene izvan zdravlja na kojoj je model treniran.

🟡 🤖 Modeli 25. lipnja 2026. · 2 min čitanja

Google: DiffusionGemma 26B — 4× brža generacija teksta difuzijskim pristupom

Editorial illustration: apstraktni prikaz paralelnih struja teksta koje se formiraju iz difuzijskog oblaka, digitalni stil

DiffusionGemma je Googleov 26B MoE model koji generira tekst difuzijskim pristupom — paralelno, a ne sekvencijalno. Postiže više od 1.000 tokena u sekundi na jednom H100 GPU-u, što je do 4× brže od standardnih autoregresivnih modela, uz kompromis u kvaliteti u odnosu na Gemma 4.

🟡 🤖 Modeli 25. lipnja 2026. · 2 min čitanja

Google: Gemini 3.5 Live Translate — prijevod govor-u-govor u 70+ jezika u stvarnom vremenu

Editorial illustration: audio waveforms connecting speech bubbles in multiple scripts across a globe, real-time translation concept

Google je lansirao Gemini 3.5 Live Translate — sustav za speech-to-speech prijevod koji podržava 70+ jezika i više od 2.000 jezičnih kombinacija u stvarnom vremenu, uz očuvanje intonacije i zaštitu SynthID vodenim žigom.

🟡 🤖 Modeli 24. lipnja 2026. · 2 min čitanja

arXiv:2606.23181: DART — bez treninga do adaptivnog mišljenja u hibridnim reasoning modelima

Editorial illustration: apstraktni dijagram grananja s dva odvojena puta odlučivanja u mreži tokena

DART je metoda usmjeravanja koja bez ikakvog treninga odlučuje treba li AI model dugo razmišljati ili može odmah odgovoriti — smanjuje potrošnju thinking tokena za 15–69% uz istovremeni rast točnosti do +22,5 bodova na testovima koda.

🟡 🤖 Modeli 24. lipnja 2026. · 2 min čitanja

Mistral: OCR 4 — strukturirana ekstrakcija dokumenata s bounding boxovima u 170 jezika

Editorial illustration: skeniran papirni dokument s označenim odlomcima i bounding boxovima u raznim jezicima

Mistral OCR 4 je novi model za optičko prepoznavanje znakova koji postiže vrh ljestvice na OlmOCRBenchu s 85,20 bodova, podržava 170 jezika i donosi paragraph-level bounding boxove — sve uz cijenu od 4 USD na 1000 stranica.

🟡 🤖 Modeli 24. lipnja 2026. · 2 min čitanja

PyTorch/SGLang: DeepSeek-V4 Pro na NVIDIA GB300 — 5× veći throughput uz isti interaktivitet

Editorial illustration: server rack s NVIDIA Blackwell GPU karticama i grafom koji prikazuje peterostruki rast throughputa

PyTorch tim i SGLang su od travnja do lipnja 2026. povećali throughput posluživanja DeepSeek-V4 Pro modela na NVIDIA GB300 arhitekturi s oko 2.200 na više od 11.200 tokena po sekundi po GPU-u — peterostruko poboljšanje bez gubitka interaktiviteta za krajnjeg korisnika.

🟡 🤖 Modeli 21. lipnja 2026. · 2 min čitanja

arXiv:2606.20560: DiffusionGemma jednako čitljiv kao Gemma 4 — praznina od 28,6× srušena na 1,1×

Urednička ilustracija: DiffusionGemma jednako čitljiv kao Gemma 4 — praznina od 28,6× srušena na 1,1×

DiffusionGemma je Googleov difuzijski jezični model koji operira u kontinuiranom latentnom prostoru. Istraživanje 13 autora predvođeno Neelom Nandom pokazuje da je inicijalna neprozirnost 28,6× veća od Gemme 4, ali interpretabilni token bottleneck tu razliku sužava na svega 1,1×.

🟢 🤖 Modeli 21. lipnja 2026. · 2 min čitanja

arXiv:2606.20543: Prostorno spekulativno dekodiranje ubrzava generiranje slika 13,3×

Urednička ilustracija: Prostorno spekulativno dekodiranje ubrzava generiranje slika 13,3×

SSD (Spatially Speculative Decoding) je nova metoda koja istovremeno predviđa horizontalni i vertikalni susjed piksela u autoregresivnom generiranju slika, čime postiže do 13,3× ubrzanje bez gubitka vizualne kvalitete na DPG-Bench i GenEval benchmarkima.

🟢 🤖 Modeli 21. lipnja 2026. · 2 min čitanja

arXiv:2606.20561: TimeProVe smanjuje troškove zaključivanja nad dugim videozapisima za 93%

Urednička ilustracija: TimeProVe smanjuje troškove zaključivanja nad dugim videozapisima za 93%

TimeProVe je okvir koji ubrzava zaključivanje VLM modela nad dugim videozapisima uvođenjem dvostupanjskog „predloži pa provjeri” pristupa. Smanjuje pozive skupim modelima za 75% i ukupan trošak inferencije za 93%, a na novom OpenTSUBench benchmarku nadmašuje najjačeg konkurenta za 7,3 postotna boda.

🟢 🤖 Modeli 21. lipnja 2026. · 2 min čitanja

arXiv:2606.20008: VIMPO — pojačano učenje bez kritičara pobjeđuje GRPO na MATH-500 i AIME

Urednička ilustracija: VIMPO — pojačano učenje bez kritičara pobjeđuje GRPO na MATH-500 i AIME

VIMPO je nova metoda pojačanog učenja za LLM rezoniranje koja iz KL-regulariziranog RL izvodi implicitnu funkciju vrijednosti — bez zasebne mreže kritičara. Nadmašuje GRPO na četiri matematička benchmarka uključujući AIME 2024 i AIME 2025, a prednosti ostaju stabilne i pod šumovitim uvjetima nagrade.

🟡 🤖 Modeli 20. lipnja 2026. · 2 min čitanja

arXiv:2606.20333: SoftSkill komprimira skill-dokumente u 32 latentna tokena i diže LiveMath za 42,1 boda

Urednička ilustracija: dugi dokument sažima se u nekoliko svijetlećih latentnih tokena

SoftSkill je metoda opisana u radu arXiv:2606.20333 koja pretvara skill-dokumente, poput Markdown SKILL.md datoteka, u kompaktne kontinuirane latentne objekte koji vode ponašanje modela bez mijenjanja baznog modela. Umjesto stotina ili tisuća tokena uputa, SoftSkill koristi 32 virtualna tokena i na zadatku LiveMath postiže poboljšanje od 42,1 postotnog boda u odnosu na rad bez vještine.

Pogledaj cijelu arhivu →