🔧 Hardware

54 vijesti

🟢 🔧 Hardware 10. srpnja 2026. · 2 min čitanja

AMD: SGLang Diffusion na ROCm-u dovodi generiranje i uređivanje slika na Instinct GPU-e — inference framework iz LLM svijeta širi se na difuziju

Editorial ilustracija: AMD GPU čip iz kojeg izranja generirana slika kroz difuzijske slojeve

AMD je objavio vodič za pokretanje difuzijskih modela za generiranje i uređivanje slika na Instinct GPU-ima kroz SGLang Diffusion na ROCm steku. SGLang, inference framework izvorno popularan za velike jezične modele, sada proširuje podršku na image difuziju, čime AMD jača ponudu za AI inference izvan NVIDIA ekosustava.

🟢 🔧 Hardware 9. srpnja 2026. · 2 min čitanja

AMD: FlyDSL — Python DSL koji obećava performanse ručno pisanih HIP C++ GPU kernela uz znatno manje koda

Editorial ilustracija: Python zmija oko GPU čipa iz kojeg izlaze optimizirani tokovi

FlyDSL je AMD-ov Python domain-specific jezik za pisanje GPU kernela koji prema novom ROCm vodiču dostiže performanse ručno optimiziranog HIP C++ koda uz manje napisanih linija. AMD je objavio praktični vodič za portiranje postojećih HIP kernela, pozicionirajući FlyDSL kao Python-first alternativu NVIDIA-inu CUDA lancu.

🟢 🔧 Hardware 7. srpnja 2026. · 3 min čitanja

AMD objašnjava occupancy matematiku za MI355X: visoka popunjenost nije uvjet za vršni throughput

Editorial ilustracija: AMD CDNA4 MI355X GPU matematika zaposlenosti i optimizacija kernel koda

AMD ROCm tim objavio je tehnički vodič o ručnom izračunu GPU occupancyja za CDNA4 arhitekturu. Ključni nalaz: matrix-bound kerneli na MI355X postižu vršni throughput pri svega 12% occupancyja — protuintuitivan rezultat za praktičare koji dolaze iz CUDA ekosustava.

🟢 🔧 Hardware 7. srpnja 2026. · 3 min čitanja

NVIDIA Vera: zašto agentski AI treba brže jezgre, a ne više jezgri

Editorial ilustracija: NVIDIA Vera CPU s Olympus jezgrama optimiziran za petlje AI agenata

NVIDIA Vera CPU s Olympus jezgrama donosi 50% veći IPC od Grace procesora i 3,4 TB/s core-to-core propusnosti. Perplexity bilježi 1,5× brže dovršavanje poslova na coding agentskim workflowovima.

🟢 🔧 Hardware 6. srpnja 2026. · 4 min čitanja

AMD Quark donosi MXFP4 kvantizaciju za FLUX.1-dev na Instinct MI350 uz 1,92× ubrzanje

Editorial ilustracija: AMD MI350 MXFP4 kvantizacija ubrzava generiranje slika difuzijskim modelima

AMD Quark 0.12 omogućuje MXFP4 kvantizaciju FLUX.1-dev modela za generiranje slika na Instinct MI350 GPU-ima putem Diffusers i xDiT okvira. S torch.compile, MXFP4 ASM postiže 1,92× ubrzanje nad BF16 eager baseline uz CLIP ocjene identične referenci.

🟢 🔧 Hardware 6. srpnja 2026. · 4 min čitanja

AMD Primus Tuning Agent automatski pronalazi optimalnu LLM konfiguraciju za MI355X klastere

Editorial ilustracija: AMD Primus automatsko podešavanje konfiguracije treniranja jezičnih modela na MI355X

AMD ROCm Primus Tuning Agent kombinira deterministički seed planer i LLM-vođenu istraživačku petlju kako bi automatski otkrio optimalne konfiguracije za treniranje LLM-ova na AMD Instinct GPU-ima. Na Mixtral 8×22B postigao je +27% mjerenog throughputa nad AMD-ovom referencom za samo ~30 minuta pretrage.

🟢 🔧 Hardware 6. srpnja 2026. · 3 min čitanja

Kvantne tehnologije i AI: što je realno danas, a što ostaje budućnost

Editorial ilustracija: Kvantne tehnologije i AI komplementarnost u istraživanju naprednih materijala

Industrijski stručnjaci iz Multiverse Computinga i Toshibine korporacije za OECD.ai razlažu gdje kvantne tehnologije već danas mijenjaju AI, a gdje optimistična očekivanja nisu potkrijepljena dokazima. Tensor mreže smanjuju računalnu potrebu 10–100 puta; šira kvantna ML primjena nije realna u idućem desetljeću.

🟡 🔧 Hardware 3. srpnja 2026. · 4 min čitanja

AMD AgentKernelArena: otvoreni benchmark za AI agente na GPU kernel optimizaciji

Editorial ilustracija: AMD MI355 GPU čip za optimizaciju kernel koda AI agenata u benchmarku

AMD Research objavio je 3. srpnja 2026. otvoreni benchmarking okvir AgentKernelArena koji mjeri koliko dobro AI coding agenti optimiziraju stvarne GPU kernele. Od 214 zadataka u četiri kategorije, AMD-ov vlastiti GEAKv3 (Claude Opus 4.6) vodi s 9,04x ubrzanjem na HIP kernelima, dok Claude Code (Opus 4.6) dolazi drugi s 6,08x. Svi eksperimenti provođeni su na AMD Instinct MI300X unutar ROCm 7.1.1.

🟡 🔧 Hardware 3. srpnja 2026. · 4 min čitanja

AMD Eagle3 i Quark FP8: spekulativno dekodiranje donosi do 2,00x throughput na MI355X

Editorial ilustracija: AMD Eagle3 spekulativno dekodiranje na AMD Instinct GPU-u za ubrzano zaključivanje

AMD ROCm tim objavio je 3. srpnja 2026. detalje produkcijske primjene Eagle3 spekulativnog dekodiranja na AMD hardveru. Kombinacija Eagle3 multi-layer pristupa, vLLM backenda i AMD Quark FP8 kvantizacije postiže 1,69x do 2,00x veći throughput za Kimi-K2.5 i 1,38x do 1,79x za MiniMax-M2.5 na AMD Instinct MI355X, bez gubitka u kvaliteti izlaza.

🟢 🔧 Hardware 3. srpnja 2026. · 4 min čitanja

AMD ROCm: GPU-rezidentni YOLO26 pipeline drži video okvire u VRAM-u od dekodiranja do detekcije

Editorial ilustracija: AMD Radeon GPU detekcija objekata u videu s YOLO26 pipelineom

AMD je objavio GPU-rezidentni pipeline za detekciju objekata koji koristi rocDecode, DLPack, PyTorch i MIGraphX kako bi video okviri nikad ne napustili VRAM — sve do trenutka kad su poznate završne detekcije.

🟢 🔧 Hardware 30. lipnja 2026. · 3 min čitanja

NVIDIA: softverski stack na Blackwellu smanjio trošak tokena DeepSeek V4 pet puta za mjesec dana

Editorial ilustracija: NVIDIA Blackwell softverski stog za inferenciju smanjuje cijenu po tokenu pet puta

NVIDIA objašnjava kako naslagane softverske optimizacije na Blackwell arhitekturi — od NVFP4 preciznosti do spekulativnog dekodiranja — postižu do 20× veći throughput i pet puta niži trošak tokena za DeepSeek V4 modele.

🟡 🔧 Hardware 29. lipnja 2026. · 2 min čitanja

AMD: ROCm low-latency GEMM kerneli ubrzavaju LLM inferenciju do 1,79× na Instinct MI355X

Editorial ilustracija: ROCm low-latency GEMM kerneli ubrzavaju LLM inferenciju do 1,79× na Instinct MI355X, bez teksta i lica

AMD je objavio FlyDSL sustav unutar AITER frameworka (AI Tensor Engine for ROCm) koji automatski generira specijalizirane GEMM kernele za LLM decode fazu na AMD GPU-ovima. Rezultat: 1,64× prosječno smanjenje latencije i 1,79× ubrzanje za najkritičnije scenarije s M≤8 tokena, testirano na Instinct MI355X s 256 compute jedinica.

🟢 🔧 Hardware 28. lipnja 2026. · 1 min čitanja

AMD: Resource Manager automatski istiskuje neaktivne GPU workloadove i vraća resurse u zajednički pool klastera

Editorial ilustracija: redovi GPU akceleratora s tokovima resursa u podatkovnom centru, bez teksta i lica

AMD Resource Manager dobio je automatsko istiskivanje (pre-emption): prati iskorištenost GPU-a po radnom opterećenju i prekida poslove ispod konfigurabilnog praga (npr. 10%) nakon zadanog idle timera (npr. 15 minuta). Nudi dvije politike — istiskivanje samo pod pritiskom na GPU ili uvijek — vraćajući resurse zauzete neaktivnim dev okruženjima u zajednički pool.

🟡 🔧 Hardware 27. lipnja 2026. · 2 min čitanja

AMD: MXFP4/MXFP6 mixed-precision kvantizacija na MI355X — do 29% veći throughput

Editorial illustration: AMD Instinct MI355X GPU akcelerator s dijagramom mixed-precision kvantizacije i grafom throughputa

AMD je na Instinct MI355X akceleratoru demonstrirao W_MXFP4_A_MXFP6 mixed-precision kvantizaciju koja donosi do 29% veći throughput uz zadržavanje točnosti bliske FP8 standardu, koristeći vLLM framework za produkcijsku inferenciju.

🟡 🔧 Hardware 26. lipnja 2026. · 2 min čitanja

NVIDIA i AWS: EC2 G7 instance s Blackwell GPU-om donose 4,6× bolji AI inference

Editorial illustration: NVIDIA Blackwell GPU server rack u AWS podatkovnom centru s plavim svjetlosnim efektima

NVIDIA i AWS najavili su EC2 G7 instance s RTX PRO 4500 Blackwell GPU-om koji donosi 4,6× bolji AI inference od prethodne G6 generacije, dok knjižnica cuVS postaje zadana u Amazon OpenSearch Serverlessu s 10× bržim vektorskim indeksiranjem.

🔴 🔧 Hardware 25. lipnja 2026. · 3 min čitanja

OpenAI: Jalapeño — vlastiti ASIC čip za LLM inference koji smanjuje ovisnost o NVIDIA-i

Editorial illustration: futuristic AI inference chip labeled Jalapeno on a circuit board, green accent lighting, no faces or text

OpenAI i Broadcom zajednički su najavili Jalapeño, custom ASIC čip optimiziran za LLM inference. Strateški korak kojim OpenAI ulazi u kategoriju vlastitog silikona — ravnopravno uz Google TPU, Apple Neural Engine i AWS Trainium — i smanjuje ovisnost o NVIDIA GPU-ima.

🟢 🔧 Hardware 25. lipnja 2026. · 1 min čitanja

AMD: ATOM optimizer — DP Attention i Two-Batch Overlap za DeepSeek-V4 na MI355X

Editorial illustration: AMD MI355X GPU čip s grafom optimizacije propusnosti inference workloada

ATOM je AMD-ov open-source inference engine (softverski pogon za pokretanje AI modela) za MI355X GPU koji donosi dvije optimizacije za DeepSeek-V4: PrefillDelayer eliminira gubitak pri koordinaciji rankova, a Two-Batch Overlap ubrzava balansiranje tokena uz preklapanje mrežnih operacija.

🟢 🔧 Hardware 24. lipnja 2026. · 2 min čitanja

AMD ROCm: EAGLE3 speculative decoding ubrzava Kimi-K2.5 za 33% na MI325X

Editorial illustration: AMD Instinct MI325X GPU kartice u data centru s grafom rasta brzine generiranja teksta

AMD ROCm tim demonstrirao je EAGLE3 speculative decoding na 8× Instinct MI325X s modelom Kimi-K2.5, postižući 33% veći output throughput i 58% manji median inter-token latency bez gubitka točnosti na GSM8K benchmarku.

🟡 🔧 Hardware 23. lipnja 2026. · 2 min čitanja

NVIDIA: JUPITER — prvo europsko exascale superračunalo postavlja znanstvene rekorde na ISC 2026

Editorial illustration: Europski datacenter s NVIDIA Grace Hopper čipovima i plavim infiniband kabelima

JUPITER je prvo europsko exascale superračunalo, smješteno u Forschungszentrum Jülich u Njemačkoj. Pogonjen NVIDIA Grace Hopper Superchipovima i Quantum-X800 InfiniBand mrežom, JUPITER je mapirao 86 milijardi neurona, oborio kvantni rekord simulacijom 50 qubita i dostigao svjetski rekord u klimatskim simulacijama.

🟡 🔧 Hardware 23. lipnja 2026. · 2 min čitanja

NVIDIA: Vera CPU u Los Alamosu — 7× brži agentic AI za nuklearnu znanost i 3 nova superračunala

Editorial illustration: NVIDIA Vera CPU procesorski čip i shema superračunala u istraživačkom laboratoriju

NVIDIA Vera CPU s Olympus jezgrom stiže u Los Alamos National Laboratory donoseći 7× bolje performanse na URSA workloadima i 3× na Monte Carlo simulacijama prijenosa topline u usporedbi s Crossroads x86 procesorom. Tri nova superračunala — Mission, Vision i Veritas — bit će operativna 2027.

🟢 🔧 Hardware 23. lipnja 2026. · 2 min čitanja

NVIDIA: CUDA-X biblioteke cuPhoton, DAQIRI i ALCHEMI ubrzavaju astronomiju, kemiju i materijale

Editorial illustration: NVIDIA GPU supercomputing hardware powering scientific data visualization with astronomical and molecular graphics

NVIDIA je objavila tri nove CUDA-X softverske biblioteke za AI u znanosti: cuPhoton za astronomiju nudi ubrzanje do 14.900×, ALCHEMI kod Lila Sciences postiže 50× brži screening materijala, a DAQIRI ubrzava real-time networking za fizikalne detektore.

🟢 🔧 Hardware 20. lipnja 2026. · 1 min čitanja

AMD: ROCm optimizacija Matrix3D-a za 3D svjetove ubrzala renderiranje do 54 posto na Instinct GPU-ima

Urednička ilustracija: proceduralno generiran 3D krajolik izranja iz GPU jezgre

AMD je na ROCm blogu opisao optimizaciju okvira Matrix3D za generiranje istraživih 3D svjetova na AMD Instinct GPU-ima. Zamjenom CUDA-specifičnih komponenti Triton kernelima i korištenjem biblioteke gsplat za 3DGS, renderiranje je na GPU-u MI250 ubrzano za 54 posto, a na MI300 za 50 posto, dok je sam rendering kernel 36 posto brži od CUDA verzije.

🟡 🔧 Hardware 19. lipnja 2026. · 2 min čitanja

AMD: Analiza RoCE mrežnih uzoraka pri treningu velikih jezičnih modela

Editorial ilustracija: Analiza RoCE mrežnih uzoraka pri treningu velikih jezičnih modela

AMD je objavio komparativnu analizu RoCE mrežnih prometnih uzoraka pri treningu četiri velika LLM-a — GPT-4, Llama 3, DeepSeek-V2 i Grok 4.0 — kao praktično vodstvo za izgradnju AI infrastrukture u scale-out klasterima s više GPU čvorova.

🟢 🔧 Hardware 18. lipnja 2026. · 1 min čitanja

AMD: Open-source Schola spaja Unreal Engine i učenje pojačanjem za trening robotske ruke na ROCm-u

Editorial ilustracija: trening robotske ruke učenjem pojačanjem u simulaciji

AMD je predstavio Schola, open-source dodatak za Unreal Engine koji omogućuje trening učenjem pojačanjem kompatibilan s Gymnasiumom kroz Python okvire i gRPC. U primjeru se kolaborativna robotska ruka xArm6 trenira u Unreal Engineu 5.7 s MuJoCo fizikom, algoritmom PPO i PyTorchem na AMD ROCm stogu za GPU ubrzanje. Tutorial pokazuje reach-zadatak u kojem se vrh ruke pomiče na nasumične ciljne lokacije.

🟡 🔧 Hardware 17. lipnja 2026. · 1 min čitanja

AMD: Instinct MI355X u MLPerf Training v6.0 na 5% zaostatka za NVIDIA-om, 3,5× brži od prošle generacije

Editorial ilustracija: AMD Instinct MI355X akcelerator u podatkovnom centru

AMD je u MLPerf Training v6.0 pokazao da je Instinct MI355X unutar otprilike 5% performansi ekvivalentnog NVIDIA GPU-a na LLM benchmarkovima. MI355X je 3,5× brži od prošlogodišnjeg MI300X te 13–19% brži od prethodnog kruga. AMD je prvi put uveo MXFP4 (FP4) recepte za trening i Primus jedinstveni okvir, uz višečvornu prijavu od 512 MI300X GPU-a na 64 čvora.

🟡 🔧 Hardware 17. lipnja 2026. · 2 min čitanja

NVIDIA: Blackwell pomeo MLPerf Training 6.0 — najbrži na svih 7 benchmarka, GB300 do 1,6× brži

Editorial ilustracija: NVIDIA Blackwell GPU klaster za treniranje AI modela

NVIDIA je objavila da je njezina Blackwell platforma postigla najbolje rezultate na svih sedam testova MLPerf Training 6.0. GB300 NVL72 donosi do 1,6× brži trening od GB200 NVL72, a najveća prijava koristila je 8.192 Blackwell GPU-a na DeepSeek-V3 modelu od 671 milijarde parametara. CoreWeave je istrenirao DeepSeek-V3 671B u 2,02 minute na 8.192 GPU-a, dok je Microsoft Azure odradio Llama 3.1 405B u 7,07 minuta.

🟡 🔧 Hardware 16. lipnja 2026. · 2 min čitanja

AMD: Novi ATOM inference engine za Instinct GPU-e donosi OpenAI-kompatibilan API i MoE optimizacije

Editorial ilustracija: AMD Instinct GPU stog za posluživanje AI modela

AMD je predstavio ATOM, inference engine za Instinct GPU-e koji eksponira OpenAI-kompatibilan API te orkestrira KV cache, scheduling i paralelizam. ATOM je vrh ROCm stoga, uz AITER kernele i MoRI RDMA komunikaciju, podržava TP, DP i EP paralelizam te je optimiziran za MoE modele poput DeepSeek V2–V4, Mixtral i Qwen3-MoE. Nudi FP8, MXFP4, INT8 i INT4 kvantizaciju te MTP speculative decoding s EAGLE proposerom.

🟢 🔧 Hardware 12. lipnja 2026. · 3 min čitanja

Reciklirani Pixel telefoni postaju podatkovni centar: 2.000 uređaja, 50% manje ugljičnog otiska

Editorial ilustracija: Google pretvara 2000 povučenih Pixel telefona u niskougljični podatkovni centar

Istraživači sa UC San Diego uz podršku Googlea grade podatkovni centar od 2.000 povučenih Pixel pametnih telefona. Zadržavanjem matičnih ploča štede oko 50% ugrađenog ugljika, a klaster od 25 do 50 telefona već sada odrađuje vršna opterećenja za 75 studentskih kolegija paralelnog računarstva.

🟡 🔧 Hardware 4. lipnja 2026. · 2 min čitanja

Black Forest Labs: FLUX.2 [klein] stiže predinstaliran na ASUS ProArt laptope

Urednička ilustracija: FLUX.2 [klein] stiže predinstaliran na ASUS ProArt laptope

Black Forest Labs u partnerstvu s ASUS-om i NVIDIA-om donosi FLUX.2 [klein] predinstaliran na ASUS ProArt potrošačke laptope. Riječ je o prvom slučaju da se FLUX model isporučuje predinstaliran na potrošačkom hardveru. Model od 4 milijarde parametara omogućuje generaciju i editiranje slika u manje od jedne sekunde, lokalno i bez ovisnosti o cloudu.

🟡 🔧 Hardware 1. lipnja 2026. · 2 min čitanja

OpenAI: najavljen Stargate data-centar u Michiganu

Urednička ilustracija: najavljen Stargate data-centar u Michiganu

OpenAI je najavio izgradnju novog Stargate data-centra u američkoj saveznoj državi Michigan. Riječ je o širenju Stargate infrastrukturnog programa za računalnu snagu koji OpenAI smješta u kontekst takozvanog Intelligence Agea. Detalji o kapacitetu i ulaganju u ovoj objavi nisu razrađeni, pa upućujemo na službeni izvor.

🟢 🔧 Hardware 1. lipnja 2026. · 2 min čitanja

AMD: Alibabin ROLL framework radi nativno na Instinct GPU-ovima

Urednička ilustracija: Alibabin ROLL framework radi nativno na Instinct GPU-ovima

AMD je objavio da Alibabin open-source reinforcement-learning framework ROLL sada radi nativno na AMD Instinct GPU-ovima uz ROCm softver, bez izmjena koda, custom patcheva ili nestandardnih buildova. Suradnja uključuje vLLM kompatibilnost, popravke za Ray i podršku za distribuirani RL trening velikih jezičnih modela.

🟢 🔧 Hardware 29. svibnja 2026. · 1 min čitanja

AMD: Spekulativno dekodiranje na MI300X ubrzava inferenciju 4,3×

Urednička ilustracija: Spekulativno dekodiranje na MI300X ubrzava inferenciju 4,3×

AMD je na ROCm blogu predstavio implementaciju spekulativnog dekodiranja na Instinct MI300X GPU-ima. Tehnika u kojoj manji draft model predviđa tokene, a veći ih verificira, postigla je do 4,3 puta veću propusnost u odnosu na klasično autoregresivno generiranje.

🟢 🔧 Hardware 27. svibnja 2026. · 3 min čitanja

AMD ROCm: 4-valna interleave optimizacija FP8 GEMM kernela za Instinct MI355X (CDNA 4) udostručuje register budžet po valu

Urednička ilustracija: 4-valna interleave optimizacija FP8 GEMM kernela za Instinct MI355X (CDNA 4) udostručuje regist

AMD ROCm blog opisuje novu 4-valan interleave pristup za FP8 GEMM (matrično množenje s pomiješanom preciznošću) kernele na Instinct MI355X akceleratoru s CDNA 4 arhitekturom. Optimizacija mijenja raspored od 8-valnog ping-pong pristupa prema 4 vala s punim VGPR budžetom od 512 registara, eliminirajući konflikte u LDS memoriji kroz XOR-baziranog swizzle i skrivajući memorijsku latenciju preciznim preklapanjem MFMA instrukcija i učitavanja podataka.

🟢 🔧 Hardware 27. svibnja 2026. · 3 min čitanja

PyTorch: TokenSpeed postiže rekordnih 580 token/s na Qwen3.5-397B-A17B s NVIDIA Blackwell GPU-ima

Urednička ilustracija: TokenSpeed postiže rekordnih 580 token/s na Qwen3.5-397B-A17B s NVIDIA Blackwell GPU-ima

TokenSpeed, open-source LLM inference engine LightSeek Foundationa s MIT licencom, postigao je 580 tokena u sekundi na Qwen3.5-397B-A17B modelu koristeći osam NVIDIA Blackwell B200 GPU-a u TP8 konfiguraciji. Rekord je ostvaren za agentičke workloade s prefix cachingom i preklapanjem CPU-GPU izvođenja, uz manje od 16% degradacije performansi i pri kontekstu od 1 milijun tokena.

🟡 🔧 Hardware 25. svibnja 2026. · 2 min čitanja

AMD: Ryzen AI Max+ 395 pokreće LLM modele do 122 milijarde parametara uz zajedničku memoriju

Urednička ilustracija: Ryzen AI Max+ 395 pokreće LLM modele do 122 milijarde parametara uz zajedničku memoriju

AMD ROCm blog objavio je detaljnu analizu LLM inferencije na Ryzen AI Max+ 395 procesoru s UMA (Unified Memory Architecture) arhitekturom. Sustav s 128 GB LPDDR5X memorije postiže 42 tok/s na Qwen3.5 35B MoE modelu s punim GPU offloadingom, a podržava i modele do 122B parametara kombiniranjem CPU i GPU memorije.

🟢 🔧 Hardware 23. svibnja 2026. · 4 min čitanja

AMD: Gluon block-level model omogućuje GEMM kernele s 5.255 TFLOPS MXFP4 na Instinct MI355

Editorial ilustracija: GPU akcelerator s rasporedom matričnih jedinica i pipeline tokova

AMD ROCm tim objavio je tutorial za pisanje high-performance GEMM kernela u Gluon programskom modelu na MI355 GPU-u. Optimirani FP16 kernel postiže 1.489 TFLOPS uz 98,75 posto MFMA efikasnosti, dok proširenja na BF8 (3.257 TFLOPS) i MXFP4 (5.255 TFLOPS) demonstriraju relevantnost za moderne AI workloade. Tutorial uključuje workgroup remapping i swizzle koji reducira L2 cache misses s 5,3 M na 4,1 M.

🟡 🔧 Hardware 21. svibnja 2026. · 2 min čitanja

AMD: ROCm 7.13 donosi MI350P GPU, multi-VF virtualizaciju i TheRock pakiranje

Editorial illustration: AMD ROCm 7.13 s MI350P GPU, multi-VF virtualizacijom i TheRock modularnim pakiranjem

AMD je 20. svibnja 2026. objavio ROCm 7.13 — novu verziju open-source AI compute stack-a koja donosi podršku za MI350P GPU, virtualizaciju do 8 izoliranih vGPU-a po MI300X akceleratoru, open-source ROCprof Trace decoder za transparentnu analizu performansi i modularno TheRock pakiranje s domain-specific SDK-ovima. Release validiran je na Ubuntu 26.04 i RHEL 9.6 te uključuje VMware ESXi 9.1 podršku za MI350X i MI355X.

🟢 🔧 Hardware 16. svibnja 2026. · 3 min čitanja

AMD ROCm: BubbleFence dijeli video streamove embeddingom iz Vision Foundation modela umjesto metadata heuristika

Editorial illustration: video frameovi s embedding bubble vizualizacijom u 2D prostoru.

BubbleFence je novi AMD ROCm AI tool objavljen 15. svibnja 2026. koji rješava fundamental ML problem semantičkog dijeljenja video streamova u train/validation/test setove bez semantic leakage. Umjesto klasičnih metadata-based heuristika, BubbleFence koristi vision foundation model embeddinge (CLIP) i adaptive bubbles s LID weighting za particioniranje. Demonstriran na autonomous driving (Zenseact Open Dataset) i Minecraft gameplay scenarijima bez configuration promjena.

🟢 🔧 Hardware 15. svibnja 2026. · 2 min čitanja

AMD ROCm: Kimi-K2.5 W4A8 i W8A8 kvantizacija na MI325X kroz Quark + FlyDSL + AITER inference stack

Editorial illustration: AMD MI325X GPU s W4A8 quantizacijskim slojem i inference akceleracijskim ikonama.

AMD ROCm Kimi-K2.5 quantization za MI325X je novi inference acceleration blueprint objavljen 14. svibnja 2026. Kombinira AMD Quark kvantizacijski toolkit za pretvaranje Kimi-K2.5 modela u W4A8 i W8A8 precision formate, FlyDSL inference serving sloj i AITER optimization stack. Pristup pozicionira non-NVIDIA inference path za chinese frontier modele i pokazuje AMD strategiju da MI325X postane održiva alternativa H100/H200 za open-source LLM serving.

🟡 🔧 Hardware 12. svibnja 2026. · 2 min čitanja

AMD: Instinct MI355X nadmašuje NVIDIA B200 za ComfyUI workflowove uz PyTorch optimizacije u ROCm 7.2.0

Editorial illustration: Instinct MI355X nadmašuje NVIDIA B200 za ComfyUI workflowove uz PyTorch optimizacije u ROCm 7.2.0

AMD Instinct MI355X je data center GPU koji u objavljenom benchmark-u nadmašuje NVIDIA B200 na tri ComfyUI generativna workflowa — text-to-video Wan2.2 (1.44×), text-to-image FLUX.1-dev (1.42×) i 3D Hunyuan3D v2.1 (1.20×) — zahvaljujući AOTriton gfx950 kernelima, hipBLASLt GEMM tuningu i ostalim ROCm 7.2.0 optimizacijama.

🟡 🔧 Hardware 12. svibnja 2026. · 2 min čitanja

NVIDIA: Fleet Intelligence — managed nadzor velikih GPU flota s kriptografskom provjerom integriteta

Editorial illustration: Fleet Intelligence — managed nadzor velikih GPU flota s kriptografskom provjerom integriteta

NVIDIA Fleet Intelligence je managed servis koji u stvarnom vremenu nadzire velike flote NVIDIA data center GPU-a — snagu, temperaturu, performanse i ECC greške — uz kriptografsku provjeru autentičnosti GPU-a kroz NVIDIA Remote Attestation Service. Servis je besplatan za vlasnike Vera Rubin, Blackwell i Hopper GPU-a.

🟡 🔧 Hardware 11. svibnja 2026. · 2 min čitanja

vLLM: TurboQuant studija pokazuje da FP8 ostaje superioran za KV-cache — 3bit-nc pad ~20 pp

Editorial illustration: TurboQuant studija pokazuje da FP8 ostaje superioran za KV-cache — 3bit-nc pad ~20 pp

TurboQuant je metoda agresivne kvantizacije KV-cachea na 3-4 bita koju je Red Hat AI tim sustavno usporedio s FP8 standardom. Rezultati pokazuju da FP8 zadržava propusnost i točnost, dok varijante 3bit-nc gube približno 20 postotnih bodova na zahtjevnim reasoning benchmarkovima poput AIME25.

🔴 🔧 Hardware 7. svibnja 2026. · 3 min čitanja

NVIDIA: Spectrum-X Multipath Reliable Connection postaje OCP otvoreni standard za gigascale AI mreže

Editorial illustration: paralelne svjetlovodne staze između AI rack-ova s natpisom MRC, Spectrum-X i OCP open standard

NVIDIA Spectrum-X Multipath Reliable Connection (MRC) je RDMA transportni protokol koji distribuira jednu vezu preko više mrežnih putova i sada je objavljen kao otvorena specifikacija kroz Open Compute Project. MRC je već u produkciji kod OpenAI-a, Microsoftovog Fairwater data centra i Oracleovog Abilene data centra, a razvijen je u suradnji s AMD-om, Broadcomom, Intelom i Microsoftom.

🟡 🔧 Hardware 6. svibnja 2026. · 2 min čitanja

AMD: FarSkip-Collective ubrzava MoE inferenciju 18-34 % na AMD GPU-ima

Editorial illustration: paralelni tokovi između AMD GPU-a tijekom MoE inferencije bez idle blokova.

AMD ROCm tim predstavio je FarSkip-Collective, modificiranu MoE arhitekturu koja eliminira GPU idle vrijeme tijekom Expert Parallelism komunikacije. Rezultati: 18 % manji TTFT za Llama-4 Scout, do 1,34× ubrzanje za DeepSeek-V3 i 11 % bržu Moonlight pre-trening fazu.

🟡 🔧 Hardware 5. svibnja 2026. · 3 min čitanja

ArXiv SAGA: workflow-atomic GPU scheduling za AI agente postiže 1,64× brže task completion na 64-GPU klasteru, prihvaćeno na HPDC 2026

Editorial ilustracija: GPU klaster s povezanim agentnim workflow-ovima kao atomarnim jedinicama, simbolika scheduling-a

Tim Dongxin Guo, Jikun Wu i Siu Ming Yiu predstavio je 1. svibnja 2026. SAGA — workflow-atomic raspoređivač za AI agente na GPU klasterima koji tretira cijeli agent workflow kao jednu schedulable jedinicu umjesto pojedinačnih LLM poziva. Sustav postiže 1,64× geometrijsku sredinu smanjenja task completion vremena na 64-GPU klasteru i 99,2 % SLO postizanje pod multi-tenant opterećenjem. Rad je prihvaćen na HPDC 2026 u Clevelandu (13.-16. srpnja 2026.).

🟢 🔧 Hardware 25. travnja 2026. · 2 min čitanja

AMD Primus Projection: alat za predviđanje memorije i brzine treninga LLM-ova prije pokretanja na Instinct GPU klasterima

Editorial illustration: AMD Primus Projection — predviđanje LLM treninga

AMD Primus Projection je alat koji prije pokretanja treninga LLM-a na Instinct GPU klasterima predviđa memorijske zahtjeve i propusnost. Koristi analitičke formule uz stvarni GPU benchmark, a projekcije su unutar ~10 % izmjerenih rezultata na MI325X i MI355X akceleratorima za Llama i Mixtral modele.

🟢 🔧 Hardware 24. travnja 2026. · 3 min čitanja

Google na Cloud Next '26 predstavio TPU 8i i TPU 8t: specijalizirani čipovi za agentno AI računarstvo

Editorial illustration: Google TPU 8i i 8t — specijalizirani AI čipovi

Google je na konferenciji Cloud Next '26 predstavio dvije nove generacije TPU čipova: TPU 8i za inferenciju AI agenata i TPU 8t za trening najsloženijih modela. Potez formalizira podjelu Googleove TPU linije na dvije specijalizirane grane unutar 'agentne ere' računarstva.

🟡 🔧 Hardware 23. travnja 2026. · 2 min čitanja

NVIDIA i Google Cloud najavili suradnju za agentic AI i physical AI na zajedničkoj infrastrukturi

Editorial illustration: AI čip — hardware

NVIDIA i Google Cloud objavili su zajedničku suradnju za ubrzavanje agentic AI i physical AI radnih opterećenja, kombinirajući NVIDIA GPU infrastrukturu s Google Cloud platformom za robotiku, autonomne sustave i agente.

🟢 🔧 Hardware 23. travnja 2026. · 2 min čitanja

Gemma 4 pokrenut kao Vision Language Agent lokalno na Jetson Orin Nano Super

Editorial illustration: AI čip — hardware

NVIDIA i HuggingFace demonstrirali su Gemma 4 kao Vision Language Agent koji autonomno odlučuje o korištenju kamere i cijelu pipeline obradu, uključujući speech-to-text i TTS, izvodi lokalno na NVIDIA Jetson Orin Nano Super s 8 GB memorije, bez cloud ovisnosti.

🔴 🔧 Hardware 22. travnja 2026. · 3 min čitanja

Google predstavio 8. generaciju TPU čipova: dvije specijalizirane varijante za agentic AI eru

Editorial ilustracija: Dva specijalizirana TPU cipa 8. generacije za treniranje i inferenciju agentic AI workloada

Google je na Cloud Next '26 konferenciji predstavio osmu generaciju svojih TPU čipova u dvije specijalizirane varijante — TPU 8t za treniranje modela i TPU 8i za agentic inference. Prva je to generacija posebno dizajnirana za autonomne AI agente i multi-step rezoniranje.

Pogledaj cijelu arhivu →