🔧 Hardware

54 Nachrichten

🟢 🔧 Hardware 10. Juli 2026 · 2 Min. Lesezeit

AMD: SGLang Diffusion auf ROCm bringt Bildgenerierung und -bearbeitung auf Instinct-GPUs — Inferenz-Framework aus der LLM-Welt erweitert sich auf Diffusion

Redaktionelle Illustration: AMD-GPU-Chip, aus dem ein generiertes Bild durch Diffusionsschichten hervortritt

AMD hat einen Leitfaden zur Ausführung von Diffusionsmodellen für Bildgenerierung und -bearbeitung auf Instinct-GPUs über SGLang Diffusion im ROCm-Stack veröffentlicht. SGLang, ursprünglich als Inferenz-Framework für große Sprachmodelle bekannt, erweitert die Unterstützung nun auf Bilddiffusion und stärkt damit AMDs KI-Inferenzangebot außerhalb des NVIDIA-Ökosystems.

🟢 🔧 Hardware 9. Juli 2026 · 2 Min. Lesezeit

AMD: FlyDSL — Python-DSL verspricht Leistung manuell geschriebener HIP-C++-GPU-Kernel mit deutlich weniger Code

Redaktionelle Illustration: Python-Schlange um einen GPU-Chip, aus dem optimierte Ströme austreten

FlyDSL ist AMDs Python-domänenspezifische Sprache für GPU-Kernel, die laut einem neuen ROCm-Leitfaden die Leistung von manuell optimiertem HIP-C++-Code erreicht und dabei weniger geschriebene Zeilen benötigt. AMD veröffentlichte einen praktischen Leitfaden zum Portieren bestehender HIP-Kernel und positioniert FlyDSL als Python-first-Alternative zur NVIDIA-CUDA-Toolchain.

🟢 🔧 Hardware 7. Juli 2026 · 3 Min. Lesezeit

AMD erklärt Occupancy-Mathematik für MI355X: Hohe Auslastung ist keine Voraussetzung für Peak-Throughput

Redaktionelle Illustration: AMD CDNA4 MI355X GPU Occupancy-Mathematik und Kernel-Code-Optimierung

Das AMD-ROCm-Team hat einen technischen Leitfaden zur manuellen Berechnung der GPU-Occupancy für die CDNA4-Architektur veröffentlicht. Zentraler Befund: Matrix-gebundene Kernel auf dem MI355X erreichen Peak-Throughput bei nur 12 % Occupancy — ein kontraintuitives Ergebnis für Entwickler aus dem CUDA-Ökosystem.

🟢 🔧 Hardware 7. Juli 2026 · 3 Min. Lesezeit

NVIDIA Vera: Warum agentische KI schnellere Kerne braucht, nicht mehr Kerne

Redaktionelle Illustration: NVIDIA Vera CPU mit Olympus-Kernen optimiert für KI-Agenten-Schleifen

Der NVIDIA Vera CPU mit Olympus-Kernen liefert 50 % mehr IPC als Grace und 3,4 TB/s Core-to-Core-Bandbreite. Perplexity verzeichnet 1,5× schnellere Job-Abschlüsse bei agentischen Coding-Workflows.

🟢 🔧 Hardware 6. Juli 2026 · 3 Min. Lesezeit

AMD Quark bringt MXFP4-Quantisierung für FLUX.1-dev auf Instinct MI350 mit 1,92× Beschleunigung

Editorial-Illustration: AMD MI350 MXFP4-Quantisierung beschleunigt Bildgenerierung mit Diffusionsmodellen

AMD Quark 0.12 ermöglicht die MXFP4-Quantisierung des FLUX.1-dev-Bildgenerierungsmodells auf Instinct-MI350-GPUs über die Diffusers- und xDiT-Frameworks. Mit torch.compile erzielt MXFP4 ASM eine 1,92-fache Beschleunigung gegenüber dem BF16-Eager-Baseline bei identischen CLIP-Scores.

🟢 🔧 Hardware 6. Juli 2026 · 3 Min. Lesezeit

AMD Primus Tuning Agent findet automatisch die optimale LLM-Konfiguration für MI355X-Cluster

Editorial-Illustration: AMD Primus automatisches Abstimmen der Trainingskonfiguration für Sprachmodelle auf MI355X

Der AMD-ROCm-Primus-Tuning-Agent kombiniert einen deterministischen Seed-Planer und eine LLM-gesteuerte Explorationsschleife, um optimale Konfigurationen für das LLM-Training auf AMD-Instinct-GPUs automatisch zu entdecken. Auf Mixtral 8×22B erzielte er +27% gemessenen Durchsatz über AMDs Referenz in nur ~30 Minuten Suche.

🟢 🔧 Hardware 6. Juli 2026 · 3 Min. Lesezeit

Quantentechnologien und KI: Was heute realistisch ist und was Zukunft bleibt

Editorial-Illustration: Komplementarität von Quantentechnologien und KI in der Erforschung fortgeschrittener Materialien

Industrieexperten von Multiverse Computing und der Toshiba Corporation erläutern für OECD.ai, wo Quantentechnologien KI bereits heute verändern und wo optimistische Erwartungen nicht belegt sind. Tensornetzwerke reduzieren den Rechenaufwand 10–100-fach; breitere Quanten-ML-Anwendungen sind im nächsten Jahrzehnt nicht realistisch.

🟡 🔧 Hardware 3. Juli 2026 · 3 Min. Lesezeit

AMD AgentKernelArena: offener Benchmark für KI-Agenten zur GPU-Kernel-Optimierung

Redaktionelle Illustration: AMD MI355 GPU-Chip zur Optimierung von Kernel-Code durch KI-Agenten im Benchmark

AMD Research veröffentlichte am 3. Juli 2026 das offene Benchmark-Framework AgentKernelArena, das misst, wie gut KI-Coding-Agenten reale GPU-Kernel optimieren. Von 214 Aufgaben in vier Kategorien führt AMDs eigener GEAKv3 (Claude Opus 4.6) mit einer 9,04-fachen Beschleunigung bei HIP-Kerneln; Claude Code (Opus 4.6) folgt mit 6,08x. Alle Experimente wurden auf AMD Instinct MI300X unter ROCm 7.1.1 durchgeführt.

🟡 🔧 Hardware 3. Juli 2026 · 4 Min. Lesezeit

AMD Eagle3 und Quark FP8: Spekulatives Decoding bringt bis zu 2,00x Durchsatz auf MI355X

Redaktionelle Illustration: AMD Eagle3 Speculative Decoding auf AMD Instinct GPU für beschleunigte Inferenz

Das AMD ROCm-Team veröffentlichte am 3. Juli 2026 Details zur Produktionsanwendung von Eagle3 Speculative Decoding auf AMD-Hardware. Die Kombination aus Eagle3-Multi-Layer-Ansatz, vLLM-Backend und AMD Quark FP8-Quantisierung erreicht 1,69x bis 2,00x höheren Durchsatz für Kimi-K2.5 und 1,38x bis 1,79x für MiniMax-M2.5 auf AMD Instinct MI355X — ohne Qualitätsverlust bei der Ausgabe.

🟢 🔧 Hardware 3. Juli 2026 · 4 Min. Lesezeit

AMD ROCm: GPU-residente YOLO26-Pipeline hält Video-Frames von der Dekodierung bis zur Erkennung im VRAM

Redaktionelle Illustration: AMD Radeon GPU-Objekterkennung in Video mit YOLO26-Pipeline

AMD präsentierte eine GPU-residente Pipeline zur Objekterkennung, die rocDecode, DLPack, PyTorch und MIGraphX kombiniert, sodass Video-Frames nie den VRAM verlassen — bis die endgültigen Erkennungsergebnisse vorliegen.

🟢 🔧 Hardware 30. Juni 2026 · 3 Min. Lesezeit

NVIDIA: Software-Stack auf Blackwell senkt Token-Kosten für DeepSeek V4 in einem Monat um das Fünffache

Redaktionelle Illustration: NVIDIA Blackwell Software-Stack für Inferenz senkt die Kosten pro Token um das Fünffache

NVIDIA erklärt, wie gestapelte Software-Optimierungen auf der Blackwell-Architektur — von NVFP4-Präzision bis spekulativem Decoding — bis zu 20× höheren Durchsatz und fünfmal niedrigere Token-Kosten für DeepSeek-V4-Modelle erzielen.

🟡 🔧 Hardware 29. Juni 2026 · 2 Min. Lesezeit

AMD: ROCm Low-Latency-GEMM-Kernel beschleunigen LLM-Inferenz bis zu 1,79× auf Instinct MI355X

Redaktionelle Illustration: ROCm Low-Latency-GEMM-Kernel beschleunigen LLM-Inferenz bis zu 1,79× auf Instinct MI355X, ohne Text und Gesichter

AMD veröffentlichte das FlyDSL-System im AITER-Framework (AI Tensor Engine for ROCm), das automatisch spezialisierte GEMM-Kernel für die LLM-Decode-Phase auf AMD-GPUs generiert. Ergebnis: 1,64× durchschnittliche Latenzreduktion und 1,79× Beschleunigung für die kritischsten Szenarien mit M≤8 Token, getestet auf Instinct MI355X mit 256 Compute-Einheiten.

🟢 🔧 Hardware 28. Juni 2026 · 1 Min. Lesezeit

AMD: Resource Manager verdrängt automatisch inaktive GPU-Workloads und gibt Ressourcen an den Cluster-Pool zurück

Redaktionelle Illustration: Reihen von GPU-Beschleunigern mit Ressourcenflüssen in einem Rechenzentrum, ohne Text und Gesichter

Der AMD Resource Manager erhielt automatische Verdrängung (Pre-emption): Er überwacht die GPU-Auslastung pro Arbeitslast und unterbricht Jobs unterhalb eines konfigurierbaren Schwellenwerts (z.B. 10%) nach einem festgelegten Idle-Timer (z.B. 15 Minuten). Er bietet zwei Richtlinien – Verdrängung nur unter GPU-Druck oder immer – und gibt Ressourcen inaktiver Entwicklungsumgebungen an den gemeinsamen Pool zurück.

🟡 🔧 Hardware 27. Juni 2026 · 2 Min. Lesezeit

AMD: MXFP4/MXFP6 Mixed-Precision-Quantisierung auf MI355X — bis zu 29% mehr Durchsatz

Editorial illustration: AMD Instinct MI355X GPU-Beschleuniger mit Diagramm zur Mixed-Precision-Quantisierung und Durchsatzgraph

AMD hat auf dem Instinct MI355X-Beschleuniger die W_MXFP4_A_MXFP6 Mixed-Precision-Quantisierung demonstriert, die bis zu 29% mehr Durchsatz bei nahezu FP8-genauer Präzision liefert und dabei das vLLM-Framework für den Produktionseinsatz nutzt.

🟡 🔧 Hardware 26. Juni 2026 · 2 Min. Lesezeit

NVIDIA und AWS: EC2 G7-Instanzen mit Blackwell-GPU bringen 4,6× bessere KI-Inferenz

Editorial illustration: NVIDIA Blackwell GPU server rack in an AWS data center with blue light effects

NVIDIA und AWS haben EC2 G7-Instanzen mit RTX PRO 4500 Blackwell-GPU angekündigt, die eine 4,6× bessere KI-Inferenz als die Vorgänger-G6-Generation bieten. Die cuVS-Bibliothek wird zur Standardoption in Amazon OpenSearch Serverless mit 10× schnellerer Vektorindexierung.

🔴 🔧 Hardware 25. Juni 2026 · 3 Min. Lesezeit

OpenAI: Jalapeño — eigener ASIC-Chip für LLM-Inferenz, um die Abhängigkeit von NVIDIA zu reduzieren

Redaktionelle Illustration: futuristischer KI-Inferenzchip mit der Aufschrift Jalapeno auf einer Platine, grüne Akzentbeleuchtung, keine Gesichter oder Text

OpenAI und Broadcom haben gemeinsam Jalapeño angekündigt, einen maßgeschneiderten ASIC-Chip für LLM-Inferenz. Ein strategischer Schritt, mit dem OpenAI in die Kategorie eigener Siliziumlösungen eintritt — gleichrangig mit Google TPU, Apple Neural Engine und AWS Trainium — und die Abhängigkeit von NVIDIA-GPUs reduziert.

🟢 🔧 Hardware 25. Juni 2026 · 1 Min. Lesezeit

AMD: ATOM-Optimizer — DP Attention und Two-Batch Overlap für DeepSeek-V4 auf MI355X

Redaktionelle Illustration: AMD MI355X GPU-Chip mit Diagramm zur Optimierung des Inferenz-Durchsatzes

ATOM ist AMDs Open-Source-Inferenz-Engine für den MI355X-GPU mit zwei Optimierungen für DeepSeek-V4: PrefillDelayer eliminiert Koordinationsverluste zwischen Data-Parallel-Ranks, und Two-Batch Overlap beschleunigt das Token-Balancing durch Überlappung von Netzwerkoperationen.

🟢 🔧 Hardware 24. Juni 2026 · 2 Min. Lesezeit

AMD ROCm: EAGLE3 Speculative Decoding beschleunigt Kimi-K2.5 um 33 % auf MI325X

Redaktionelle Illustration: AMD Instinct MI325X GPU-Karten in einem Rechenzentrum mit einem Diagramm steigender Generierungsgeschwindigkeit

Das AMD ROCm-Team demonstrierte EAGLE3 Speculative Decoding auf 8× Instinct MI325X mit dem Modell Kimi-K2.5 und erzielte einen um 33 % höheren Output-Throughput sowie eine um 58 % geringere mediane Inter-Token-Latenz — ohne Genauigkeitsverlust beim GSM8K-Benchmark.

🟡 🔧 Hardware 23. Juni 2026 · 2 Min. Lesezeit

NVIDIA: JUPITER — Europas erstes Exascale-Supercomputer stellt Wissenschaftsrekorde auf der ISC 2026 auf

Editorial illustration: Europäisches Rechenzentrum mit NVIDIA Grace Hopper Chips und blauen InfiniBand-Kabeln

JUPITER ist Europas erstes Exascale-Supercomputer, untergebracht im Forschungszentrum Jülich in Deutschland. Angetrieben von NVIDIA Grace Hopper Superchips und Quantum-X800-InfiniBand-Netzwerk kartierte JUPITER 86 Milliarden Neuronen, brach einen Quantenrekord mit der Simulation von 50 Qubits und erreichte einen Weltrekord bei Klimasimulationen.

🟡 🔧 Hardware 23. Juni 2026 · 2 Min. Lesezeit

NVIDIA: Vera CPU in Los Alamos — 7× schnellere agentische KI für Nuklearwissenschaft und 3 neue Supercomputer

Editorial illustration: NVIDIA Vera CPU Prozessorchip und Supercomputer-Schema in einem Forschungslabor

NVIDIA Vera CPU mit Olympus-Kern kommt ins Los Alamos National Laboratory und bringt 7× bessere Leistung bei URSA-Workloads und 3× bei Monte-Carlo-Wärmeübertragungssimulationen im Vergleich zum Crossroads-x86-Prozessor. Drei neue Supercomputer — Mission, Vision und Veritas — sollen 2027 in Betrieb gehen.

🟢 🔧 Hardware 23. Juni 2026 · 2 Min. Lesezeit

NVIDIA: CUDA-X-Bibliotheken cuPhoton, DAQIRI und ALCHEMI beschleunigen Astronomie, Chemie und Materialwissenschaft

Editorial illustration: NVIDIA GPU supercomputing hardware powering scientific data visualization with astronomical and molecular graphics

NVIDIA hat drei neue CUDA-X-Softwarebibliotheken für KI in der Wissenschaft veröffentlicht: cuPhoton für die Astronomie bietet eine 14.900-fache Beschleunigung, ALCHEMI ermöglicht bei Lila Sciences ein 50-fach schnelleres Materialscreening, und DAQIRI beschleunigt Echtzeit-Networking für physikalische Detektoren.

🟢 🔧 Hardware 20. Juni 2026 · 1 Min. Lesezeit

AMD: ROCm-Optimierung von Matrix3D für 3D-Welten beschleunigt Rendering auf Instinct-GPUs um bis zu 54 Prozent

Redaktionelle Illustration: prozedural generierte 3D-Landschaft, die aus einem GPU-Kern aufsteigt

AMD beschreibt im ROCm-Blog die Optimierung des Matrix3D-Frameworks zur Generierung erkundbarer 3D-Welten auf AMD-Instinct-GPUs. Durch den Ersatz CUDA-spezifischer Komponenten durch Triton-Kernel und die Nutzung der gsplat-Bibliothek für 3DGS wurde das Rendering auf der MI250-GPU um 54 Prozent und auf der MI300 um 50 Prozent beschleunigt; der Rendering-Kernel selbst ist 36 Prozent schneller als die CUDA-Version.

🟡 🔧 Hardware 19. Juni 2026 · 2 Min. Lesezeit

AMD: Analyse von RoCE-Netzwerkverkehrsmustern beim Training großer Sprachmodelle

Redaktionelle Illustration: Analyse von RoCE-Netzwerkverkehrsmustern beim Training großer Sprachmodelle

AMD veröffentlichte eine vergleichende Analyse der RoCE-Netzwerkverkehrsmuster beim Training von vier großen Sprachmodellen — GPT-4, Llama 3, DeepSeek-V2 und Grok 4.0 — als praktischen Leitfaden für den Aufbau von KI-Infrastruktur in Scale-out-Clustern mit mehreren GPU-Knoten.

🟢 🔧 Hardware 18. Juni 2026 · 1 Min. Lesezeit

AMD: Open-source Schola verbindet Unreal Engine und Reinforcement Learning für Roboterarm-Training auf ROCm

Redaktionelle Illustration: Reinforcement-Learning-Training eines Roboterarms in der Simulation

AMD hat Schola vorgestellt, ein Open-Source-Plugin für Unreal Engine, das Gymnasium-kompatibles Reinforcement-Learning-Training über Python-Frameworks und gRPC ermöglicht. Im Beispiel wird ein kollaborativer Roboterarm xArm6 in Unreal Engine 5.7 mit MuJoCo-Physik, dem PPO-Algorithmus und PyTorch auf dem AMD ROCm-Stack für GPU-Beschleunigung trainiert. Das Tutorial zeigt eine Reach-Aufgabe, bei der die Armspitze zu zufällig platzierten Zielorten bewegt wird.

🟡 🔧 Hardware 17. Juni 2026 · 1 Min. Lesezeit

AMD: Instinct MI355X bei MLPerf Training v6.0 nur 5% hinter NVIDIA, 3,5× schneller als Vorgänger

Redaktionelle Illustration: AMD Instinct MI355X Beschleuniger im Rechenzentrum

AMDs MLPerf Training v6.0 Ergebnisse zeigen, dass der Instinct MI355X auf LLM-Benchmarks innerhalb von etwa 5% der Leistung eines gleichwertigen NVIDIA-GPUs liegt. Der MI355X ist 3,5× schneller als der MI300X des Vorjahres und 13–19% schneller als die vorherige Runde. AMD führte erstmals MXFP4 (FP4)-Trainingsrezepte und das Primus-Unified-Framework ein, zusammen mit einer Mehrknoteneinreichung von 512 MI300X-GPUs auf 64 Knoten.

🟡 🔧 Hardware 17. Juni 2026 · 1 Min. Lesezeit

NVIDIA: Blackwell dominiert MLPerf Training 6.0 — schnellster auf allen 7 Benchmarks, GB300 bis zu 1,6× schneller

Redaktionelle Illustration: NVIDIA Blackwell GPU-Cluster für KI-Modelltraining

NVIDIA gab bekannt, dass ihre Blackwell-Plattform auf allen sieben Tests des MLPerf Training 6.0 die besten Ergebnisse erzielt hat. GB300 NVL72 bietet bis zu 1,6× schnelleres Training als GB200 NVL72. Die größte Einreichung nutzte 8.192 Blackwell-GPUs am DeepSeek-V3-Modell mit 671 Milliarden Parametern. CoreWeave trainierte DeepSeek-V3 671B in 2,02 Minuten auf 8.192 GPUs, Microsoft Azure schloss Llama 3.1 405B in 7,07 Minuten ab.

🟡 🔧 Hardware 16. Juni 2026 · 2 Min. Lesezeit

AMD: Neuer ATOM Inference Engine für Instinct GPUs bietet OpenAI-kompatible API und MoE-Optimierungen

Redaktionelle Illustration: AMD-Instinct-GPU-Stack für KI-Modell-Serving

AMD hat ATOM vorgestellt, einen Inference Engine für Instinct GPUs, der eine OpenAI-kompatible API bereitstellt und KV-Cache, Scheduling und Parallelismus orchestriert. ATOM steht an der Spitze des ROCm-Stacks, neben AITER-Kerneln und MoRI-RDMA-Kommunikation, unterstützt TP-, DP- und EP-Parallelismus und ist für MoE-Modelle wie DeepSeek V2–V4, Mixtral und Qwen3-MoE optimiert. Er bietet FP8-, MXFP4-, INT8- und INT4-Quantisierung sowie MTP Speculative Decoding mit EAGLE-Proposer.

🟢 🔧 Hardware 12. Juni 2026 · 3 Min. Lesezeit

Recycelte Pixel-Phones als Rechenzentrum: 2.000 Geräte, 50 % weniger Kohlenstoff-Fußabdruck

Redaktionelle Illustration: Google wandelt 2.000 ausgesonderte Pixel-Phones in ein CO₂-armes Rechenzentrum um

Forscher der UC San Diego bauen mit Unterstützung von Google ein Rechenzentrum aus 2.000 ausgesonderten Pixel-Smartphones. Durch den Erhalt der Hauptplatinen sparen sie rund 50 % des eingebetteten Kohlenstoffs, und ein Cluster von 25 bis 50 Smartphones bewältigt bereits Spitzenlastanforderungen für 75 studentische Kurse in der parallelen Datenverarbeitung.

🟡 🔧 Hardware 4. Juni 2026 · 2 Min. Lesezeit

Black Forest Labs: FLUX.2 [klein] kommt vorinstalliert auf ASUS-ProArt-Laptops

Redaktionelle Illustration: FLUX.2 [klein] kommt vorinstalliert auf ASUS-ProArt-Laptops

Black Forest Labs bringt in Partnerschaft mit ASUS und NVIDIA FLUX.2 [klein] vorinstalliert auf ASUS-ProArt-Consumer-Laptops. Es ist das erste Mal, dass ein FLUX-Modell vorinstalliert auf Consumer-Hardware ausgeliefert wird. Das Modell mit 4 Milliarden Parametern ermöglicht die Generierung und Bearbeitung von Bildern in weniger als einer Sekunde, lokal und ohne Abhängigkeit von der Cloud.

🟡 🔧 Hardware 1. Juni 2026 · 2 Min. Lesezeit

OpenAI: Stargate-Rechenzentrum in Michigan angekündigt

Redaktionelle Illustration: Stargate-Rechenzentrum in Michigan angekündigt

OpenAI kündigte den Bau eines neuen Stargate-Rechenzentrums im US-Bundesstaat Michigan an. Es handelt sich um eine Erweiterung des Stargate-Infrastrukturprogramms für Rechenleistung, das OpenAI in den Kontext des sogenannten Intelligence Age stellt. Details zu Kapazität und Investition werden in dieser Ankündigung nicht ausgeführt, daher verweisen wir auf die offizielle Quelle.

🟢 🔧 Hardware 1. Juni 2026 · 2 Min. Lesezeit

AMD: Alibabas ROLL-Framework läuft nativ auf Instinct-GPUs

Redaktionelle Illustration: Alibabas ROLL-Framework läuft nativ auf Instinct-GPUs

AMD gab bekannt, dass Alibabas Open-Source-Reinforcement-Learning-Framework ROLL jetzt nativ auf AMD Instinct-GPUs mit der ROCm-Software läuft, ohne Codeänderungen, Custom-Patches oder nicht-standardisierte Builds. Die Zusammenarbeit umfasst vLLM-Kompatibilität, Fixes für Ray und Unterstützung für verteiltes RL-Training großer Sprachmodelle.

🟢 🔧 Hardware 29. Mai 2026 · 2 Min. Lesezeit

AMD: Spekulatives Decoding auf MI300X beschleunigt Inferenz um das 4,3-Fache

Redaktionelle Illustration: Spekulatives Decoding auf MI300X beschleunigt Inferenz um das 4,3-Fache

Im ROCm-Blog stellte AMD eine Implementierung des spekulativen Decodings auf Instinct-MI300X-GPUs vor. Die Technik, bei der ein kleineres Draft-Modell Tokens vorhersagt und ein größeres sie verifiziert, erreichte einen bis zu 4,3-mal höheren Durchsatz im Vergleich zur klassischen autoregressiven Generierung.

🟢 🔧 Hardware 27. Mai 2026 · 2 Min. Lesezeit

AMD ROCm: 4-Wave-Interleave-Optimierung der FP8-GEMM-Kernel fuer Instinct MI355X (CDNA 4) verdoppelt Register-Budget pro Wave

Urednička ilustracija: 4-valna interleave optimizacija FP8 GEMM kernela za Instinct MI355X (CDNA 4) udostručuje regist

Der AMD ROCm Blog beschreibt einen neuen 4-Wave-Interleave-Ansatz fuer FP8-GEMM-Kernel (Matrixmultiplikation mit gemischter Praezision) auf dem Instinct MI355X mit CDNA-4-Architektur. Die Optimierung wechselt vom 8-Wave-Ping-Pong-Layout zu 4 Waves mit vollem VGPR-Budget von 512 Registern, eliminiert LDS-Speicher-Bankkonflikte durch XOR-basiertes Swizzle und verbirgt Speicherlatenz durch praezises Ueberlappen von MFMA-Instruktionen mit Datenladevorgaengen.

🟢 🔧 Hardware 27. Mai 2026 · 2 Min. Lesezeit

PyTorch: TokenSpeed erreicht Rekord 580 Token/s auf Qwen3.5-397B-A17B mit NVIDIA Blackwell GPUs

Urednička ilustracija: TokenSpeed postiže rekordnih 580 token/s na Qwen3.5-397B-A17B s NVIDIA Blackwell GPU-ima

TokenSpeed, eine Open-Source-LLM-Inferenz-Engine der LightSeek Foundation mit MIT-Lizenz, erreichte 580 Token pro Sekunde auf dem Qwen3.5-397B-A17B-Modell mit acht NVIDIA Blackwell B200 GPUs in TP8-Konfiguration. Der Rekord wurde für agentische Workloads mit Prefix-Caching und CPU-GPU-Ausführungsüberlappung erzielt, mit weniger als 16% Leistungsabfall selbst bei 1-Million-Token-Kontext.

🟡 🔧 Hardware 25. Mai 2026 · 2 Min. Lesezeit

AMD: Ryzen AI Max+ 395 führt LLM-Modelle bis 122 Milliarden Parameter mit Unified Memory aus

Urednička ilustracija: Ryzen AI Max+ 395 pokreće LLM modele do 122 milijarde parametara uz zajedničku memoriju

Der AMD ROCm-Blog veröffentlichte eine detaillierte Analyse der LLM-Inferenz auf dem Ryzen AI Max+ 395-Prozessor mit UMA-Architektur (Unified Memory Architecture). Ein System mit 128 GB LPDDR5X-Speicher erreicht 42 Tok/s beim Qwen3.5 35B MoE-Modell mit vollem GPU-Offloading und unterstützt Modelle bis 122B Parameter durch Kombination von CPU- und GPU-Speicher.

🟢 🔧 Hardware 23. Mai 2026 · 3 Min. Lesezeit

AMD: Gluon Block-Level-Modell ermöglicht GEMM-Kernels mit 5,255 TFLOPS MXFP4 auf Instinct MI355

Editorial-Illustration: GPU-Beschleuniger mit Matrix-Einheit-Layout und Pipeline-Flüssen

Das AMD ROCm-Team veröffentlichte ein Tutorial zum Schreiben hochperformanter GEMM-Kernels im Gluon-Programmiermodell auf dem MI355-GPU. Ein optimierter FP16-Kernel erreicht 1,489 TFLOPS bei 98,75 Prozent MFMA-Effizienz; Erweiterungen auf BF8 (3,257 TFLOPS) und MXFP4 (5,255 TFLOPS) belegen die Relevanz für moderne KI-Workloads. Das Tutorial umfasst Workgroup-Remapping und Swizzle, das L2-Cache-Misses von 5,3 Mio. auf 4,1 Mio. reduziert.

🟡 🔧 Hardware 21. Mai 2026 · 2 Min. Lesezeit

AMD: ROCm 7.13 bringt MI350P-GPU, Multi-VF-Virtualisierung und TheRock-Paketierung

Redaktionelle Illustration: AMD ROCm 7.13 mit MI350P-GPU, Multi-VF-Virtualisierung und TheRock-Modulpaketierung

AMD veröffentlichte am 20. Mai 2026 ROCm 7.13 — eine neue Version seines Open-Source-KI-Compute-Stacks mit Unterstützung für den MI350P-GPU, Virtualisierung mit bis zu 8 isolierten vGPUs je MI300X-Beschleuniger, einem Open-Source-ROCprof-Trace-Decoder und modularer TheRock-Paketierung mit domänenspezifischen SDKs. Validiert auf Ubuntu 26.04 und RHEL 9.6, mit VMware-ESXi-9.1-Support für MI350X und MI355X.

🟢 🔧 Hardware 16. Mai 2026 · 3 Min. Lesezeit

AMD ROCm: BubbleFence partitioniert Video-Streams mit Embeddings aus Vision-Foundation-Modellen statt Metadaten-Heuristiken

Redaktionelle Illustration: Video-Frames mit Embedding-Bubble-Visualisierung im 2D-Raum.

BubbleFence ist ein neues AMD-ROCm-KI-Werkzeug, das am 15. Mai 2026 angekündigt wurde und das grundlegende ML-Problem der semantischen Aufteilung von Video-Streams in Trainings-/Validierungs-/Testsets ohne semantisches Leakage löst. Statt klassischer Metadaten-basierter Heuristiken verwendet BubbleFence Vision-Foundation-Modell-Embeddings (CLIP) und adaptive Bubbles mit LID-Gewichtung für die Partitionierung. Demonstriert auf autonomem Fahren (Zenseact Open Dataset) und Minecraft-Gameplay-Szenarien ohne Konfigurationsänderungen.

🟢 🔧 Hardware 15. Mai 2026 · 2 Min. Lesezeit

AMD ROCm: Kimi-K2.5 W4A8 und W8A8 Quantisierung auf MI325X über den Quark + FlyDSL + AITER Inferenz-Stack

Editorial illustration: AMD MI325X GPU mit W4A8-Quantisierungsschicht und Inferenz-Beschleunigungssymbolen.

AMD ROCm Kimi-K2.5 Quantisierung für MI325X ist ein neues Inferenz-Beschleunigungs-Blueprint, veröffentlicht am 14. Mai 2026. Es kombiniert das AMD-Quark-Quantisierungs-Toolkit zur Konvertierung des Kimi-K2.5-Modells in W4A8- und W8A8-Präzisionsformate, die FlyDSL-Inferenz-Serving-Schicht und den AITER-Optimierungs-Stack. Der Ansatz positioniert einen Nicht-NVIDIA-Inferenzpfad für chinesische Frontier-Modelle und demonstriert AMDs Strategie, den MI325X als tragfähige Alternative zum H100/H200 für Open-Source-LLM-Serving zu etablieren.

🟡 🔧 Hardware 12. Mai 2026 · 2 Min. Lesezeit

AMD: Instinct MI355X übertrifft NVIDIA B200 bei ComfyUI-Workflows mit PyTorch-Optimierungen in ROCm 7.2.0

Editorial illustration: Instinct MI355X übertrifft NVIDIA B200 bei ComfyUI-Workflows mit PyTorch-Optimierungen in ROCm 7.2.0

AMD Instinct MI355X ist eine Rechenzentrum-GPU, die in veröffentlichten Benchmarks NVIDIA B200 bei drei generativen ComfyUI-Workflows übertrifft — Text-to-Video Wan2.2 (1,44-fach), Text-to-Image FLUX.1-dev (1,42-fach) und 3D Hunyuan3D v2.1 (1,20-fach) — dank AOTriton gfx950-Kerneln, hipBLASLt-GEMM-Tuning und weiteren ROCm-7.2.0-Optimierungen.

🟡 🔧 Hardware 12. Mai 2026 · 2 Min. Lesezeit

NVIDIA: Fleet Intelligence — verwaltete Überwachung großer GPU-Flotten mit kryptografischer Integritätsprüfung

Editorial illustration: Fleet Intelligence — verwaltete Überwachung großer GPU-Flotten mit kryptografischer Integritätsprüfung

NVIDIA Fleet Intelligence ist ein verwalteter Dienst, der große Flotten von NVIDIA-Rechenzentrum-GPUs in Echtzeit überwacht — Leistungsaufnahme, Temperatur, Performance und ECC-Fehler — mit kryptografischer GPU-Authentizitätsprüfung über den NVIDIA Remote Attestation Service. Der Dienst ist kostenlos für Besitzer von Vera-Rubin-, Blackwell- und Hopper-GPUs.

🟡 🔧 Hardware 11. Mai 2026 · 2 Min. Lesezeit

vLLM: TurboQuant-Studie zeigt FP8 bleibt superior für KV-Cache — 3bit-nc fällt ~20 pp

Editorial illustration: TurboQuant-Studie zeigt FP8 bleibt superior für KV-Cache — 3bit-nc fällt ~20 pp

TurboQuant ist eine aggressive KV-Cache-Quantisierungsmethode auf 3-4 Bit, die das Red Hat AI-Team systematisch mit dem FP8-Standard verglichen hat. Die Ergebnisse zeigen, dass FP8 Durchsatz und Genauigkeit beibehält, während 3bit-nc-Varianten bei anspruchsvollen Reasoning-Benchmarks wie AIME25 rund 20 Prozentpunkte verlieren.

🔴 🔧 Hardware 7. Mai 2026 · 2 Min. Lesezeit

NVIDIA: Spectrum-X Multipath Reliable Connection wird OCP-Offenstandard für Gigascale-KI-Netzwerke

Editorial illustration: parallele Glasfaserpfade zwischen KI-Racks mit MRC-, Spectrum-X- und OCP-Open-Standard-Beschriftungen

NVIDIA Spectrum-X Multipath Reliable Connection (MRC) ist ein RDMA-Transportprotokoll, das eine einzelne Verbindung über mehrere Netzwerkpfade verteilt und nun als offene Spezifikation über das Open Compute Project veröffentlicht wurde. MRC ist bereits bei OpenAI, Microsofts Fairwater-Rechenzentrum und Oracles Abilene-Rechenzentrum im Produktionseinsatz und wurde in Zusammenarbeit mit AMD, Broadcom, Intel und Microsoft entwickelt.

🟡 🔧 Hardware 6. Mai 2026 · 2 Min. Lesezeit

AMD: FarSkip-Collective beschleunigt MoE-Inferenz um 18–34 % auf AMD-GPUs

Redaktionelle Illustration: parallele Datenflüsse zwischen AMD-GPUs während der MoE-Inferenz ohne Leerlaufblöcke.

Das AMD-ROCm-Team stellte FarSkip-Collective vor — eine modifizierte MoE-Architektur, die GPU-Leerlaufzeiten bei Expert-Parallelism-Kommunikation eliminiert. Ergebnisse: 18 % geringerer TTFT für Llama-4 Scout, bis zu 1,34× Beschleunigung für DeepSeek-V3 und 11 % schnelleres Moonlight-Vortraining.

🟡 🔧 Hardware 5. Mai 2026 · 2 Min. Lesezeit

ArXiv SAGA: Workflow-atomares GPU-Scheduling für KI-Agenten erreicht 1,64× schnellere Task-Completion auf 64-GPU-Cluster, angenommen auf HPDC 2026

Redaktionelle Illustration: GPU-Cluster mit verbundenen Agenten-Workflows als atomare Einheiten, Symbolik für Scheduling

Das Team aus Dongxin Guo, Jikun Wu und Siu Ming Yiu präsentierte am 1. Mai 2026 SAGA — einen workflow-atomaren Scheduler für KI-Agenten auf GPU-Clustern, der den gesamten Agenten-Workflow als eine einzige planbare Einheit behandelt statt einzelner LLM-Aufrufe. Das System erreicht eine 1,64-fache geometrische Mittlere Reduzierung der Task-Abschlusszeit auf einem 64-GPU-Cluster und 99,2 % SLO-Erreichung unter Multi-Tenant-Last. Das Paper wurde für HPDC 2026 in Cleveland (13.–16. Juli 2026) angenommen.

🟢 🔧 Hardware 25. April 2026 · 2 Min. Lesezeit

AMD Primus Projection: Werkzeug zur Vorhersage von LLM-Trainingsanforderungen vor dem Start auf Instinct-GPU-Clustern

Editorial illustration: AMD Primus Projection — LLM-Trainingsvorhersage

AMD Primus Projection ist ein Werkzeug, das vor dem Start eines LLM-Trainings auf Instinct-GPU-Clustern Speicherbedarf und Durchsatz vorhersagt. Es kombiniert analytische Formeln mit echtem GPU-Benchmarking, und die Projektionen liegen innerhalb von ~10 % der gemessenen Ergebnisse auf MI325X- und MI355X-Beschleunigern für Llama- und Mixtral-Modelle.

🟢 🔧 Hardware 24. April 2026 · 3 Min. Lesezeit

Google stellt auf Cloud Next '26 TPU 8i und TPU 8t vor: spezialisierte Chips für agentisches KI-Computing

Editorial illustration: Google TPU 8i und 8t — spezialisierte KI-Chips

Google präsentierte auf der Cloud Next '26 zwei neue TPU-Chip-Generationen: TPU 8i für die KI-Agenteninterferenz und TPU 8t für das Training der komplexesten Modelle. Der Schritt formalisiert die Aufteilung von Googles TPU-Linie in zwei spezialisierte Zweige im Rahmen der 'agentischen Ära' des Computings.

🟡 🔧 Hardware 23. April 2026 · 2 Min. Lesezeit

NVIDIA und Google Cloud kündigen Zusammenarbeit für Agentic AI und Physical AI auf gemeinsamer Infrastruktur an

Editorial illustration: AI čip — hardware

NVIDIA und Google Cloud haben eine gemeinsame Zusammenarbeit angekündigt, um Agentic-AI- und Physical-AI-Workloads zu beschleunigen — dabei wird NVIDIAs GPU-Infrastruktur mit der Google Cloud Platform für Robotik, autonome Systeme und Agenten kombiniert.

🟢 🔧 Hardware 23. April 2026 · 2 Min. Lesezeit

Gemma 4 läuft als Vision Language Agent lokal auf Jetson Orin Nano Super

Redaktionelle Illustration: KI-Chip — hardware

NVIDIA und HuggingFace demonstrierten Gemma 4 als Vision Language Agent, der autonom über den Kameraeinsatz entscheidet und die gesamte Pipeline inklusive Speech-to-Text und TTS lokal auf einem NVIDIA Jetson Orin Nano Super mit 8 GB Speicher ausführt — ohne Cloud-Abhängigkeit.

🔴 🔧 Hardware 22. April 2026 · 3 Min. Lesezeit

Google stellt 8. TPU-Generation vor: zwei spezialisierte Varianten für die Ära der agentischen KI

Redaktionelle Illustration: Zwei spezialisierte TPU-Chips der 8. Generation für Training und Inferenz agentischer KI-Workloads

Auf der Cloud Next '26 stellte Google die achte Generation seiner TPU-Chips in zwei spezialisierten Varianten vor — TPU 8t für das Modelltraining und TPU 8i für agentische Inferenz. Es ist die erste Generation, die gezielt für autonome KI-Agenten und mehrstufiges Reasoning entwickelt wurde.

Vollständiges Archiv ansehen →