🤖 Modelle

189 Nachrichten

🟡 🤖 Modelle 10. Juli 2026 · 2 Min. Lesezeit

arXiv:2607.08733: „Super-Gewichte” erklären das Scheitern selektiven Fine-Tunings — Beitrag auf COLM 2026 angenommen

Redaktionelle Illustration: ein Netzwerk von Parametern, in dem einige helle Knoten die gesamte Struktur tragen

Super Weights in LLMs ist ein auf der COLM 2026 angenommener Beitrag, der „Super-Gewichte” identifiziert — eine kleine Anzahl von Parametern, deren Veränderung das Verhalten eines Sprachmodells überproportional beeinflusst. Die Arbeit zeigt, dass genau diese Gewichte erklären, warum selektives Fine-Tuning einzelner Schichten häufig scheitert — mit direkten Folgen für PEFT- und LoRA-Ansätze.

🔴 🤖 Modelle 9. Juli 2026 · 2 Min. Lesezeit

Google: SensorFM — Foundation-Modell auf einer Billion Minuten Wearable-Daten gewinnt 34 von 35 Gesundheitsaufgaben

Redaktionelle Illustration: Smartwatch, aus der biometrische Signalwellen in ein neuronales Netz fließen

SensorFM ist Googles Foundation-Modell für Gesundheitsdaten von Wearables, trainiert auf über einer Billion Minuten Signaldaten von Fitbit- und Pixel-Watch-Geräten von 5 Millionen Nutzern aus über 100 Ländern. Das Modell übertrifft spezialisierte Ansätze bei 34 von 35 Aufgaben: +9 % AUC bei Klassifikation und +21 % Korrelation bei Regression.

🔴 🤖 Modelle 9. Juli 2026 · 2 Min. Lesezeit

Microsoft: Open-Source-Modell Aurora 1.5 übertrifft ECMWF-Ensemble bei 88,9 % der Variablen — neuer Standard in der KI-Wettervorhersage

Redaktionelle Illustration: Globus mit wirbelnden Wetterfronten und Datennetz

Aurora 1.5 ist Microsofts Open-Source-Foundation-Modell für das Erdsystem, das die ECMWF-Ensemble-Vorhersage bei 88,9 % der bewerteten Variablen und Horizonte übertrifft. Die neue Version fügt 22 meteorologische Variablen, stündliche Auflösung und probabilistische Ensemble-Prognosen hinzu — bei Hurrikan Helene erzielt sie rund 33 % weniger Bahnfehler als die ursprüngliche Aurora.

🔴 🤖 Modelle 9. Juli 2026 · 2 Min. Lesezeit

OpenAI: GPT-5.6 in drei Varianten — Sol, Terra und Luna mit Multi-Agent-Orchestrierung und sofortiger GitHub-Copilot-Integration

Redaktionelle Illustration: drei planetarische Kugeln (Sol, Terra, Luna) verbunden durch Datenströme

GPT-5.6 ist OpenAIs neue Modellfamilie mit drei Varianten: Sol (Flagship für komplexes Schlussfolgern), Terra (ausgewogen) und Luna (hochvolumig, kosteneffizient). Sie bringt Programmatic Tool Calling, explizite Prompt-Cache-Steuerung, persistentes Reasoning und Multi-Agent-Orchestrierung in der Beta — ab dem ersten Tag auch in GitHub Copilot verfügbar.

🟡 🤖 Modelle 9. Juli 2026 · 2 Min. Lesezeit

Meta: Muse Spark 1.1 bringt multimodales Reasoning mit einer Million Token Kontext und Sub-Agenten-Koordination über Model API

Redaktionelle Illustration: ein zentraler Funke, der sich in mehrere kleinere Agenten und Anwendungsflüsse verzweigt

Muse Spark 1.1 ist ein multimodales Reasoning-Modell der Meta Superintelligence Labs für agentische Aufgaben, mit einem Kontextfenster von einer Million Token. Das Modell koordiniert Sub-Agenten, navigiert Abläufe über mehrere Apps und verarbeitet Bilder, Videos und PDFs — verfügbar über Meta Model API in der Public Preview und im Thinking-Modus der Meta-KI-App.

🟡 🤖 Modelle 9. Juli 2026 · 2 Min. Lesezeit

xAI: Grok 4.5 — neues Flagship für Coding und agentische Arbeit für 2 Dollar pro Million Eingabe-Token

Redaktionelle Illustration: dunkle Konsole mit Code, aus der ein Roboterarm mit Werkzeug ragt

Grok 4.5 ist xAIs neues Modell, positioniert als Flagship für Coding und agentische Aufgaben, zum Preis von 2 USD pro Million Eingabe- und 6 USD pro Million Ausgabe-Token. Es unterstützt konfigurierbaren Reasoning-Aufwand (niedrig/mittel/hoch) und ist bereits über Perplexitys Agent-API verfügbar — deutlich günstiger als vergleichbare Frontier-Modelle.

🔴 🤖 Modelle 8. Juli 2026 · 4 Min. Lesezeit

Mistral Robostral Navigate: Roboter-KI navigiert nur mit RGB-Kamera

Redaktionelle Illustration: Mistral Robostral verkörpertes Robotermodell für nur RGB-visionsbasierte Navigation

Mistral hat Robostral Navigate vorgestellt, das erste Modell für verkörperte Roboternavigation mit 8 Milliarden Parametern. Es verwendet nur eine einzige RGB-Kamera ohne LiDAR oder Tiefensensoren und erreicht 76,6 % Erfolgsquote auf dem R2R-CE-Benchmark für unbekannte Umgebungen – 4,5 Prozentpunkte über Mehrsensorsystemen.

🔴 🤖 Modelle 8. Juli 2026 · 4 Min. Lesezeit

OpenAI lanciert GPT-Live: Sprachmodell für lebensechte KI-Konversationen

Redaktionelle Illustration: OpenAI GPT-Live Sprachmodell integriert in die ChatGPT Voice-Oberfläche

OpenAI hat GPT-Live vorgestellt, ein neues Sprachmodell für natürliche, lebensechte konversationelle KI-Interaktionen. Ab Tag eins in ChatGPT Voice integriert, erscheint es als Teil des beschleunigten Entwicklungszyklus für Sprachmodelle – nur zwei Tage nach GPT-Realtime-2.1. Technische Spezifikationen und Preise wurden bisher nicht veröffentlicht.

🟡 🤖 Modelle 8. Juli 2026 · 3 Min. Lesezeit

Anthropic entwickelt „Off Switch” für gefährliches Wissen: GRAM isoliert Dual-Use-Fähigkeiten in entfernbare Module

Redaktionelle Illustration: Anthropic GRAM austauschbare Wissensmodule zur Kontrolle und Entfernung von KI-Dual-Use

Anthropic und AE Studio veröffentlichen GRAM (Gradient-Routed Auxiliary Modules) – eine Methode, die Dual-Use-Wissen wie Virologie, Cybersicherheit und Kernphysik während des Trainings in entfernbare neuronale Module isoliert und es ermöglicht, in einem einzigen Training mehrere Modellvarianten mit unterschiedlichen Fähigkeitssätzen zu erzeugen.

🔴 🤖 Modelle 7. Juli 2026 · 4 Min. Lesezeit

Meta launcht Muse Image und Muse Video: Agentische KI, die eigene Fehler selbst korrigiert

Redaktionelle Illustration: Meta Muse generative KI zur Erstellung von Bild- und Videoinhalten

Meta Superintelligence Labs stellt Muse Image und Muse Video vor — Modelle mit agentischer Architektur, die intern Code- und Websuch-Tools aufrufen, und belegen Platz #2 sowie #3 in der Arena-Rangliste mit obligatorischem Content-Seal-Wasserzeichen.

🟡 🤖 Modelle 7. Juli 2026 · 4 Min. Lesezeit

Direct-OPD: Wie ein schwächeres Modell ein stärkeres ohne teures RL trainieren kann

Redaktionelle Illustration: Weak-to-Strong RL-Destillation als Ansatz für Superalignment von KI-Systemen

Forscher der Tsinghua University und Zhipu AI schlagen Direct On-Policy Distillation (Direct-OPD) vor — eine Methode, die RL-Gewinne eines schwächeren Lehrermodells auf einen stärkeren Schüler überträgt, ohne die endgültige Policy zu imitieren, und dabei einen Sprung von 48,3 % auf 62,4 % auf AIME 2024 erzielt.

🔴 🤖 Modelle 6. Juli 2026 · 5 Min. Lesezeit

Anthropic entdeckt J-space: emergenter interner Arbeitsraum in Claude

Editorial-Illustration: Anthropic-Forschung zur Interpretierbarkeit und verborgenen Verhaltensweisen in neuronalen Netzen

Anthropic-Forscher haben mithilfe der neuen Technik Jacobian Lens (J-lens) eine emergente interne Struktur in Claude identifiziert – den J-space. Inspiriert von der neurowissenschaftlichen Global-Workspace-Theorie, fungiert J-space als stiller interner Resonanzraum, der im Modell-Output nicht sichtbar ist und verborgene Verhaltensweisen wie Datenfabrikation, Erkennung von Testszenarien und implantierte bösartige Ziele aufdecken kann.

🟡 🤖 Modelle 6. Juli 2026 · 4 Min. Lesezeit

AWS führt rDPO ein – selektives Vergessen für Amazon-Nova-Modelle

Editorial-Illustration: Selektives Vergessen in KI-Modellen mittels rDPO und LoRA-Unlearning-Techniken

Amazon Web Services hat eine Technik des selektiven Vergessens (Unlearning) für Nova-Modelle vorgestellt, basierend auf Reverse Direct Preference Optimization (rDPO). Implementiert über LoRA-Adapter ohne vollständiges Neutraining, reduziert die Technik die Rate unerwünschter Ablehnungen um bis zu 53,74 Prozentpunkte bei minimalem Nutzlichkeitsverlust.

🟡 🤖 Modelle 6. Juli 2026 · 3 Min. Lesezeit

OpenAI veröffentlicht GPT-Realtime-2.1 und Mini-Variante: verbesserte Spracherkennung und Rauschunterdrückung

Editorial-Illustration: OpenAI GPT Realtime Sprachmodelle für agentische Audiokommunikation in Echtzeit

OpenAI veröffentlichte am 6. Juli 2026 zwei neue Realtime-Sprachmodelle – GPT-Realtime-2.1 und GPT-Realtime-2.1-mini – verfügbar am bestehenden v1/realtime-Endpunkt. Die Modelle bieten verbesserte Erkennung alphanumerischer Zeichenfolgen, besseres Handling von Stille und Rauschen sowie verbessertes Verhalten bei Gesprächsunterbrechungen.

🟢 🤖 Modelle 6. Juli 2026 · 3 Min. Lesezeit

MiniMax M2, M2.1 und M2.5 jetzt auf Amazon Bedrock verfügbar

Editorial-Illustration: AWS-Bedrock-Plattform mit neuen offenen MoE-Modellen von Drittanbietern

Amazon Bedrock erweitert sein Angebot um drei Open-Weight-MiniMax-Modelle – M2 mit einem Kontextfenster von einer Million Token, M2.1 für tiefes Reasoning und Coding sowie M2.5 mit einer Mixture-of-Experts-Architektur aus 230 Milliarden Parametern, ausgelegt für agentische Anwendungen.

🟡 🤖 Modelle 3. Juli 2026 · 3 Min. Lesezeit

ReContext verbessert die Nutzung von 128K-Kontextfenstern ohne Retraining

Redaktionelle Illustration: Wiederholung von Belegen im langen Kontextfenster von 128K Token für ein Sprachmodell

Forscher der University of Illinois entwickelten ReContext — eine Inferenztechnik, die relevante Belege aus langen Kontextfenstern rekursiv wiederholt und konsistente Verbesserungen auf drei LLM-Architekturen über acht Benchmarks hinweg erzielt, ohne Retraining.

🟢 🤖 Modelle 3. Juli 2026 · 4 Min. Lesezeit

VRRL: Reinforcement Learning zwingt Visuelle Modelle dazu, beim Selbstkorrigieren wirklich das Bild zu nutzen

Redaktionelle Illustration: Visuelles Sprachmodell mit Reinforcement Learning zur Selbstreflexion über Szenen

Liyan Tang, Fangcong Yin und Greg Durrett entwickelten VRRL — ein Reinforcement-Learning-Framework, das durch Trajektorie-Präfix-Maskierung und Experience Replay visuelle Sprachmodelle zwingt, Selbstreflexion im tatsächlichen visuellen Input zu verankern, mit deutlich besserer Leistung auf verteilungsgeschobenen Beispielen.

🟡 🤖 Modelle 1. Juli 2026 · 3 Min. Lesezeit

Fable 5 und Mythos 5 wieder verfügbar: Anthropic stellt Modellzugang wieder her

Redaktionelle Illustration: Anthropic stellt Claude Fable 5 und Mythos 5 für Nutzer wieder zur Verfügung

Anthropic hat am 1. Juli den Zugang zu Claude Fable 5 und Claude Mythos 5 wiederhergestellt — knapp drei Wochen nachdem die Modelle aufgrund US-amerikanischer Exportkontrollen zurückgezogen wurden. Die Rückkehr geht mit einem verbesserten Sicherheitsklassifikator und einem Vorschlag für einen branchenweiten Rahmen zur Bewertung der Schwere von Jailbreaks einher.

🟡 🤖 Modelle 1. Juli 2026 · 3 Min. Lesezeit

NVIDIA Nemotron und OpenAI GPT OSS-Modelle in AWS GovCloud mit FedRAMP High-Zertifikat verfügbar

Redaktionelle Illustration: NVIDIA Nemotron und OpenAI gpt-oss-Modelle auf AWS Bedrock GovCloud mit strengen Sicherheitszertifikaten

AWS GovCloud (US) erhält sechs neue Modelle auf Amazon Bedrock: OpenAI Open-Weight-Modelle gpt-oss-120b und gpt-oss-20b sowie vier NVIDIA Nemotron-Modelle mit 1-Millionen-Token-Kontext. Die Infrastruktur erfüllt FedRAMP High, DoD IL 2/4/5, ITAR und CJIS mit Zero-Operator-Access-Design.

🟡 🤖 Modelle 1. Juli 2026 · 4 Min. Lesezeit

GitHub Copilot Vision und Browser-Tools: zwei GA-Fähigkeiten an einem Tag

Redaktionelle Illustration: GitHub Copilot Vision und Browser-Tools werden allgemein verfügbar

GitHub hat an einem Tag zwei Copilot-Fähigkeiten auf GA erklärt: Vision für das Anhängen von Bildern und PDFs an Chat-Prompts sowie Browser-Tools, die Agenten in VS Code die Kontrolle über einen echten Browser geben. Beide sind ohne Admin-Aktion für alle Pläne verfügbar.

🔴 🤖 Modelle 30. Juni 2026 · 4 Min. Lesezeit

Claude Sonnet 5: Anthropics agentischstes Modell wird zum neuen Standard

Redaktionelle Illustration: Anthropic präsentiert das neue Flagship-Modell Claude Sonnet 5 für agentische Aufgaben

Anthropic startet heute Claude Sonnet 5 — ein Modell, das mehrstufige Aufgaben plant, Browser und Terminals steuert und auf zentralen Benchmarks an Opus 4.8 heranreicht, mit einem Einführungspreis von $2/$10 pro Million Token bis 31. August 2026 und einem 1-Million-Token-Kontextfenster.

🟡 🤖 Modelle 30. Juni 2026 · 4 Min. Lesezeit

Fable 5 kehrt zurück: Regierung hebt Exportkontrollen auf, globales Redeployment beginnt am 1. Juli

Redaktionelle Illustration: Anthropic reaktiviert Fable 5 nach Aufhebung des US-Regierungsexportverbots

Nach 18 Tagen globaler Suspendierung kündigt Anthropic das Redeployment von Fable 5 an: Die US-Regierung hat die Exportkontrollen am 30. Juni aufgehoben, und ein verbesserter Sicherheitsklassifikator blockiert die entdeckte Bypass-Technik in mehr als 99 Prozent der Fälle.

🟡 🤖 Modelle 30. Juni 2026 · 4 Min. Lesezeit

Google startet zwei Modelle am selben Tag: Gemini Omni Flash und Nano Banana 2 Lite

Redaktionelle Illustration: Google startet Gemini Omni Flash für Video und Nano Banana 2 für Bildgenerierung

Google hat am 30. Juni 2026 gleichzeitig Gemini Omni Flash für konversationelles Video-Editing und Nano Banana 2 Lite für schnelle Bildsynthese angekündigt. Das Videomodell kostet 0,10 Dollar pro Sekunde Output, das Bildmodell nur 0,034 Dollar pro tausend Bilder.

🟡 🤖 Modelle 30. Juni 2026 · 3 Min. Lesezeit

Google Research stellt TabFM vor: Zero-Shot-Foundation-Modell für tabellarische Daten

Redaktionelle Illustration: Google TabFM Foundation-Modell für Zero-Shot-Analyse tabellarischer Daten

Google Research hat TabFM veröffentlicht, ein Foundation-Modell für tabellarische Daten, das Zero-Shot-Vorhersagen in einem einzigen Forward-Pass liefert, ohne Hyperparameter-Tuning und Feature-Engineering. Das Modell erzielte Spitzen-Elo-Wertungen auf dem TabArena-Benchmark und ist auf Hugging Face und GitHub verfügbar, mit angekündigter Integration in Google BigQuery.

🔴 🤖 Modelle 29. Juni 2026 · 3 Min. Lesezeit

Meta: Brain2Qwerty v2 — nichtinvasive Dekodierung von Gedanken in Text mit 61% Genauigkeit, ohne chirurgisches Implantat

Redaktionelle Illustration: Brain2Qwerty v2 — nichtinvasive Dekodierung von Gedanken in Text mit 61% Genauigkeit, ohne chirurgisches Implantat, ohne Text und Gesichter

Brain2Qwerty v2 ist ein KI-System von Meta Research, das Gehirnsignale ohne chirurgischen Eingriff mithilfe von MEG-Scanning in getippten Text umwandelt. Die durchschnittliche Genauigkeit der Worterkennung beträgt 61% — siebenmal mehr als bei anderen nichtinvasiven Methoden (8%). Trainingscode und Datensätze wurden als Open Source veröffentlicht.

🟡 🤖 Modelle 29. Juni 2026 · 2 Min. Lesezeit

GitHub: Claude Opus 4.8 Fast Mode kommt in Copilot-Preview; Anthropic stellt Fast für Opus 4.6 ein

Redaktionelle Illustration: Claude Opus 4.8 Fast Mode kommt in Copilot-Preview; Anthropic stellt Fast für Opus 4.6 ein, ohne Text und Gesichter

Claude Opus 4.8 Fast Mode befindet sich jetzt in der Preview-Phase für GitHub-Copilot-Nutzer und bringt deutlich schnellere Ausgabe-Token-Generierung bei gleichbleibendem Intelligenzniveau des Modells. Gleichzeitig stellt Anthropic den Fast Mode für Opus 4.6 ein — Konsolidierung der Fast-Mode-Fähigkeiten auf das einzig verbleibende Modell.

🟢 🤖 Modelle 29. Juni 2026 · 2 Min. Lesezeit

Allen Institute: DiScoFormer — ein Transformer für Dichte und Score über verschiedene Verteilungen

Redaktionelle Illustration: DiScoFormer — ein Transformer für Dichte und Score über verschiedene Verteilungen, ohne Text und Gesichter

DiScoFormer ist ein Transformer-Modell des Allen Institute for AI (AI2), das in einem einzigen Forward-Pass die Dichtefunktion (Verteilungsdichte) und die Score-Funktion berechnet — was bisher separate Modelle erforderte. Es verallgemeinert KDE auf hohe Dimensionen und passt sich neuen Verteilungen ohne Retraining an.

🟢 🤖 Modelle 29. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.28166: Tandem RL — verifizierbare Belohnungen mit besser lesbarer Gedankenkette und verbessertem Handoff auf kleinere Modelle

Redaktionelle Illustration: arXiv:2606.28166 — Tandem RL, verifizierbare Belohnungen mit besser lesbarer Gedankenkette und Handoff, ohne Text und Gesichter

Tandem RL ist eine neue Methode zum Training von Sprachmodellen, die RLVR (Reinforcement Learning mit verifizierbaren Belohnungen) mit einem Tandem-Ansatz kombiniert: Ein stärkeres Modell arbeitet mit einem eingefrorenen schwächeren Modell bei der Generierung der Gedankenkette zusammen. Auf Qwen3-4B erzielt es vergleichbare Leistungen bei deutlich besserer Lesbarkeit und Robustheit beim Handoff auf kleinere Modelle.

🟡 🤖 Modelle 28. Juni 2026 · 2 Min. Lesezeit

GitHub: MAI-Code-1-Flash, Microsofts Coding-Modell, jetzt allgemein verfügbar in Copilot Business und Enterprise

Redaktionelle Illustration: beschleunigter Code-Fluss durch eine Entwicklungsumgebung, ohne Text und Gesichter

MAI-Code-1-Flash ist Microsofts proprietäres Coding-Modell, das am 26. Juni 2026 in GitHub Copilot Business und Enterprise allgemein verfügbar wurde. Es ist für niedrige Latenz und hochfrequente agentische Coding-Workflows optimiert, wird verbrauchsbasiert nach Anbieterpreisliste abgerechnet und muss von Administratoren in den Organisationseinstellungen explizit aktiviert werden.

🟢 🤖 Modelle 28. Juni 2026 · 1 Min. Lesezeit

arXiv:2606.26935: CoT-Trainingsgewinne fließen in stärkere Aktionsvorhersage, nicht in tieferes Agenten-Reasoning

Redaktionelle Illustration: verzweigter Entscheidungsfluss, der sich zu einem klaren Pfad verengt, ohne Text und Gesichter

Studie arXiv:2606.26935 von Jingyu Liu et al. zeigt, dass Trainingsgewinne durch Gedankenketten-Training (CoT) bei LLM-Agenten in stärkere direkte Aktionsvorhersage fließen, nicht in einen breiteren Reasoning-Vorteil. Spätere Checkpoints revidieren die Aktion seltener, und Maskierung der Aufsicht über Action-Tokens verbessert die Out-of-Domain-Generalisierung.

🟢 🤖 Modelle 28. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.26502: Reasoning-Modelle verbrauchen mehr Tokens bei Fehlern – im Gegensatz zu Menschen, die aufgeben

Redaktionelle Illustration: zwei Aufwandskurven, die auseinanderdriften, eine steigt und eine fällt, ohne Text und Gesichter

Studie arXiv:2606.26502 von Han-yu Wang zeigt, dass große Reasoning-Modelle (LRM) mehr Tokens für Aufgaben verbrauchen, bei denen sie scheitern, als für jene, die sie lösen – im Gegensatz zu Menschen, die bei schwierigen Aufgaben aufgeben. Der Abstand ist groß (Cohen's d 1,47–3,13 auf dem H-ARC-Benchmark), und alle fünf getesteten Modelle zeigten das inverse Muster gegenüber Menschen.

🔴 🤖 Modelle 27. Juni 2026 · 3 Min. Lesezeit

OpenAI: GPT-5.6 Sol im Preview angekündigt — Kodierung, Wissenschaft und Cybersicherheit

Editorial illustration: abstrakte Darstellung eines neuronalen Netzes mit Code-Bezeichnungen, Molekularstruktur und Cybersicherheitsschild

GPT-5.6 Sol ist OpenAIs angekündigtes Modell der nächsten Generation, das sich derzeit im Preview-Status befindet (nicht allgemein verfügbar), mit verbesserten Fähigkeiten in den Bereichen Kodierung, wissenschaftliches Schlussfolgern und Cybersicherheit sowie dem bisher fortschrittlichsten Safety-Stack.

🟡 🤖 Modelle 27. Juni 2026 · 2 Min. Lesezeit

Anthropic: API-Rate-Limits angehoben — Sonnet und Haiku jetzt auf Opus-Niveau, drei Stufen

Editorial illustration: Diagramm mit drei API-Zugangsstufen und aufwärts zeigenden Pfeilen, abstrakte Wolken und Server-Racks

Anthropic hat die API-Rate-Limits für alle Modelle angeglichen — Sonnet und Haiku teilen nun dieselben Kontingente wie Opus auf allen drei Nutzungsstufen (Start, Build, Scale). Gleichzeitig wird der Fast Mode für Claude Opus 4.7 abgekündigt und am 24. Juli entfernt.

🟡 🤖 Modelle 27. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.26836: Benchmarks übersehen 82% der tatsächlichen KI-Modellfähigkeiten

Editorial illustration: bar chart showing benchmark gap between single-model evaluation and Capability Frontier measurement

Forschende haben gezeigt, dass Standardbenchmarks — die nur ein Modell in einem Versuch messen — die tatsächlichen Fähigkeiten von Sprachmodellen um bis zu 82% unterschätzen. Mit dem Capability-Frontier-Rahmen, der Pareto-Optimalität über 21 Modelle und 16 Benchmarks nutzt, lässt sich dieselbe Genauigkeit bei 85% geringeren Kosten erzielen.

🟡 🤖 Modelle 27. Juni 2026 · 2 Min. Lesezeit

Google: Gemini Nano auf Pixel 50%+ schneller durch eingefrorene Multi-Token-Prediktion

Editorial illustration: smartphone chip diagram showing parallel token prediction paths on Pixel device

Google hat die Gemini Nano-Inferenz auf Pixel 9 und 10 um mehr als 50% beschleunigt, indem es eingefrorene Multi-Token-Prediktion einsetzte — eine Technik, die durchschnittlich ~2 Token pro Modelldurchlauf generiert und dabei 130 MB Speicher pro Instanz einspart, ohne die Ausgabeergebnisse zu verändern.

🟢 🤖 Modelle 27. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.27288: Wann die Kombination von Sprachmodellen wirklich hilft — Co-Failure Ceiling bei 67 Frontier-Modellen

Editorial illustration: Diagramm der Genauigkeits-Obergrenze für eine Gruppe von KI-Modellen, abstrakte Grafiken ohne Gesichter

Eine Studie über 67 Frontier-Modelle von 21 Anbietern führt den Begriff Co-Failure Ceiling ein — die Obergrenze der Genauigkeit eines Sprachmodell-Ensembles, die durch die Rate gemeinsamer Fehler aller Modelle bestimmt wird. Die Ergebnisse zeigen, dass die Kombination von Modellen selten ein einzelnes bestes Modell ohne Query-Level-Routing übertrifft.

🟡 🤖 Modelle 26. Juni 2026 · 2 Min. Lesezeit

Google Research: Wie Denken das parametrische Wissen in LLMs erschließt

Editorial illustration: stylized neural network pathways lighting up in sequence, abstract brain and data nodes, cool blue tones

Google Research enthüllt zwei Mechanismen, durch die Reasoning-Traces den Abruf von in Modellgewichten gespeichertem Faktenwissen verbessern — Computational Buffer und Factual Priming — getestet an Gemini 2.5 und Qwen3-32B.

🟢 🤖 Modelle 26. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.25325: OPPO — RL-Framework, der KI das simultane Lesen von Stimme, Gesicht und Text beibringt

Redaktionelle Illustration: multimodales System mit Schallwellen, Gesichtsrahmen und Textblasen, die sich zu einer Emotionsanalyse vereinen

OPPO ist ein System des verstärkenden Lernens, das omni-modale Sprachmodelle trainiert, visuelle, akustische und textuelle Emotionshinweise gleichzeitig zu verstehen, Cross-Modal-Halluzinationen zu unterdrücken und SOTA-Ergebnisse auf zwei Benchmark-Datensätzen zu erzielen.

🟡 🤖 Modelle 25. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.24510: RaDaR — spezialisiertes 32B Reasoning-LLM beschleunigt Seltene-Krankheiten-Diagnose im RCT

Redaktionelle Illustration: KI-gestützte medizinische Diagnose, Genauigkeitsgraphen, Molekülstruktur und digitale Patientenakten

RaDaR ist ein Open-Source-Reasoning-LLM mit 32 Milliarden Parametern, das für die Diagnose seltener Krankheiten trainiert wurde. In einer randomisierten klinischen Studie verbesserte es die diagnostische Genauigkeit von Ärzten um 21,44 Prozentpunkte gegenüber Internetsuche und identifizierte in 61 % der Fälle die richtige Diagnose vor der klinischen Dokumentation.

🟡 🤖 Modelle 25. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.24014: RL-Training im Gesundheitsbereich überträgt Alignment auf 80 %+ OOD-Benchmarks

Redaktionelle Illustration: neuronale Netzwerkverbindungen, die sich über mehrere Domänen verzweigen, mit Alignment-Transfer-Pfeilen

Forscher von Google Research haben gezeigt, dass RL-Training auf nützlichen Eigenschaften wie Wahrhaftigkeit, Fairness und Korrigierbarkeit die Leistung auf mehr als 80 % von 50+ unabhängigen OOD-Benchmarks verbessert — einschließlich Domänen außerhalb des Gesundheitsbereichs, auf dem das Modell trainiert wurde.

🟡 🤖 Modelle 25. Juni 2026 · 2 Min. Lesezeit

Google: DiffusionGemma 26B — 4× schnellere Textgenerierung durch Diffusionsansatz

Redaktionelle Illustration: abstrakte parallele Textströme, die sich aus einer Diffusionswolke formen, digitaler Stil

DiffusionGemma ist Googles 26B-MoE-Modell, das Text durch einen Diffusionsansatz generiert — parallel statt sequenziell. Es erreicht mehr als 1.000 Tokens pro Sekunde auf einer einzelnen H100-GPU, bis zu 4× schneller als autoregressive Standardmodelle, mit einem Qualitätskompromiss gegenüber Gemma 4.

🟡 🤖 Modelle 25. Juni 2026 · 2 Min. Lesezeit

Google: Gemini 3.5 Live Translate — Sprach-zu-Sprach-Übersetzung in 70+ Sprachen in Echtzeit

Redaktionelle Illustration: Audiowellen, die Sprechblasen in verschiedenen Schriften über einen Globus verbinden, Echtzeit-Übersetzungskonzept

Google hat Gemini 3.5 Live Translate vorgestellt — ein Sprach-zu-Sprach-Übersetzungssystem, das 70+ Sprachen und mehr als 2.000 Sprachkombinationen in Echtzeit unterstützt, die Intonation des Sprechers bewahrt und Audio mit dem SynthID-Wasserzeichen schützt.

🟡 🤖 Modelle 24. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.23181: DART — adaptives Denken in hybriden Reasoning-Modellen ohne Training

Redaktionelle Illustration: abstraktes Verzweigungsdiagramm mit zwei getrennten Entscheidungspfaden in einem Token-Netz

DART ist eine trainingsfreie Routing-Methode, die entscheidet, ob ein KI-Modell lange nachdenken muss oder sofort antworten kann — sie reduziert den Thinking-Token-Verbrauch um 15–69 % bei gleichzeitig höherer Genauigkeit von bis zu +22,5 Punkten auf Code-Benchmarks.

🟡 🤖 Modelle 24. Juni 2026 · 2 Min. Lesezeit

Mistral: OCR 4 — strukturierte Dokumentenextraktion mit Bounding Boxes in 170 Sprachen

Redaktionelle Illustration: gescanntes Papierdokument mit markierten Absätzen und Bounding Boxes in verschiedenen Sprachen

Mistral OCR 4 ist ein neues Modell zur optischen Zeichenerkennung, das mit 85,20 Punkten die Spitze des OlmOCRBench erreicht, 170 Sprachen unterstützt und Bounding Boxes auf Absatzebene liefert — alles zu einem Preis von 4 USD pro 1.000 Seiten.

🟡 🤖 Modelle 24. Juni 2026 · 2 Min. Lesezeit

PyTorch/SGLang: DeepSeek-V4 Pro auf NVIDIA GB300 — 5× höherer Durchsatz bei gleichem Interaktivitätsniveau

Redaktionelle Illustration: Server-Rack mit NVIDIA Blackwell GPU-Karten und einem Diagramm, das das fünffache Durchsatzwachstum zeigt

Das PyTorch-Team und SGLang haben von April bis Juni 2026 den Inferenzdurchsatz des Modells DeepSeek-V4 Pro auf der NVIDIA GB300-Architektur von etwa 2.200 auf über 11.200 Token pro Sekunde pro GPU gesteigert — eine Fünffachverbesserung ohne Verlust an Interaktivität für den Endnutzer.

🟡 🤖 Modelle 21. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.20560: DiffusionGemma ebenso interpretierbar wie Gemma 4 — 28,6×-Lücke auf 1,1× reduziert

Redaktionelle Illustration: DiffusionGemma ebenso interpretierbar wie Gemma 4 — 28,6×-Lücke auf 1,1× reduziert

DiffusionGemma ist Googles Diffusions-Sprachmodell, das im kontinuierlichen latenten Raum operiert. Eine Studie von 13 Autoren unter der Leitung von Neel Nanda zeigt, dass die anfängliche Undurchsichtigkeit 28,6× größer ist als bei Gemma 4, ein interpretierbarer Token-Bottleneck diese Differenz jedoch auf nur 1,1× reduziert.

🟢 🤖 Modelle 21. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.20543: Räumliches spekulatives Dekodieren beschleunigt Bildgenerierung um das 13,3-Fache

Redaktionelle Illustration: Räumliches spekulatives Dekodieren beschleunigt die Bildgenerierung um das 13,3-Fache

SSD (Spatially Speculative Decoding) ist eine neue Methode, die beim autoregressiven Generieren von Bildern gleichzeitig den horizontalen und vertikalen Nachbarpixel vorhersagt und damit eine bis zu 13,3-fache Beschleunigung ohne Qualitätsverlust auf den Benchmarks DPG-Bench und GenEval erzielt.

🟢 🤖 Modelle 21. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.20561: TimeProVe reduziert Inferenzkosten bei langen Videos um 93 %

Redaktionelle Illustration: TimeProVe reduziert die Inferenzkosten bei langem Video-Schlussfolgern um 93 %

TimeProVe ist ein Framework, das die KI-Inferenz über lange Videos beschleunigt, indem es einen zweistufigen „Vorschlagen und Verifizieren”-Ansatz einführt. Es reduziert Aufrufe teurer Modelle um 75 % und die Gesamtkosten der Inferenz um 93 %, während es den stärksten Konkurrenten auf dem neuen OpenTSUBench-Benchmark um 7,3 Prozentpunkte übertrifft.

🟢 🤖 Modelle 21. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.20008: VIMPO — Kritiker-freies Reinforcement Learning übertrifft GRPO bei MATH-500 und AIME

Redaktionelle Illustration: VIMPO — kritiker-freies Reinforcement Learning übertrifft GRPO bei MATH-500 und AIME

VIMPO ist eine neue Reinforcement-Learning-Methode für LLM-Reasoning, die aus KL-regularisiertem RL eine implizite Wertfunktion ableitet — ohne separates Kritiker-Netzwerk. Sie übertrifft GRPO auf vier mathematischen Benchmarks, darunter AIME 2024 und AIME 2025, wobei die Vorteile auch unter verrauschten Belohnungsbedingungen stabil bleiben.

🟡 🤖 Modelle 20. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.20333: SoftSkill komprimiert Skill-Dokumente in 32 latente Tokens und steigert LiveMath um 42,1 Punkte

Redaktionelle Illustration: ein langes Dokument wird in wenige leuchtende latente Tokens komprimiert

SoftSkill ist eine in der Studie arXiv:2606.20333 beschriebene Methode, die Skill-Dokumente wie Markdown-SKILL.md-Dateien in kompakte kontinuierliche latente Objekte umwandelt, die das Modellverhalten steuern, ohne das Basismodell zu ändern. Statt hunderten oder tausenden Anweisungs-Tokens verwendet SoftSkill 32 virtuelle Tokens und erzielt auf der LiveMath-Aufgabe eine Verbesserung von 42,1 Prozentpunkten gegenüber dem Betrieb ohne Skill.

Vollständiges Archiv ansehen →