📦 Open Source

83 Nachrichten

🟢 📦 Open Source 10. Juli 2026 · 2 Min. Lesezeit

PyTorch: „kostenlose Normalisierung” fusioniert Layer Norm in GEMM- und Attention-Kernel — Meta zielt auf niedrigere Trainingskosten großer Modelle

Redaktionelle Illustration: Zwei GPU-Kernel, die ohne Zwischenschritt zu einem einzigen Datenstrom verschmelzen

Das PyTorch-Team von Meta veröffentlichte Techniken zur Fusionierung von Normalisierungsoperationen direkt in GEMM- und Attention-Kernel, mit dem Ziel, deren Rechenkosten zu eliminieren — „kostenlose Normalisierung”. Der Code ist über eine Kernel-Bibliothek auf GitHub verfügbar; das direkte Ergebnis ist schnelleres Training und schnellere Inferenz bei Modellen mit häufigen Layer-Norm- und RMS-Norm-Operationen.

🟡 📦 Open Source 9. Juli 2026 · 2 Min. Lesezeit

Ollama: 88 Millionen Dollar Finanzierung für lokale KI — 8,9 Millionen Entwickler und Docker-Gründer als Investoren

Redaktionelle Illustration: Lama-Silhouette aus Prozessorchips, umgeben von lokalen Computern

Ollama ist eine Plattform zum lokalen Betrieb offener KI-Modelle, die eine Finanzierungsrunde von 88 Millionen Dollar bekanntgab — mit Investoren wie Benchmark, Theory Ventures und Solomon Hykes, dem Gründer von Docker. Die Plattform bedient 8,9 Millionen Entwickler und 85 % der Fortune-500-Unternehmen; der Cloud-Dienst verdoppelt das Token-Volumen monatlich.

🔴 📦 Open Source 8. Juli 2026 · 5 Min. Lesezeit

PyTorch 2.13: bis zu 4× weniger GPU-Speicher beim LLM-Training und 12,3× schnelleres FlexAttention

Redaktionelle Illustration: PyTorch 2.13 neues Release mit wichtigen Verbesserungen für KI-Training und Inferenz

PyTorch 2.13 erscheint mit 3.328 Commits von 526 Mitwirkenden. Wichtigste Neuerungen: nn.LinearCrossEntropyLoss reduziert den GPU-Spitzenspeicherbedarf beim LLM-Training um bis zu 4×, FlexAttention auf Apple Silicon erreicht bis zu 12,3× Beschleunigung, und das neue torchcomms-Backend modernisiert das verteilte Training.

🟡 📦 Open Source 8. Juli 2026 · 4 Min. Lesezeit

CNCF White Paper: Datenspeicherung bleibt größtes Hindernis für Cloud-Native-KI im Maßstab

Redaktionelle Illustration: CNCF White Paper über Datenspeicherung für Cloud-Native-KI und Kubernetes-Infrastruktur

CNCF TAG Infrastructure hat ein White Paper veröffentlicht, das Datenspeicher-Engpässe in Cloud-Native-KI-Umgebungen kartiert, die Anforderungen der Phasen Training, Inferenz und agentische KI unterscheidet und Architekturempfehlungen für Kubernetes-KI/ML-Deployments gibt.

🟢 📦 Open Source 8. Juli 2026 · 3 Min. Lesezeit

IBM und Red Hat erweitern Lightwell – 6.500+ bereinigte Open-Source-Abhängigkeiten und Clearinghouse für Finanzen

Redaktionelle Illustration: IBM und Red Hat Lightwell KI-System zur Behebung von Schwachstellen in Open-Source-Code

IBM und Red Hat haben Lightwell Network in allgemeiner Verfügbarkeit mit einem Katalog von 6.500+ digital signierten bereinigten Abhängigkeiten in Java und Python gestartet, sowie Lightwell Clearinghouse Premier für die Koordination von Patch-Embargos im Finanzdienstleistungssektor, unterstützt von einer 5-Milliarden-Dollar-Verpflichtung für Open-Source-Sicherheit.

🟡 📦 Open Source 6. Juli 2026 · 4 Min. Lesezeit

vLLM und Tencent Hunyuan streamen zwei HPC-Backends für NVIDIA-Hopper-GPUs upstream

Editorial-Illustration: vLLM FP8 und MoE GPU-Kernel für hochleistungsfähiges Serving großer Sprachmodelle

Das Tencent-Hunyuan-AI-Infra-Team und das vLLM-Team haben gemeinsam den HPC_ATTN-Attention-Backend und den hpc-MoE-Backend upstream gestellt, die TTFT um 24% und TPOT um 17% auf einer 8×-NVIDIA-H20-Konfiguration reduzieren – ohne vLLM-Code forken zu müssen.

🟡 📦 Open Source 1. Juli 2026 · 4 Min. Lesezeit

Kimi K2.7 Code ist jetzt in GitHub Copilot — als erstes Open-Weight-Modell

Redaktionelle Illustration: Kimi K2.7 Open-Weight-Modell von Moonshot in GitHub Copilot integriert

Moonshot AIs Kimi K2.7 Code ist in GitHub Copilot als erstes Open-Weight-Modell im Model Picker verfügbar, gehostet auf Microsoft Azure. Verfügbar für Pro-, Pro+- und Max-Pläne mit nutzungsbasierter Abrechnung, mit geplanter Erweiterung auf Business und Enterprise.

🟢 📦 Open Source 1. Juli 2026 · 3 Min. Lesezeit

LangChain veröffentlicht OpenWiki: Open-Source-Tool, das Repositories automatisch für KI-Agenten dokumentiert

Redaktionelle Illustration: LangSmith-Engine für den Open-Source-Dokumentationsagenten OpenWiki für Repositories

LangChain hat OpenWiki veröffentlicht — ein Open-Source-CLI-Tool, das automatisch Dokumentations-Wikis für Code-Repositories generiert und aktualisiert. Ziel ist es, Code-Agenten strukturierten Repository-Kontext zu liefern, ohne Instruktionsdateien wie AGENTS.md oder CLAUDE.md aufzublähen. Das Tool basiert auf dem DeepAgents-Framework und unterstützt mehrere LLM-Provider.

🟡 📦 Open Source 30. Juni 2026 · 3 Min. Lesezeit

Miles: PyTorch-natives Open-Source-Framework für RL-Post-Training von LLMs im Frontier-Maßstab

Redaktionelle Illustration: PyTorch-nativer Miles-Stack für Post-Training mit Reinforcement Learning und Kernel-Fusion

RadixArk veröffentlicht Miles, ein Open-Source-Reinforcement-Learning-Framework, das SGLang, Megatron-LM, Ray und PyTorch in einem einheitlichen, produktionsgetesteten Stack für das Post-Training großer Sprachmodelle auf Hopper- und Blackwell-GPUs vereint.

🟢 📦 Open Source 30. Juni 2026 · 3 Min. Lesezeit

CNCF Kepler von Grund auf neu gebaut: präzise Energiemessung von Kubernetes-Pods ohne Kernel-Privilegien

Redaktionelle Illustration: CNCF Kepler neu gestaltet für präzise Energieverbrauchsmessung der Kubernetes-Infrastruktur

Das CNCF-Sandbox-Projekt Kepler wurde vollständig neu geschrieben: Die neue Architektur ersetzt den eBPF-Ansatz durch das Lesen standardmäßiger /proc- und /sys-Pfade, eliminiert mehrkilowatthohe Messspitzen und reduziert den Leistungsattributionsfehler auf Milliwatt-Ebene.

🟢 📦 Open Source 30. Juni 2026 · 3 Min. Lesezeit

ONNX v1.22.0 bringt native Attention-Operatoren für LLMs und WebAssembly-Unterstützung

Redaktionelle Illustration: ONNX Version 1.22 bringt neue Attention-Operatoren und WebAssembly-Interoperabilität

Die LF AI & Data Foundation hat ONNX v1.22.0 mit nativen Attention-Operatoren für Transformer-Architekturen und LLMs, WebAssembly-Unterstützung zur Modellvorschau im Browser sowie SLSA-Level-2-kryptografischen Attestierungen veröffentlicht. 27 Mitwirkende haben beigetragen, davon 16 zum ersten Mal.

🟡 📦 Open Source 29. Juni 2026 · 2 Min. Lesezeit

NVIDIA: Palantir und NVIDIA Nemotron bringen souveräne KI für US-Behörden in Air-Gapped-Systemen

Redaktionelle Illustration: Palantir und NVIDIA Nemotron bringen souveräne KI für US-Behörden in Air-Gapped-Systemen, ohne Text und Gesichter

Palantir integrierte NVIDIA-Nemotron-Open-Modelle in seinen Sovereign AI Operating System für US-amerikanische Regierungsbehörden und kritische Infrastruktur. Das System funktioniert in Air-Gapped-Umgebungen — vollständig isolierten Netzwerken ohne Internetverbindung — und deckt die Sektoren Verteidigung, Energie, Gesundheit, Bildung und Transport ab.

🟡 📦 Open Source 27. Juni 2026 · 2 Min. Lesezeit

GitHub: Desktop 3.6 bringt Git Worktrees und KI-gestützte Merge-Konfliktlösung

Editorial illustration: laptop screen showing branching git tree diagram with multiple parallel workflow lanes, dark background

GitHub Desktop 3.6 ist für macOS und Windows verfügbar und bringt Unterstützung für Git Worktrees — ein Mechanismus, der paralleles Arbeiten an mehreren Branches ohne Stashing ermöglicht — sowie tiefere Copilot-Integrationen für Commit-Nachrichten und Merge-Konflikte.

🔴 📦 Open Source 26. Juni 2026 · 2 Min. Lesezeit

PyTorch: TokenSpeed-Kernel — portable Hochleistungs-Kernel für Multi-Silicon-LLM-Inferenz

Redaktionelle Illustration: PyTorch-Logo mit abstrakten GPU-Siliziumschichten und Inferenzbeschleunigungsgraph auf blauem Hintergrund

TokenSpeed-Kernel ist ein quelloffenes dreischichtiges Kernel-Subsystem, das LLM-Inferenz auf NVIDIA- und AMD-GPUs ohne Code-Umschreiben um bis zu 3,6-fach beschleunigt und bereits in das vLLM-Inferencing-Framework integriert ist.

🟢 📦 Open Source 26. Juni 2026 · 1 Min. Lesezeit

Allen Institute: Welche Token sagt ein Hybridmodell (OLMo 3) besser voraus?

Redaktionelle Illustration: Vergleichsdiagramm der hybriden SSM-Transformer-Architektur und des reinen Transformer-Modells mit Token-Darstellung

Das Allen Institute (AI2) analysiert OLMo 3 und OLMo Hybrid und zeigt: Hybridmodelle sagen bedeutungstragende, kontextabhängige Token besser voraus, während reine Transformer beim wörtlichen Textkopieren überlegen bleiben.

🟢 📦 Open Source 25. Juni 2026 · 1 Min. Lesezeit

arXiv:2606.24855: OpenThoughts-Agent — offene Rezepte für das Training agentischer Modelle

Redaktionelle Illustration: offenes Labor mit Roboter-Agenten, die Datenkarten in einer Pipeline sortieren

OpenThoughts-Agent ist eine offene Pipeline zur Datenkuration für agentische Sprachmodelle. Nach über 100 Ablationsexperimenten erstellte das Team 100.000 Beispiele und feinabstimmte Qwen3-32B, das auf sieben agentischen Benchmarks 44,8 % erreicht — besser als alle bisherigen Open-Source-Modelle.

🟢 📦 Open Source 21. Juni 2026 · 2 Min. Lesezeit

Anthropic (Claude Code GitHub): Claude Code v2.1.185 verbessert die Stream-Stall-Meldung

Redaktionelle Illustration: Claude Code v2.1.185 verbessert die Stream-Stall-Meldung

Claude Code v2.1.185 ist ein UX-Patch vom 20. Juni 2026, der die API-Stream-Stall-Meldung ändert und den Aktivierungsschwellenwert von 10 auf 20 Sekunden Stille verlängert — ohne Änderungen am Modell oder API.

🟡 📦 Open Source 20. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.20517: Multi-LCB erweitert LiveCodeBench auf 12 Programmiersprachen und deckt Python-Overfitting bei 24 Modellen auf

Redaktionelle Illustration: zwölf Programmiersprachensymbole um ein zentrales Leistungsmessgerät

Multi-LCB ist eine Erweiterung des LiveCodeBench-Benchmarks von Python auf 12 Programmiersprachen, beschrieben in der Studie arXiv:2606.20517 und akzeptiert auf der ICLR 2026. Durch Tests an 24 großen Sprachmodellen decken die Autoren signifikantes Python-Overfitting und sprachspezifische Datenkontamination auf und legen die Grenzen mehrsprachiger Codegenerierung in heutigen Modellen offen.

🟡 📦 Open Source 20. Juni 2026 · 2 Min. Lesezeit

UK AISI: Engineering Playbook öffnet Frontier-Modell-Evaluierungsinfrastruktur in fünf Schichten

Redaktionelle Illustration: fünf gestapelte Infrastrukturschichten mit Sicherheitsschild-Symbol

Der Engineering Playbook ist eine Open-Source-Dokumentation, die das UK AI Safety Institute am 18. Juni 2026 veröffentlichte und die interne Infrastruktur zur Evaluierung von Frontier-KI-Modellen öffnet. Der Playbook ist in fünf Schichten strukturiert (Evaluate, Isolate, Connect, Run, Scale) und baut auf dem früher veröffentlichten Tool Inspect AI auf, das über 200 fertige Evaluierungen und 240 Mitwirkende hat.

🟡 📦 Open Source 19. Juni 2026 · 2 Min. Lesezeit

Black Forest Labs: Robin Rombach fordert G7-Führer auf, offene KI-Entwicklung zu unterstützen

Redaktionelle Illustration: Robin Rombach fordert G7-Führer auf, offene KI-Entwicklung zu unterstützen

Robin Rombach, Mitgründer und CEO von Black Forest Labs (Schöpfer der FLUX-Modelle), wandte sich an G7-Staats- und Regierungschefs mit dem Aufruf, offene und verantwortungsvolle KI-Entwicklung zur globalen Norm zu machen. Rombach argumentiert, dass die öffentliche Verfügbarkeit von KI-Parametern Innovationen fördert und die Technologie demokratisiert.

🟡 📦 Open Source 18. Juni 2026 · 2 Min. Lesezeit

Allen Institute: Open-Source MolmoMotion sagt 3D-Bewegung aus Videos vorher und setzt SOTA in der Robotik

Redaktionelle Illustration: Vorhersage von 3D-Objekttrajektorien für robotische Manipulation

Das Allen Institute veröffentlichte MolmoMotion, ein vollständig quelloffenes Modell, das 3D-Trajektorien von Objekten aus Videos und natürlichsprachlichen Anweisungen wie „drehe die Schüssel” vorhersagt. Das Modell erreicht den State-of-the-Art auf PointMotionBench mit 0,109 m mittlerer Abweichung gegenüber 0,134 m des vorherigen Rekords und steigert den Erfolg von Pick-and-Place-Aufgaben in der Robotik von 56 % auf 76,3 % — ein Plus von 20,3 Prozentpunkten. Es wurde auf dem MolmoMotion-1M-Datensatz mit 1,16 Millionen Videos mit 3D-Trajektorien und Aktionsbeschreibungen trainiert.

🟡 📦 Open Source 17. Juni 2026 · 1 Min. Lesezeit

vLLM: Semantic Router Fusion kombiniert ein Modell-Panel mit einem Richter, der eine einzige Antwort synthetisiert

Redaktionelle Illustration: KI-Modell-Panel und Richtermodell synthetisieren eine einzige Antwort

vLLM stellte Semantic Router Fusion vor, ein Primitiv, bei dem mehrere Modelle parallel als Panel arbeiten und ein Richtermodell Konsens und Unterschiede analysiert sowie eine einzige Antwort synthetisiert. Es unterstützt lokale vLLM- und private Endpunkte sowie öffentliche Anbieter wie Gemini, Kimi, DeepSeek und Claude. Externe Validierung auf OpenRouter DRACO ergab 69% für das kombinierte Panel gegenüber 65,3% für das beste Einzelmodell, mit voller OpenAI-API-Kompatibilität.

🟡 📦 Open Source 16. Juni 2026 · 2 Min. Lesezeit

GitHub: Offener Multilingual Repositories Dataset mit 80 Millionen Zeilen und 40 Millionen Repositories

Redaktionelle Illustration: mehrsprachiger Datensatz aus offenen Code-Repositories

GitHub hat den Multilingual Repositories Dataset mit mehr als 80 Millionen Klassifikationszeilen aus 40 Millionen Repositories unter der vollständig offenen CC0-1.0-Lizenz veröffentlicht. Für jedes Repository erfasst der Datensatz drei Textquellen — README, meistkommentiertes Issue und meistkommentierter Pull Request — mit Spracherkennung durch drei Tools: fastText, gcld3 und lingua-py. Portugiesisch führt bei nicht-englischen README-Dateien, Koreanisch ist in Issue-Diskussionen am häufigsten vertreten.

🟢 📦 Open Source 16. Juni 2026 · 2 Min. Lesezeit

CNCF: Oracles Spende von 3 Millionen Dollar in OCI-Credits beschleunigt Arm64-Unterstützung in 12+ Projekten

Redaktionelle Illustration: Arm64-Cloud-Infrastruktur für Open-Source-Projekte

CNCF berichtet, dass Oracles Spende von 3 Millionen Dollar in OCI-Compute-Credits Arm64-CI/CD-Unterstützung in mehr als 12 Projekten ermöglicht, darunter OpenTelemetry, containerd, Falco, Longhorn, Crossplane und Jaeger. Die Nachfrage überstieg schnell die anfängliche Richtlinie von 5.000 Dollar pro Monat. Der Wandel wird von Daten begleitet, dass mehr als 50 Prozent neuer AWS-Instanzen und 33 Prozent der Azure-Instanzen nun auf Arm64-Architektur laufen.

🟡 📦 Open Source 12. Juni 2026 · 4 Min. Lesezeit

Allen Institute for AI veröffentlicht olmo-eval: Evaluierungsplattform für den aktiven LLM-Entwicklungszyklus

Redaktionelle Illustration: AllenAI OLMo Evaluierungsplattform für Entwicklung und Vergleich von Open-Source-Sprachmodellen

AI2 veröffentlichte olmo-eval, eine offene Evaluierungsplattform, die den OLMES-Standard vom einmaligen Benchmarking hin zu einer vollständigen Entwicklungsschleife erweitert. Die Kerninnovation ist der paarweise Checkpoint-Vergleich auf Einzelfrageebene sowie integrierte statistische Maße zur Unterscheidung echter Verbesserungen von Messrauschen.

🟡 📦 Open Source 12. Juni 2026 · 3 Min. Lesezeit

MiniMax M3 in vLLM: Day-0-Unterstützung für ein Modell mit einer Million Token Kontext

Redaktionelle Illustration: vLLM-Serving für MiniMax M3 multimodales MoE-Modell mit einer Million Token Kontext

Das vLLM-Team veröffentlichte vollständige Day-0-Unterstützung für MiniMax M3 — ein Modell mit einer Million Token Kontext, nativer Multimodalität und Mixture-of-Experts-Architektur. Die Kerninnovation ist MiniMax Sparse Attention, die das praktische Serving langer Kontexte ohne vollständige Materialisierung des KV-Cache ermöglicht.

🟡 📦 Open Source 11. Juni 2026 · 3 Min. Lesezeit

Ollama bringt bis zu 20 % schnellere Apple Silicon Inferenz: MLX-Engine, NVFP4-Quantisierung und Snapshots für agentische Workflows

Redaktionelle Illustration: Ollama MLX NVFP4-Quantisierung für beschleunigtes lokales Schlussfolgern auf Apple Silicon-Chip

Ollama hat die MLX-Engine für Apple Silicon aktualisiert und bringt damit bis zu 20 Prozent schnellere Token-Generierung durch Metal-Kernel-Fusionen und GPU-Sampling. Das neue NVFP4-Quantisierungsformat halbiert den Qualitätsverlust gegenüber nicht quantisiertem BF16, und das Snapshot-System erleichtert agentische Workflows mit Verzweigungs- und Wiederholungsmöglichkeiten.

🟢 📦 Open Source 10. Juni 2026 · 3 Min. Lesezeit

Helion in vLLM: PyTorch-natives DSL ersetzt CUDA-Kernel und beschleunigt FP8-Inferenz von Qwen3-Modellen

Redaktionelle Illustration: PyTorch Helion DSL portable GPU-Kernel für Inferenz und automatisches Tuning von LLMs

Helion ist eine PyTorch-native DSL zur Entwicklung von GPU-Kerneln ohne direkten CUDA-Code. Neun Helion-Kernel wurden in vLLM für die FP8-Inferenz von Qwen3-Modellen integriert: Nicht-GEMM-Kernel verzeichnen Beschleunigungen von bis zu 73 % auf H100, und der Gesamtdurchsatz steigt um rund 5–9 % im Vergleich zu bisherigen Lösungen.

🟢 📦 Open Source 9. Juni 2026 · 4 Min. Lesezeit

LF AI & Data: DocLang-Arbeitsgruppe entwickelt offenen Standard für KI-native Dokumente

Redaktionelle Illustration: LF AI und Data führt offenen Standard für KI-native Dokumente ein

Die LF AI & Data Foundation hat die DocLang Specification Working Group mit den Gründungsmitgliedern IBM, Red Hat und NVIDIA ins Leben gerufen, um einen offenen Standard für KI-native Dokumente zu entwickeln. Das Format bewahrt semantische Bedeutung und geometrisches Layout, beinhaltet eingebettete Governance-Kontrollen und ist für moderne KI-Tokenizer und agentische Workflows optimiert.

🟢 📦 Open Source 9. Juni 2026 · 4 Min. Lesezeit

vLLM: vime — neues RL-Framework, das Megatron-Training und vLLM-Inferenz in einer Pipeline vereint

Redaktionelle Illustration: vLLM neues Framework für Reinforcement Learning mit GB200-GPU-Infrastruktur

vime ist ein neues RL-Framework für das Post-Training von Sprachmodellen, das Megatron Distributed Training und vLLM-Inferenz in einer einheitlichen Pipeline verbindet. Auf GB200-Hardware erreicht das Qwen3-30B-A3B-MoE-Modell etwa 147 Sekunden pro Schritt — 1,72× schneller als auf H200. R3-Routing-Replay reduziert die Log-Wahrscheinlichkeits-Diskrepanz von 0,019 auf 0,013.

🟡 📦 Open Source 6. Juni 2026 · 3 Min. Lesezeit

arXiv:2606.08094: vla.cpp betreibt Vision-Language-Action-Modelle mit 1,3 GiB Speicher

Redaktionelle Illustration: vla.cpp betreibt Vision-Language-Action-Modelle mit 1,3 GiB Speicher

Eine neue Arbeit praesentiert vla.cpp, eine C++-Inference-Engine zum Betrieb von Vision-Language-Action-Policies auf ressourcenbeschraenkter Roboter-Hardware. Die Engine erreicht SOTA-Niveau im LIBERO-Object-Benchmark und fuehrt BitVLA mit nur 1,3 GiB Speicher aus.

🟡 📦 Open Source 5. Juni 2026 · 3 Min. Lesezeit

Ollama 0.30: Integration mit llama.cpp, GGUF-Unterstützung und bis zu 20 % schnellere Inferenz

Redaktionelle Illustration: Integration mit llama.cpp, GGUF-Unterstützung und bis zu 20 % schnellere Inferenz

Ollama 0.30 bringt die Integration mit llama.cpp für bessere Leistung und GGUF-Modellkompatibilität, mit einem bis zu 20 % höheren Durchsatz auf NVIDIA-GPUs. Es erweitert die Hardware-Unterstützung mit Vulkan auf AMD- und Intel-Geräten und fügt Unterstützung für Tool-Calling hinzu. Es ergänzt die bestehende MLX-Engine für Apple Silicon.

🟡 📦 Open Source 5. Juni 2026 · 3 Min. Lesezeit

vLLM Semantic Router v0.3 'Themis': produktionsreifes statefuls Routing von Anfragen

Redaktionelle Illustration: produktionsreifes statefuls Routing von Anfragen

Das vLLM-Team hat v0.3 'Themis' seines Semantic Routers veröffentlicht, die erste produktionsreife Version zum Routing von Anfragen zwischen Modellen. Sie bringt eine kanonische Konfiguration, einen inspizierbaren Entscheidungsfluss und reproduzierbares Routing-Verhalten für Kubernetes-Deployments.

🟢 📦 Open Source 3. Juni 2026 · 3 Min. Lesezeit

Google macht das Hydrologie-Framework hinter dem Hochwasservorhersagedienst Flood Hub quelloffen

Redaktionelle Illustration: Google macht das Hydrologie-Framework hinter dem Hochwasservorhersagedienst Flood Hub quelloffen

Google Research hat am 3. Juni 2026 auf GitHub unter der Apache-2.0-Lizenz das Python/PyTorch-Framework veröffentlicht, das den globalen Hochwasservorhersagedienst Flood Hub antreibt. Das Framework nutzt LSTM und die neuere ME-LSTM-Architektur über dem Open-Source-Datensatz Caravan, und das aktualisierte v2-Modell verlängert den zuverlässigen Vorhersagehorizont in gepegelten Einzugsgebieten um 6 Tage.

🟡 📦 Open Source 2. Juni 2026 · 2 Min. Lesezeit

vLLM: Session-Aware Agentic Routing senkt Modellwechsel um 79 Prozent

Redaktionelle Illustration: Session-Aware Agentic Routing senkt Modellwechsel um 79 Prozent

Der vLLM Semantic Router hat Session-Aware Agentic Routing (SAAR) erhalten, einen Mechanismus, der langlaufende agentische Gespräche versteht, statt jede Nachricht einzeln zu behandeln. Über 21.600 Testrunden senkt SAAR die Modellwechsel um 79,29 Prozent, eliminiert unsichere Wechsel vollständig und senkt die geschätzten Kosten um 78,71 Prozent.

🟢 📦 Open Source 2. Juni 2026 · 2 Min. Lesezeit

vLLM: AutoRound-Quantisierung kommt in vLLM-Omni für kleinere multimodale Modelle

Redaktionelle Illustration: AutoRound-Quantisierung kommt in vLLM-Omni für kleinere multimodale Modelle

vLLM hat Intels AutoRound-Quantisierung in vLLM-Omni integriert und ermöglicht damit die W4A16-Kompression multimodaler und Diffusionsmodelle. Das Ergebnis ist ein bis zu 62 Prozent kleinerer Checkpoint, bei minimalem Qualitätsverlust und schnellerer Generierung auf Intel-XPU- und NVIDIA-Grafikkarten.

🟡 📦 Open Source 1. Juni 2026 · 2 Min. Lesezeit

vLLM: Betrieb auf NVIDIA DGX Spark / GB10 Systemen

Redaktionelle Illustration: Betrieb auf NVIDIA DGX Spark / GB10 Systemen

Das vLLM-Team veröffentlichte einen praktischen Leitfaden zum Betrieb von vLLM auf dem NVIDIA DGX Spark System auf Basis des GB10-Chips. Der Leitfaden behandelt das Verhalten des Unified Memory, das Serving des NVFP4-Modells Nemotron-3-Super, Docker-Deployment, Prometheus-Metriken und Ergebnisse der lokalen Evaluierung auf der neuen Edge-Hardware.

🟢 📦 Open Source 30. Mai 2026 · 2 Min. Lesezeit

xAI: xai-sdk-python v1.15.0 ergänzt das Modell grok-build-0.1 und Kontext-Kompaktierung

Redaktionelle Illustration: xai-sdk-python v1.15.0 ergänzt das Modell grok-build-0.1 und Kontext-Kompaktierung

xAI hat xai-sdk-python v1.15.0 veröffentlicht, eine Version mit drei Änderungen: Hinzufügen des Modells grok-build-0.1 zur Klasse ChatModel, Unterstützung für Kontext-Kompaktierung sowie die Anhebung der Version von 1.14.0 auf 1.15.0. Alle Änderungen kamen über drei separate Pull Requests.

🟡 📦 Open Source 29. Mai 2026 · 2 Min. Lesezeit

arXiv:2605.31463: PithTrain, ein kompaktes, auf Agenten zugeschnittenes MoE-Trainingssystem

Redaktionelle Illustration: PithTrain, ein kompaktes, auf Agenten zugeschnittenes MoE-Trainingssystem

PithTrain ist ein neues Trainingssystem für Mixture-of-Experts-Modelle, optimiert für KI-Coding-Agenten. Die Arbeit führt die Metrik Agent-Task-Efficiency und den zugehörigen ATE-Bench ein, auf dem PithTrain bis zu 62 Prozent weniger Agentenschritte und 64 Prozent weniger aktive GPU-Zeit bei vergleichbarem Durchsatz erreicht.

🟡 📦 Open Source 28. Mai 2026 · 2 Min. Lesezeit

vLLM: Standardisierte APIs zur Gewichtssynchronisation beschleunigen asynchrones RL

Redaktionelle Illustration: Standardisierte APIs zur Gewichtssynchronisation beschleunigen asynchrones RL

Am 28. Mai 2026 hat vLLM standardisierte APIs zur Gewichtssynchronisation (weight synchronization) und verbesserte Unterstützung für asynchrones Reinforcement Learning eingeführt. Es löst die Fragmentierung, bei der jedes RL-Framework den Gewichtstransfer zwischen Training und Inferenz ad-hoc implementiert, und behebt Stabilitätsprobleme in großen verteilten Deployments.

🟢 📦 Open Source 28. Mai 2026 · 2 Min. Lesezeit

Microsoft: Data Formulator 0.7 verbindet fragmentierte Unternehmensdaten

Redaktionelle Illustration: Data Formulator 0.7 verbindet fragmentierte Unternehmensdaten

Data Formulator 0.7 ist ein Open-Source-System von Microsoft Research, das fragmentierte Datenquellen in Unternehmen verbindet und iterative analytische Arbeitsabläufe unterstützt. Es bringt persistente Datenkonnektoren und kontextbewusste KI-Agenten und ermöglicht Analytik ohne Kenntnis von SQL oder Programmierung.

🟢 📦 Open Source 28. Mai 2026 · 1 Min. Lesezeit

Mistral: Search Toolkit für produktive Such-Pipelines

Redaktionelle Illustration: Search Toolkit für produktive Such-Pipelines

Mistral Search Toolkit ist ein Open-Source-Framework zum Bauen produktiver Such-Pipelines für KI-Anwendungen. Es vereint Ingestion, Retrieval und Evaluation unter einer einzigen Schnittstelle und lässt sich in der Cloud, on-premises oder am Netzwerkrand betreiben.

🟢 📦 Open Source 28. Mai 2026 · 2 Min. Lesezeit

Ollama: OpenJarvis v1.0 für persönliche KI-Agenten, die lokal laufen

Redaktionelle Illustration: OpenJarvis v1.0 für persönliche KI-Agenten, die lokal laufen

OpenJarvis v1.0 ist ein Open-Source-Framework zum Bauen persönlicher KI-Agenten, die lokal auf eigener Hardware laufen, mit integrierter Ollama-Anbindung. Es ist ein Local-First-Ansatz, bei dem Modelle lokal bleiben und die Cloud optional ist, mit Erfassung von Energieverbrauch, Kosten und Latenz.

🟡 📦 Open Source 27. Mai 2026 · 3 Min. Lesezeit

PyTorch: Wie torch.compile bis zu 10× Beschleunigung durch Kernel Fusion erreicht

Urednička ilustracija: Kako torch.compile postiže ubrzanje do 10× kroz kernel fusion

Der PyTorch-Compiler torch.compile erzielt auf GPUs bis zu 10× Beschleunigung, indem redundante Schreibvorgänge in den globalen Speicher durch Kernel Fusion eliminiert werden. Statt separater GPU-Kernel für jede Operation fügt der Inductor-Compiler abhängige Operationen automatisch zu einem einzigen Kernel zusammen, der Zwischenwerte in den schnellen Prozessor-Registern hält.

🟢 📦 Open Source 27. Mai 2026 · 2 Min. Lesezeit

xAI: SDK Python v1.14.0 fügt enable_image_search zu web_search und SERVER_SIDE_TOOL_IMAGE_SEARCH-Enum hinzu

Urednička ilustracija: SDK Python v1.14.0 dodaje enable_image_search u web_search i SERVER_SIDE_TOOL_IMAGE_SEARCH enum

xAI veröffentlichte Python SDK v1.14.0 mit Unterstützung für die Bildsuche innerhalb der web_search-Funktionalität. Das neue Feld enable_image_search und die Enum-Konstante SERVER_SIDE_TOOL_IMAGE_SEARCH ermöglichen Entwicklungsteams, die Grok-basierte Anwendungen erstellen, die serverseitige visuelle Inhaltssuche neben der Standard-Web-Textsuche zu aktivieren.

🟢 📦 Open Source 23. Mai 2026 · 3 Min. Lesezeit

Kedro: Version 1.2.0 bringt @experimental-Dekorator und LangGraph Agentic Starter für GenAI-Pipelines

Editorial-Illustration: Pipeline-Knoten mit LangGraph-Orchestrierungsbrücke und Mermaid-Diagramm

Das Linux-Foundation-KI-Projekt Kedro veröffentlichte Version 1.2.0 zusammen mit Kedro-Viz 12.3.0. Der neue @experimental-Dekorator ermöglicht das Markieren von APIs in der Entwicklung; das Starter-Projekt support-agent-langgraph zeigt die Integration mit LangGraph-Orchestrierung und Langfuse/Opik-Prompt-Management. Kedro-Viz erhält Mermaid-Diagramme und Node-Preview-Erweiterbarkeit für besseres Pipeline-Debugging.

🟡 📦 Open Source 21. Mai 2026 · 2 Min. Lesezeit

Stability AI: Stable Audio 3.0 mit Open-Weight-Modellen und 6-Minuten-Generierung

Redaktionelle Illustration: Stability AI Stable Audio 3 Open-Weight-Modellfamilie mit 6-Minuten-Generierung und Inpainting-Unterstützung

Stability AI veröffentlichte am 20. Mai 2026 Stable Audio 3.0 — eine Familie aus 4 Audiomodellen (Small SFX, Small, Medium, Large), von denen drei Open-Weight sind und auf Hugging Face verfügbar sind. Die wichtigste Neuerung ist die Audiogenerierung bis zu 6 Minuten (Vorgänger — 47 Sekunden), dazu Audio-Inpainting, kausale Fortsetzung und LoRA-Fine-Tuning. Alle Modelle wurden ausschließlich mit lizenzierten Daten trainiert.

🟢 📦 Open Source 20. Mai 2026 · 2 Min. Lesezeit

LangChain: Der Agent, der Agenten repariert — wie LangSmith Engine entwickelt wurde

Editorial illustration:

LangChain hat eine detaillierte technische Übersicht des LangSmith Engine veröffentlicht — eines autonomen Agenten, der Fehler in Produktions-KI-Agenten analysiert und konkrete Korrekturen vorschlägt. Er komprimiert Tausende von Traces, klassifiziert sie mit einem Screener-Sub-Agenten und generiert validierte Evaluatoren für das Issue Board.

🟡 📦 Open Source 19. Mai 2026 · 2 Min. Lesezeit

PyTorch: ExecuTorch MLX Delegate bringt 3–6× schnellere Modellausführung auf Apple-Silicon-GPUs

Editorial illustration: PyTorch veröffentlichte den experimentellen ExecuTorch MLX Delegate — ein Backend für Apple-MLX-Framework und Metal-GPU-Kernel

Das PyTorch-Team veröffentlichte den experimentellen ExecuTorch MLX Delegate — ein Backend, das das Apple-MLX-Framework und Metal-GPU-Kernel für 3- bis 6-fachen Throughput auf Apple-Silicon-Chips nutzt. Unterstützt Llama 3.2, Qwen 3, Phi-4 mini, Whisper und Voxtral-Echtzeit-Streaming-Transkription.

🟢 📦 Open Source 19. Mai 2026 · 2 Min. Lesezeit

GitHub: Copilot Spaces API jetzt allgemein verfügbar

Editorial illustration: GitHub gab die allgemeine Verfügbarkeit der REST-API für Copilot Spaces bekannt

GitHub gab die allgemeine Verfügbarkeit der REST-API für Copilot Spaces bekannt, mit der Teams kontextuelle KI-Arbeitsbereiche programmatisch erstellen, konfigurieren und löschen können. Die neue Schnittstelle ist besonders nützlich für Organisationen, die eine größere Anzahl von Spaces verwalten.

Vollständiges Archiv ansehen →