🤝 Agenten

255 Nachrichten

🟡 🤝 Agenten 10. Juli 2026 · 2 Min. Lesezeit

LangChain: OpenWiki Brains gibt Agenten proaktives Gedächtnis — sammelt automatisch Kontext aus Gmail, Notion und Git in Markdown

Redaktionelle Illustration: Ein Roboter, der aus E-Mails, Notizen und Repositories ein Wiki aus Markdown-Blättern zusammensetzt

OpenWiki Brains ist ein Open-Source-Framework von LangChain, das KI-Agenten proaktives Gedächtnis verleiht: Es sammelt automatisch Kontext aus externen Quellen und speichert ihn als Markdown-Dateien auf der Festplatte. Die erste Version unterstützt 6 Konnektoren — Gmail, Notion, Git, Twitter/X, Hacker News und Websuche — und läuft lokal über geplante Aufgaben, ohne auf die Cloud angewiesen zu sein.

🟢 🤝 Agenten 10. Juli 2026 · 2 Min. Lesezeit

arXiv:2607.08403: Spieltheorie gegen Halluzinationen — Multi-Agenten-Framework modelliert Sprachmodelle als strategische Spieler zur Reduktion von Fehlinformationen

Redaktionelle Illustration: Mehrere KI-Spieler an einem Schachbrett, die ihre Züge auf die Wahrheit abstimmen

Eine neue Arbeit schlägt ein Multi-Agenten-Framework vor, das Spieltheorie einsetzt, um Halluzinationen großer Sprachmodelle zu reduzieren. Die Interaktion der Modelle wird als Spiel strategischer Akteure modelliert, bei dem das Gleichgewicht konsistenten, nicht-halluzinierten Antworten entspricht — ein Ansatz jenseits von RLHF und RAG.

🟡 🤝 Agenten 9. Juli 2026 · 2 Min. Lesezeit

arXiv:2607.06906: 'Harness Effect' — Orchestrierungsdesign senkt KI-Agenten-Kosten um 41 % — mehr als ein Modellwechsel

Redaktionelle Illustration: Dirigentenstab, der Token-Ströme zwischen Modellen und Tools lenkt

Der Harness Effect ist ein Befund aus einer empirischen Studie von 32 Autoren, wonach das Design der Orchestrierungsschicht die Kosten von KI-Agenten stärker beeinflusst als die Wahl des Modells selbst. Über 22 Aufgaben und 6 Modelle senkte optimierte Orchestrierung die Kosten pro Aufgabe um 41 % (von 0,21 auf 0,12 USD), Token um 38 % und Ausführungszeit um 44 % — bei steigender Qualität.

🟡 🤝 Agenten 9. Juli 2026 · 2 Min. Lesezeit

IBM: Bob wird zur Multi-Agent-Plattform — neunmonatiges COBOL-Modernisierungsprojekt in 3 Tagen abgeschlossen

Redaktionelle Illustration: Mainframe-Schrank, aus dem ein Schwarm kleiner Agenten Code auf moderne Server überträgt

IBM Bob ist eine agentische Plattform für die Softwareentwicklung, die in der neuen Version eine Multi-Agent-Architektur für den gesamten Entwicklungslebenszyklus, Bobalytics-Analysen und ein Premium-Paket für die Mainframe-Modernisierung von COBOL und PL/I erhält. IBM berichtet, dass Kunde Blue Pearl ein neunmonatiges Modernisierungsprojekt mit Bob in nur drei Tagen abschloss.

🟡 🤝 Agenten 9. Juli 2026 · 2 Min. Lesezeit

OpenAI: ChatGPT wird zum Agenten für ernsthafte Arbeit — stundenlang durch Apps und Dateien bis zum fertigen Ergebnis

Redaktionelle Illustration: Schreibtisch mit mehreren Bildschirmen, durch die ein automatisierter Aufgabenfluss läuft

ChatGPT Work ist OpenAIs Schritt in die agentische Arbeit: ChatGPT kann nun Aktionen über Apps und Dateien hinweg ausführen und stundenlang selbständig an einem Projekt arbeiten. OpenAI positioniert es als Partner für die anspruchsvollsten Aufgaben und tritt damit in direkten Wettbewerb mit agentischen Produkten von Anthropic und GitHub.

🟡 🤝 Agenten 8. Juli 2026 · 4 Min. Lesezeit

Probe-Kaskade sagt Misserfolg des KI-Agenten aus verborgenen Aktivierungen im ersten Schritt voraus und spart bis zu 47 % der Token

Redaktionelle Illustration: Vorhersage und frühzeitiger Abbruch gescheiterter Agentenepisoden aus verborgenen Zuständen neuronaler Netze

Forscher haben ein System leichter Probes auf verborgenen LLM-Aktivierungen entwickelt, das gescheiterte Episoden bereits im ersten Interaktionsschritt erkennt und den Token-Verbrauch bei Qwen-2.5-7B um 47,1 % und bei Llama-3.2-3B um 37,2 % reduziert – bei garantiertem 90 % Recall.

🟡 🤝 Agenten 8. Juli 2026 · 4 Min. Lesezeit

Formale Theorie definiert präzise, wann iterative LLM-Reflexion exponentielle Verbesserungen bringt

Redaktionelle Illustration: Theorie über wann Selbstanalyse und In-Context-Suche das Schlussfolgern von KI-Systemen verbessern

Forscher Wolf, Wies und Shashua haben einen bayesianischen theoretischen Rahmen entwickelt, der beweist, dass Selbstverbesserung von Sprachmodellen nur dann exponentielle Gewinne bietet, wenn die Reflexion Fehler zuverlässig lokalisiert – andernfalls bieten sequenzielle Versuche keinen asymptotischen Vorteil gegenüber dem parallelen Sampling.

🟡 🤝 Agenten 8. Juli 2026 · 4 Min. Lesezeit

LangChain und NVIDIA launchen NemoClaw: Offener Agenten-Stack erzielt 10× niedrigere Kosten als Konkurrenz

Redaktionelle Illustration: LangChain und NVIDIA NemoClaw offener Agenten-Stack mit Nemotron 3 Ultra Architektur

LangChain und NVIDIA veröffentlichen gemeinsam NemoClaw – einen offenen Blueprint, der das Nemotron 3 Ultra Modell, den LangChain Deep Agents Code Harness und die OpenShell-Runtime kombiniert. Die Kombination erreicht eine Gesamtbewertung von 0,86 bei Kosten von 4,48 $ pro Evaluierung, gegenüber 43,48 $ für den nächstbesten Konkurrenten – bei vollständiger Self-Hosted-Datenkontrolle.

🟡 🤝 Agenten 7. Juli 2026 · 4 Min. Lesezeit

LLM-as-a-Verifier: Verifikation als neue, vierte Skalierungsachse für Sprachmodelle

Redaktionelle Illustration: LLM als Verifikator und Verifikation als neue Skalierungsdimension von KI-Modellen

Forscher von Stanford und UC Berkeley identifizieren Verifikation — die Fähigkeit zur Beurteilung der Korrektheit von Lösungen — als neue Skalierungsachse für LLMs, orthogonal zu bisherigen Paradigmen. Das Framework erzeugt kontinuierliche Verifikations-Scores und erreicht SOTA auf vier Benchmarks: Terminal-Bench V2 (86,5 %), SWE-Bench Verified (78,2 %), RoboRewardBench (87,4 %) und MedAgentBench (73,3 %).

🟡 🤝 Agenten 7. Juli 2026 · 4 Min. Lesezeit

Google erweitert Managed Agents in der Gemini API für Produktionsumgebungen

Redaktionelle Illustration: Google Gemini API erweitert verwaltete Agenten für Entwickler

Google hat der Gemini API Background-Execution, Remote-MCP-Integration, Custom-Function-Calling und Credential-Refresh hinzugefügt — vier Funktionalitäten, die Entwicklern den Einsatz von Agenten außerhalb von Prototypumgebungen ermöglichen.

🟡 🤝 Agenten 7. Juli 2026 · 4 Min. Lesezeit

LangChain: Agenten verbessern ist ein Data-Mining-Problem

Redaktionelle Illustration: LangChain-Agenten und Data-Mining aus Ausführungsspuren für bessere Observierbarkeit

Vivek Trivedy von LangChain argumentiert, dass die systematische Verbesserung von KI-Agenten im Kern ein Problem des Data-Minings von Execution-Traces im großen Maßstab ist. Empfohlene Reihenfolge: Harness-Engineering, dann Fine-Tuning, dann weitere Harness-Optimierung. Zentraler Rat: Agenten früh deployen, um die Datenpipeline zu starten.

🟢 🤝 Agenten 7. Juli 2026 · 3 Min. Lesezeit

Claude Code v2.1.203 — Session-Ablaufwarnung, kleineres Binary, schnellerer Start

Redaktionelle Illustration: Claude Code v2.1.203 mit Behebung des Session-Ablaufs und Session-Wiederherstellung

Anthropic hat am 7. Juli Claude Code v2.1.203 mit Warnung bei ablaufendem Login-Token, automatischer Wiederherstellung eingefrorener Background-Sessions und Reduzierung der Binary-Größe um rund 7 MB veröffentlicht. Mehrere Bugs wurden behoben, die macOS verlangsamt und den Betrieb von Sub-Agenten gestört hatten.

🟢 🤝 Agenten 7. Juli 2026 · 3 Min. Lesezeit

AgentGym2: Neuer Benchmark testet LLM-Agenten unter de-idealisierten Bedingungen

Redaktionelle Illustration: AgentGym2 Benchmark für realistische nicht-idealisierte Aufgaben von KI-Web-Agenten

Forscher haben AgentGym2 veröffentlicht, ein Evaluierungs-Framework, das 15 LLM-Agenten unter realistischen Bedingungen mit unvollständigen Informationen und unbekannten Tools testet. Alle Modelle — einschließlich GPT-5 und Gemini — scheitern deutlich und offenbaren eine große Lücke zwischen dem Stand der Technik und den Anforderungen des Produktionseinsatzes. Das Paper wurde auf ACL 2026 angenommen.

🟡 🤝 Agenten 3. Juli 2026 · 3 Min. Lesezeit

Claude Code v2.1.200: Standard-Permission-Modus auf Manual umgestellt

Redaktionelle Illustration: Claude Code CLI-Agent mit neuen Sicherheitskorrekturen und manuellen Berechtigungen

Anthropic veröffentlichte am 3. Juli 2026 Claude Code v2.1.200. Der Standard-Permission-Modus wurde in allen Oberflächen auf Manual umgestellt; AskUserQuestion-Dialoge werden ohne explizite Konfiguration nicht mehr automatisch fortgesetzt. Eine Sicherheitslücke zur Daemon-Übernahme wurde geschlossen, Hintergrundsitzungen und Rate-Limit-Handling von Unteragenten verbessert sowie Rendering-Flicker unter tmux 3.4+ behoben.

🟡 🤝 Agenten 2. Juli 2026 · 3 Min. Lesezeit

ICML 2026-Studie: SFT- und RL-Agenten verlieren dramatisch an Leistung außerhalb kontrollierter Benchmarks

Redaktionelle Illustration: Fragilität von KI-Agenten bei Verteilungsverschiebungen im Tool-Use und Robustheit der Generalisierung

Ein auf ICML 2026 angenommener Beitrag testet LLM-Agenten für Tool-Use systematisch unter Umgebungsverschiebungen auf vier Ebenen – Wahrnehmung, Interaktion, Schlussfolgern und Internalisierung. Ergebnis: Sowohl SFT- als auch RL-Training zeigen signifikante Degradation bei moderaten Verteilungsverschiebungen, und die Benchmark-Genauigkeit sagt tatsächliche Robustheit nicht voraus. Das vorgeschlagene PAFT (Perturbation-Augmented Fine-Tuning) bietet Abhilfe.

🟡 🤝 Agenten 2. Juli 2026 · 3 Min. Lesezeit

SEA: Agenten, die sich selbst modifizieren – mit formalen Sicherheitsgarantien in Echtzeit

Redaktionelle Illustration: Selbstevolvierende KI-Agenten mit formalen Sicherheitszertifikaten und Verhaltensverifizierung

Die SEA-Architektur (Self-Evolving Agents with Anytime-Valid Certificates) ermöglicht Agenten die Aktualisierung eigener Parameter unter Beibehaltung formaler lerntheoretischer Garantien. Fünf Verifizierungsmechanismen und auditierbare Zertifikate genehmigen oder blockieren jede Selbstmodifikation in Echtzeit; auf SWE-bench Verified erzielt SEA +4 bis +5 zusätzlich gelöste Instanzen auf starken Basismodellen.

🟡 🤝 Agenten 2. Juli 2026 · 4 Min. Lesezeit

GitHub Copilot-Agenten erhalten Session-Streaming in der öffentlichen Vorschau

Redaktionelle Illustration: GitHub Copilot-Agenten-Sitzungen mit Live-Session-Streaming in der öffentlichen Vorschau

GitHub hat die öffentliche Vorschau des Session-Streamings für Copilot-Agenten gestartet: Enterprise-Organisationen erhalten damit direkten Einblick in Prompts, Antworten und Tool-Aufrufe, die Agenten in allen Copilot-Clients ausführen.

🟢 🤝 Agenten 2. Juli 2026 · 3 Min. Lesezeit

AutoMem: Gedächtnismanagement als erlernbare Fähigkeit, nicht als Architekturentscheidung

Redaktionelle Illustration: Gedächtnis als erlernbare kognitive Fähigkeit – Graph-Engine für Lernen und Erinnern von Agenten

Forscher der Stanford University entwickelten AutoMem – ein System mit zwei Optimierungsschleifen, das automatisch lernt, Gedächtnis zu organisieren und zu nutzen, ohne menschliche Annotation, und dabei eine 2–4-fache Verbesserung gegenüber Baselines erzielt.

🟡 🤝 Agenten 1. Juli 2026 · 3 Min. Lesezeit

Claude Code v2.1.198: Hintergrund-Agenten öffnen jetzt selbst PRs, neuer /dataviz-Skill

Redaktionelle Illustration: Claude Code Agent-Ansicht automatisiert Pull-Requests und Hintergrund-Agenten

Anthropic hat Claude Code v2.1.198 mit einer Reihe bedeutender Änderungen veröffentlicht: Hintergrund-Agenten, die im Worktree arbeiten, committen, pushen und öffnen nun automatisch Draft-Pull-Requests, ohne anzuhalten oder nachzufragen. Claude in Chrome erreichte General Availability, ein neuer /dataviz-Skill für Diagrammdesign wurde hinzugefügt und AWS als Upstream-Gateway-Provider integriert.

🟡 🤝 Agenten 1. Juli 2026 · 3 Min. Lesezeit

AWS veröffentlicht serverlosen A2A-Gateway, der 190 Punkt-zu-Punkt-Verbindungen durch eine zentrale Registry ersetzt

Redaktionelle Illustration: AWS serverloser Gateway für Agent-zu-Agent-Kommunikation und Routenerkennung

Amazon Web Services hat eine serverlose Referenzarchitektur für einen A2A-Gateway veröffentlicht, der Erkennung, Routing und Zugriffskontrolle zwischen KI-Agenten zentralisiert. Zwanzig Agenten ohne Koordination erzeugen bis zu 190 gegenseitige Verbindungen — der Gateway reduziert das auf einen einzigen Einstiegspunkt.

🟡 🤝 Agenten 1. Juli 2026 · 4 Min. Lesezeit

AWS AgentCore Memory erhält Metadaten-Filterung — Genauigkeit steigt von 40 % auf 64 %

Redaktionelle Illustration: AWS AgentCore Memory-Namespaces mit Metadaten-Filterung für KI-Agenten

Amazon Bedrock AgentCore Memory führt attributbasierte Metadaten-Filterung ein, die vor der semantischen Suche angewendet wird. In einem Benchmark mit 151 Fragen stieg die Gesamtgenauigkeit von 40 % auf 64 %, bei kontextabhängigen Abfragen von 16 % auf 69 %.

🟡 🤝 Agenten 1. Juli 2026 · 3 Min. Lesezeit

LangChain führt RLM-Agenten ein: Rekursive Modelle erzielen 79 % bessere Ergebnisse bei langen Kontexten

Redaktionelle Illustration: LangChain Deep Agents mit QuickJS-Orchestrator für langen Kontext

LangChain hat im DeepAgents-Framework Recursive Language Models (RLM) eingeführt — ein Ansatz, bei dem Modelle sich selbst über Eingabe-Ausschnitte aufrufen, statt den gesamten Kontext in ein einziges Fenster zu laden. Im OOLONG-Benchmark mit 128k Tokens erreichten RLM-Agenten einen Score von 0,79 gegenüber 0,44 bei Standardagenten — eine Verbesserung von 79 Prozent.

🟡 🤝 Agenten 30. Juni 2026 · 4 Min. Lesezeit

Claude Sonnet 5 in GitHub Copilot und Agent Mode in JetBrains: Doppelschlag für Entwicklerteams

Redaktionelle Illustration: GitHub Copilot führt Claude Sonnet 5 und den agentischen Modus für JetBrains-IDEs ein

Am selben Tag, an dem Anthropic Claude Sonnet 5 startet, macht GitHub Copilot das Modell auf allen Plattformen allgemein verfügbar, und der Copilot Agent Mode wird von VS Code auf JetBrains-Entwicklungsumgebungen — IntelliJ, PyCharm, GoLand und WebStorm — ausgeweitet.

🟡 🤝 Agenten 30. Juni 2026 · 3 Min. Lesezeit

SkillOpt: Microsoft Research behandelt Agenten-Instructiondateien als trainierbare Parameter

Redaktionelle Illustration: Microsoft SkillOpt behandelt Agenten-Skills als trainierbare Parameter zur Optimierung

Microsoft Research hat SkillOpt veröffentlicht — ein System, das Skill-Dateien von Agenten durch einen iterativen Forward-Backward-Zyklus optimiert, ohne Modellgewichte anzupassen. Auf 52 Evaluierungszellen erzielte es beste oder gleichwertige Ergebnisse, und GPT-5.5 stieg mit optimierten Skills von 58,8 auf 82,3 Prozent durchschnittlicher Genauigkeit.

🟢 🤝 Agenten 30. Juni 2026 · 3 Min. Lesezeit

TRIAGE: Wie man den richtigen Token in agentischem Reinforcement Learning Verdienst zuweist

Redaktionelle Illustration: Rollenzuweisung bei agentischem Reinforcement Learning mit der TRIAGE-Methode

Forscher haben TRIAGE vorgeschlagen — ein Framework, das Trajektoriensegmente in vier semantische Rollen einteilt und jeder ein unterschiedliches Belohnungssignal zuweist, im Gegensatz zu GRPO, das alle Token gleich behandelt. Auf den Benchmarks ALFWorld, Search-QA und WebShop reduziert TRIAGE die Anzahl der Umgebungsaktionen um 10,4 bis 14,8 Prozent.

🔴 🤝 Agenten 29. Juni 2026 · 3 Min. Lesezeit

Microsoft Research: Memora — KI-Agenten-Gedächtnis mit bis zu 98% weniger Token und SOTA bei langen Gesprächen

Redaktionelle Illustration: Memora — KI-Agenten-Gedächtnis mit bis zu 98% weniger Token und SOTA bei langen Gesprächen, ohne Text und Gesichter

Memora ist ein skalierbares Gedächtnis-Framework von Microsoft Research für KI-Agenten mit langen Horizonten. Es führt eine harmonische Architektur ein, die trennt, was gespeichert wird, von wie es abgerufen wird — mit Cue-Ankern und einem richtliniengesteuerten Retriever. Es erreicht SOTA auf LoCoMo- und LongMemEval-Benchmarks bei gleichzeitig bis zu 98% Reduzierung des Token-Verbrauchs im Vergleich zum Full-Context-Ansatz.

🟡 🤝 Agenten 29. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.27483: Internalizing the Future — einheitliches Training-Paradigma für World-Model-Planning von LLM-Agenten

Redaktionelle Illustration: arXiv:2606.27483 — Internalizing the Future, einheitliches Training-Paradigma für World-Model-Planning, ohne Text und Gesichter

Internalizing the Future ist ein Preprint von Xuan Zhang und acht Koautoren von Tencent, der am 25. Juni 2026 auf arXiv eingereicht wurde. Die Arbeit schlägt ein dreistufiges Training (WM-AMT, FE-SFT, FC-RL) vor, mit dem LLM-Agenten ein World-Model entwickeln — die Fähigkeit, Projektionen zukünftiger Zustände zu generieren und den Erfolg eines Plans zu bewerten, anstatt nur reaktiv zu agieren.

🟡 🤝 Agenten 29. Juni 2026 · 2 Min. Lesezeit

LangChain: Dynamic Subagents in Deep Agents — Agent schreibt Code zum parallelen Dispatch hunderter Unteragenten

Redaktionelle Illustration: Dynamic Subagents in Deep Agents — Agent schreibt Code zum parallelen Dispatch hunderter Unteragenten, ohne Text und Gesichter

Dynamic Subagents ist eine Orchestrierungsarchitektur im LangChain-Deep-Agents-Framework, die es dem Modell ermöglicht, JavaScript-Skripte zum parallelen Dispatch hunderter Unteragenten zu schreiben. Der QuickJS-Interpreter führt die Skripte deterministisch aus und eliminiert so 300+ sequenzielle Tool-Aufrufe. Das System definiert sechs Orchestrierungsmuster — von classify-and-act bis loop-until-done.

🟢 🤝 Agenten 29. Juni 2026 · 2 Min. Lesezeit

Microsoft: 2026 Agent Confidence Index — 300 Entwickler, durchschnittliches Vertrauen in KI-Agenten 64/100

Redaktionelle Illustration: 2026 Agent Confidence Index — 300 Entwickler, durchschnittliches Vertrauen in KI-Agenten 64/100, ohne Text und Gesichter

Der 2026 Agent Confidence Index ist eine Studie, die Microsoft gemeinsam mit MIT Technology Review Insights durchführte und 300 technische Experten aus 12 Branchen zu ihrem Vertrauen in KI-Agenten für 101 Aufgaben befragte. Der Durchschnittswert beträgt 64/100; nur 30 Aufgaben überschreiten die Schwelle von 70 Punkten, und 59% der Experten nennen die Beibehaltung eines menschlichen Aufsichtskreises als primäre Sorge.

🟢 🤝 Agenten 28. Juni 2026 · 1 Min. Lesezeit

arXiv:2606.26806: EVAF konsolidiert Agentenspeicher in Modellparameter für Zielbeständigkeit nach Kontextlöschung

Redaktionelle Illustration: Spuren, die sich in eine netzartige Struktur eingraben und nach dem Löschen erhalten bleiben, ohne Text und Gesichter

Studie arXiv:2606.26806 von Haoliang Han stellt EVAF vor, einen gated-LoRA-Konsolidierungsmechanismus, der langfristigen Sprachagenten das Ziel auch nach dem Löschen des Arbeitskontexts erhält. EVAF benötigt nur 2–3 Parameterschreibvorgänge auf 200 Ereignisse und glänzt bei der Zielbeständigkeit (0,812–0,904), während Abrufsysteme beim faktischen Erinnern führen (0,956–0,973).

🟡 🤝 Agenten 27. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.26758: EGG — Mehrагenten-Framework generiert GPU-Kernel 2,13× schneller als PyTorch

Editorial illustration: multi-agent sustav optimizira GPU dijagram s tokovima podataka i blokirajućim matricama, bez lica

EGG ist ein Mehrагenten-Framework, das optimierte GPU-Kernel für die LLM-Inferenz automatisch generiert. Mit einem zweistufigen Ansatz — algorithmische Struktur, dann Hardware-Feinabstimmung — erzielt es eine durchschnittliche Beschleunigung von 2,13× gegenüber PyTorch und übertrifft sowohl agentenbasierte als auch RL-basierte Ansätze auf dem KernelBench.

🟡 🤝 Agenten 27. Juni 2026 · 2 Min. Lesezeit

AWS: Stripe hat über 100 KI-Agenten für die Finanzcompliance eingeführt — Erkenntnisse aus dem Produktionsbetrieb

Editorial illustration: Netzwerk von KI-Agenten, die Finanztransaktionen in einer Cloud-Infrastruktur überwachen

Stripe und AWS beschrieben, wie die Plattform, die jährlich 1,4 Billionen USD verarbeitet, in weniger als einem Jahr über 100 KI-Agenten für die Finanzcompliance eingeführt hat. Die auf dem ReAct-Framework und Amazon Bedrock basierenden Agenten brachten 26% kürzere Überprüfungszeiten, 95% Betrugserkennung und 60% niedrigere Kosten.

🟢 🤝 Agenten 27. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.26649: Agentenanweisungen werden zu formal verifiziertem Policy-as-Code

Editorial illustration: robotic arm converting text documents into verified code blocks on a secure policy shield

Forschende haben eine Pipeline entwickelt, die natürlichsprachliche Anweisungen für KI-Agenten, MCP-Tool-Beschreibungen und Richtliniendokumente mithilfe des Cedar Policy Language und einer Generator-Critic-Schleife automatisch in formal verifizierten Code überführt — mit deutlich höherer Spezifikationsabdeckung als manuell geschriebene symbolische Durchsetzung.

🟢 🤝 Agenten 27. Juni 2026 · 1 Min. Lesezeit

Anthropic: Claude Code v2.1.195 — Maus deaktivieren, verbessertes Voice Dictation und Hook-Korrekturen

Editorial illustration: Terminaloberfläche mit Claude Code-Logo, Hook-Symbolen und Schallwelle auf dunklem Hintergrund

Claude Code v2.1.195 ist ein kleineres QoL-Update, das eine neue Umgebungsvariable zum Deaktivieren von Mausklicks im Vollbildmodus, Korrekturen für Bindestriche in Hook-Matchern und verbessertes Voice Dictation auf macOS für CJK-Sprachen mitbringt.

🟢 🤝 Agenten 27. Juni 2026 · 2 Min. Lesezeit

LangChain: Prompt Caching im Deep Agents-Framework senkt Latenz langlebiger Agenten

Editorial illustration: robot agent with layered memory cache diagram, circuit background, no text or faces

LangChain hat im Deep Agents-Framework Prompt Caching eingeführt — eine Technik zur Wiederverwendung zuvor berechneter Kontexte zwischen Agentenschritten — mit dem Ziel, Latenz und Kosten bei mehrfach iterierenden Agenten zu senken.

🔴 🤝 Agenten 26. Juni 2026 · 3 Min. Lesezeit

arXiv:2606.25996: Autodata — agentischer Datenwissenschaftler für hochwertige synthetische Daten (Meta FAIR)

Editorial illustration: robotic scientist examining data charts and synthetic dataset pipelines in a modern research lab

Autodata ist ein System von Meta FAIR, in dem KI-Agenten die Rolle von Datenwissenschaftlern übernehmen und autonom hochwertige synthetische Datensätze erstellen. Die Methode Agentic Self-Instruct meta-optimiert den Agenten selbst; Tests in CS-Forschung, Rechtswesen und Mathematik zeigen konsistente Verbesserungen gegenüber statischen Baselines.

🟡 🤝 Agenten 26. Juni 2026 · 2 Min. Lesezeit

Anthropic: Claude Code v2.1.193 — Auto-Mode-Klassifikator für Shell-Befehle und OpenTelemetry-Logging

Redaktionelle Illustration: Terminal-Oberfläche mit Shell-Klassifikator und Telemetrie-Logging ohne Gesichter

Claude Code v2.1.193, veröffentlicht am 25. Juni 2026, führt einen Klassifikator ein, der alle Bash- und PowerShell-Befehle durch den Auto-Mode leitet, zeigt Ablehnungsgründe in der Benutzeroberfläche an und bietet ein neues OpenTelemetry-Log-Event für Enterprise-Observability.

🟡 🤝 Agenten 26. Juni 2026 · 2 Min. Lesezeit

LangChain: LangSmith Fleet On-Call Copilot, Computer Use und Deep Agents RubricMiddleware

Editorial illustration: LangSmith dashboard with alert triage agent and isolated VM environment icons

LangChain hat im Juni-Newsletter den Fleet On-Call Copilot für automatische Alert-Triage, Computer Use mit isolierten VMs für Agenten sowie die Open-Source-RubricMiddleware vorgestellt, die bei Box die Agentenentwicklung um das 3-fache beschleunigte und bei Harmonic die Nutzerbindung um das 4-fache steigerte.

🟡 🤝 Agenten 26. Juni 2026 · 2 Min. Lesezeit

OpenAI: Wie Agenten die Arbeit transformieren — Codex mit 5 Millionen Wochennutzern, Wachstum 400%

Editorial illustration: robotic arms and human hands collaborating on glowing digital workflows inside a modern office

OpenAI berichtet über explosives Wachstum von KI-Agenten im Geschäftsumfeld: Codex verzeichnet 5 Millionen wöchentliche Nutzer und ein Wachstum von 400% im Jahr 2026, während der Anteil der Aufgaben, die mehr als 30 Minuten menschlicher Arbeit ersetzen, auf 80,6% gestiegen ist.

🔴 🤝 Agenten 25. Juni 2026 · 2 Min. Lesezeit

Google: Computer Use in Gemini 3.5 Flash — KI-Agenten für Browser, Mobilgerät und Desktop

Redaktionelle Illustration: KI-Agent, der Browser und mobile Oberflächen auf mehreren Bildschirmen steuert

Google hat das Computer-Use-Werkzeug in Gemini 3.5 Flash integriert, sodass KI-Agenten Browser, Mobilgeräte und Desktop-Anwendungen eigenständig steuern können. Das Modell erzielt das bisher beste OSWorld-Ergebnis mit Enterprise-Schutz vor Prompt-Injection-Angriffen.

🟡 🤝 Agenten 25. Juni 2026 · 2 Min. Lesezeit

Anthropic: Claude Code v2.1.191 — /rewind-Befehl, 37 % weniger CPU, MCP-Retry-Logik

Redaktionelle Illustration: Terminalansicht der Claude Code-Oberfläche mit Symbolen für Rewind und CPU-Optimierung

Claude Code v2.1.191 ist ein Update vom 24. Juni 2026, das den /rewind-Befehl zur Wiederherstellung von Sitzungen nach /clear einführt, den CPU-Verbrauch beim Streaming um 37 % reduziert sowie MCP-Retry-Logik für transiente Netzwerkfehler und das Speichern genehmigter Sandbox-Hosts mitbringt.

🟢 🤝 Agenten 25. Juni 2026 · 1 Min. Lesezeit

LangChain: Wie man einem KI-Agenten Gedächtnis gibt — Capture, Analyze, Update über LangSmith

Redaktionelle Illustration: schematische Darstellung des dreiphasigen Gedächtniszyklus eines KI-Agenten mit den Bezeichnungen Capture, Analyze, Update

LangChain hat einen praxisorientierten Leitfaden für das Hinzufügen von Gedächtnis zu KI-Agenten veröffentlicht, mit einem dreiphasigen Zyklus: Trace-Aufzeichnung, Analyse und Gedächtnis-Aktualisierung — mithilfe der Werkzeuge LangSmith Observability, Engine und Context Hub.

🔴 🤝 Agenten 24. Juni 2026 · 3 Min. Lesezeit

Anthropic: Claude Tag bringt einen Multiplayer-KI-Agenten direkt in Slack-Teams

Redaktionelle Illustration: Slack-Kanal mit mehreren Nutzern, die einen KI-Agenten teilen, Nachrichten und Markierungen in der Team-Oberfläche

Claude Tag ist ein neues Anthropic-Produkt, das es Teams ermöglicht, @Claude in Slack-Kanälen zu taggen — ein gemeinsamer Agent pro Kanal arbeitet asynchron stunden- oder tagelang, merkt sich den Gesprächskontext und kennzeichnet proaktiv wichtige Informationen. Mit der internen Version wurden 65 % des Codes von Anthropics Product-Team generiert.

🟡 🤝 Agenten 24. Juni 2026 · 2 Min. Lesezeit

Anthropic: Claude Code v2.1.187 — Sandbox-Zugangsdatenschutz, Organisationsmodell-Einschränkungen, CJK-Fix

Redaktionelle Illustration: Terminal-Ansicht der Claude Code-Oberfläche mit einem Schlosssymbol und Zugangsdatenschutz

Claude Code v2.1.187 ist ein am 23. Juni 2026 veröffentlichtes Update, das die Einstellung sandbox.credentials zum Blockieren des Lesens geheimer Variablen einführt, organisationsweite Modellauswahl-Einschränkungen ermöglicht sowie MCP-Hänger und einen CJK-Mojibake-Fehler in Terminals behebt.

🟡 🤝 Agenten 24. Juni 2026 · 2 Min. Lesezeit

GitHub: Copilot erhält neue CLI-Terminal-Oberfläche und Unterstützung für eigene API-Schlüssel (BYOK)

Redaktionelle Illustration: Terminal-Fenster mit Tabs und KI-Assistent-Oberfläche, GitHub Copilot-Logo im Hintergrund

Die GitHub Copilot CLI-Terminal-Oberfläche ist allgemein verfügbar, und die neue BYOK-Option (Bring Your Own Key) ermöglicht es Nutzern, eigene API-Schlüssel für OpenAI, Anthropic, Ollama und andere Anbieter zu verwenden — ohne den obligatorischen Copilot-Modell-Layer.

🟡 🤝 Agenten 24. Juni 2026 · 2 Min. Lesezeit

NVIDIA: Agent Toolkit — offene Grundlage für Enterprise-KI-Agenten mit Nemotron-Modellen

Redaktionelle Illustration: modulare Darstellung der NVIDIA Agent Toolkit-Architektur mit verbundenen Enterprise-Systemen, ohne Gesichter und Text

Das NVIDIA Agent Toolkit ist eine offene Plattform zum Aufbau von Enterprise-KI-Agenten, die offene Nemotron-Modelle, NemoClaw-Guardrails und eine sichere OpenShell-Laufzeit kombiniert. Partner wie CrowdStrike erzielen bereits 98,5 % Genauigkeit bei der Triage von Sicherheitswarnungen, und Forschungen, die Monate dauerten, werden auf Tage verkürzt.

🟢 🤝 Agenten 24. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.22844: RaMem löst Kontextkollaps im Langzeitgedächtnis agentischer Systeme

Editorial illustration: robotic agent retrieving glowing memory fragments organized by time and session context

RaMem ist ein vierstufiges Framework, das Kontextkollaps in agentischen Gedächtnissystemen verhindert — einen Zustand, in dem komprimierte Fragmente ihren umgebenden Kontext verlieren und fälschlicherweise als gleich relevant dargestellt werden. Auf Langzeitgedächtnis-Benchmarks erzielt es einen durchschnittlichen F1-Gewinn von mehr als 10 % gegenüber bestehenden Basissystemen.

🟢 🤝 Agenten 24. Juni 2026 · 2 Min. Lesezeit

CNCF: Agent Auth — sichere Identität und Befugnisdelegation für KI-Agenten

Redaktionelle Illustration: Cloud-native Architektur mit einem Token, der zwischen Agent und Nutzeridentität fließt, symbolische Darstellung der Delegation

CNCF erklärt, warum KI-Agenten eine eigene kryptographische Identität und einen Mechanismus zur Befugnisdelegation benötigen. Der On-Behalf-Of-Token trägt sowohl die Agentenidentität als auch den Nutzerprinzipal mit einem genau definierten Scope — alles, was dem klassischen User-only-Auth-Modell fehlt.

🟡 🤝 Agenten 23. Juni 2026 · 2 Min. Lesezeit

Anthropic: Claude Code v2.1.186 bringt MCP-Login/Logout, Workflow-Filter und Skill-Verwaltung

Redaktionelle Illustration: Terminalansicht von Claude Code v2.1.186 mit MCP-Login-Befehlen und Workflow-Filter

Claude Code v2.1.186 ist ein am 22. Juni 2026 veröffentlichtes Update, das MCP-Befehle für Login/Logout zur nicht-interaktiven Authentifizierung in SSH-Umgebungen, Statusfilterung in der Workflow-Übersicht sowie einen neuen Skills-Bereich in der Plugin-Oberfläche einführt.

🟡 🤝 Agenten 23. Juni 2026 · 2 Min. Lesezeit

AWS: Bedrock AgentCore Payments — KI-Agenten zahlen APIs autonom per x402-Protokoll

Editorial illustration: robotic arm inserting digital payment token into cloud server rack with AWS and blockchain symbols

Amazon Bedrock AgentCore Payments ist eine verwaltete Infrastruktur, die KI-Agenten programmatische Zahlungen an Upstream-APIs ohne menschliche Eingriffe ermöglicht — über das x402-Protokoll und den USDC-Stablecoin auf der Base-Blockchain. Ampersend schloss die Integration in weniger als 2 Wochen ab, statt der geschätzten 3–4 Monate.

Vollständiges Archiv ansehen →