🏥 In der Praxis

192 Nachrichten

🟡 🏥 In der Praxis 10. Juli 2026 · 2 Min. Lesezeit

AWS: SageMaker bringt serverloses Fine-Tuning für NVIDIA Nemotron 3 mit SFT, RLVR und RLAIF

Redaktionelle Illustration: ein modulares Modell, das durch drei automatisierte Pipelines ohne Server verfeinert wird

Amazon SageMaker AI hat die serverlose Anpassung von NVIDIA Nemotron 3-Modellen eingeführt, ohne Infrastrukturverwaltung. Drei Techniken stehen bereit: SFT (überwachtes Fine-Tuning), RLVR (Reinforcement Learning mit verifizierbaren Belohnungen) und RLAIF (Reinforcement Learning aus KI-Feedback), womit fortgeschrittene RL-Methoden für Enterprise-Teams ohne ML-Infrastrukturwissen zugänglich werden.

🟡 🏥 In der Praxis 10. Juli 2026 · 2 Min. Lesezeit

GitHub: Bessere Tools verschlechterten Copilot Code Review — Überarbeitung der Anweisungen brachte Qualität bei 20 % geringeren Kosten zurück

Redaktionelle Illustration: eine Lupe auf einem farbigen Diff statt auf einem gesamten Repository

GitHub hat offenbart, dass die Migration des Copilot Code Reviews auf besser gewartete Tools die Ergebnisse zunächst verschlechterte — die Ursache waren nicht die Tools, sondern veraltete Agenten-Anweisungen. Durch die Überarbeitung der Anweisungen nach dem Diff-First-Prinzip (Batch-Suche vor dem Lesen von Dateien, am PR-Diff verankerte Analyse) wurden rund 20 % geringere durchschnittliche Review-Kosten bei gleicher Qualität erreicht.

🟡 🏥 In der Praxis 10. Juli 2026 · 2 Min. Lesezeit

OpenAI: Deutsche Telekom startet KI-native Transformation — Partnerschaft umfasst Support, Netz und Sprach-KI für ~245 Millionen Kunden

Redaktionelle Illustration: Ein Telekommunikationsturm, der KI-Signale über Europa ausstrahlt

Deutsche Telekom und OpenAI haben eine Partnerschaft geschlossen, um den Betreiber in einen KI-nativen Telco umzuwandeln — mit Anwendungen in Kundensupport, Mitarbeiterwerkzeugen, Netzwerkbetrieb und Sprach-KI. Deutsche Telekom ist einer der größten europäischen Netzbetreiber mit rund 245 Millionen Kunden weltweit, womit dies einer der bedeutendsten KI-Deals im Telekommunikationssektor ist.

🟢 🏥 In der Praxis 10. Juli 2026 · 2 Min. Lesezeit

Anthropic: Claude Code v2.1.206 bringt /cd mit Pfadvorschlägen, /doctor-Hinweise für CLAUDE.md und automatischen Git-Push in /commit-push-pr

Redaktionelle Illustration: ein Terminalfenster mit Befehlen und einem Pfeil, der einen Branch auf einen Remote schiebt

Claude Code v2.1.206 ist eine neue Version von Anthropics CLI-Tool und führt den Befehl /cd mit Pfadvorschlägen ein, eine /doctor-Prüfung mit Empfehlungen zum Kürzen von CLAUDE.md-Dateien sowie die automatische Freigabe von Git-Push auf den konfigurierten Remote in /commit-push-pr. Hintergrundagenten werden nun sofort nach einem Upgrade aktualisiert, ohne langsames Update beim nächsten Verbinden.

🟢 🏥 In der Praxis 10. Juli 2026 · 2 Min. Lesezeit

AWS: Henry Schein One prüft Qualität von Dental-Röntgenbildern in Echtzeit per KI — 11 Millionen Aufnahmen pro Woche bei 1,4 Sekunden Latenz

Redaktionelle Illustration: ein Dental-Röntgenbild, das ein KI-Netz mit Qualitätsstempel durchläuft

Henry Schein One hat „Image Verify” entwickelt — ein KI-System auf Amazon SageMaker zur Echtzeit-Qualitätsprüfung von Dental-Röntgenaufnahmen. Das System ist an mehr als 10.000 Standorten im Einsatz, verarbeitet über 11 Millionen Röntgenbilder pro Woche bei einer durchschnittlichen Latenz von 1,4 Sekunden und soll die Ablehnungsquote von Versicherungsanträgen aufgrund schlechter Bildqualität senken.

🟡 🏥 In der Praxis 9. Juli 2026 · 2 Min. Lesezeit

GitHub: Copilot bietet jetzt KI-Repository-Übersicht — automatische Zusammenfassung von Zweck, Technologien und Beitragshinweisen

Redaktionelle Illustration: offene Repository-Karte mit einer KI-Lupe, die eine Zusammenfassung extrahiert

GitHub Copilot Repository-Übersicht ist eine neue Funktion, die beim ersten Besuch eines unbekannten Repositorys automatisch eine Zusammenfassung erstellt: Zweck des Projekts, verwendete Technologien und Beitragshinweise. Sie funktioniert auf github.com über Copilot Chat, ist auf allen Copilot-Plänen verfügbar und erfordert keine Konfiguration.

🟢 🏥 In der Praxis 9. Juli 2026 · 2 Min. Lesezeit

Anthropic: Reflect — Dashboard zeigt, wie Sie Claude nutzen, mit Ruhezeiten und Selbstreflexionsfragen

Redaktionelle Illustration: Spiegel in Form eines Bildschirms mit Grafiken zu Nutzungsgewohnheiten

Reflect ist Anthropics Beta-Dashboard zur Analyse der eigenen Claude-Nutzungsgewohnheiten: Es zeigt dominante Themen, Aufgabenkategorien und Zeitmuster über Zeiträume von 1 bis 12 Monaten. Nutzer können Ruhezeiten und Pausenerinnerungen festlegen; verfügbar auf Free-, Pro- und Max-Plänen mit aktiviertem Memory.

🟢 🏥 In der Praxis 9. Juli 2026 · 2 Min. Lesezeit

Mistral: Studio erhält Versionskontrolle für Prompts und Skills — unveränderliche Versionen, Audit-Protokolle und Rollback

Redaktionelle Illustration: Archivschrank mit versionierten Prompt-Karten und Git-Ästen

Mistral Studio führt ein Aufzeichnungssystem für KI-Prompts und Skills ein: unveränderliches Versioning mit vollständiger Historie, Eigentümerschaft und Audit-Protokollen, Klassifizierungslabels und schnellem Rollback. Skills sind als MCP-Server integriert, Entwicklungs- und Produktionsabläufe sind getrennt — Änderungen in der Produktion laufen über CI/CD.

🟡 🏥 In der Praxis 8. Juli 2026 · 4 Min. Lesezeit

AWS führt Claude Apps Gateway ein: Zentrales Management von Claude-Tools für Enterprise-Teams

Redaktionelle Illustration: AWS selbstgehostete Steuerungsebene für Claude Code und Desktop-Anwendungen in Unternehmen

Amazon Web Services hat Claude Apps Gateway for AWS vorgestellt, eine selbstgehostete Steuerungsebene, die Enterprise-Teams zentrales Management von Zugriff, Kosten und Richtlinien für Claude Code und Claude Desktop ermöglicht – ohne die Verteilung langlebiger Anmeldeinformationen an Entwickler.

🟡 🏥 In der Praxis 8. Juli 2026 · 4 Min. Lesezeit

OpenAI hinterfragt SWE-Bench Pro: Führender KI-Coding-Benchmark hat Zuverlässigkeitsprobleme

Redaktionelle Illustration: OpenAI-Kritik an der Zuverlässigkeit des SWE-Bench-Pro-Benchmarks zur Bewertung von Coding-Fähigkeiten

OpenAI veröffentlicht eine Analyse, die die Zuverlässigkeit von SWE-Bench Pro – einem der dominierenden Benchmarks zur Bewertung von KI-Coding-Assistenten im Jahr 2026 – in Frage stellt. Da Benchmark-Ergebnisse Kauf- und Adoptionsentscheidungen stark beeinflussen, hat diese Warnung direkte praktische Folgen für die Branche.

🟢 🏥 In der Praxis 8. Juli 2026 · 3 Min. Lesezeit

Claude Code v2.1.205: Sitzungssicherheit, Fehlerbehebungen und 400 MB RAM-Einsparung

Redaktionelle Illustration: Anthropic Claude Code v2.1.205 neues Release des CLI-Entwicklungstools mit Verbesserungen

Anthropic hat am 8. Juli 2026 Claude Code v2.1.205 mit einer neuen Sicherheitsregel veröffentlicht, die Manipulation von Transkriptdateien der Sitzung verhindert, sowie einer Reihe von Korrekturen einschließlich stiller JSON- und Windows-Worktree-Fehler, und einer Auto-Update-Optimierung, die den Binärdatei-Stream direkt auf die Festplatte streamt statt in den Speicher – wodurch rund 400 MB Spitzen-RAM eingespart werden.

🟢 🏥 In der Praxis 8. Juli 2026 · 3 Min. Lesezeit

Flint — Microsofts Open-Source-Sprache, die Visualisierungen für KI-Agenten kompiliert

Redaktionelle Illustration: Microsoft Flint Visualisierungsspezifikationssprache für KI-Agenten und Datendarstellungen

Microsoft Research hat Flint veröffentlicht, eine Open-Source-Sprache für Diagrammspezifikationen, die den Kompromiss zwischen kurzen und ausführlichen Visualisierungsspezifikationen durch Kompilierung in Vega-Lite, Apache ECharts und Chart.js aus einer einzigen kompakten Notation löst – mit semantischen Datentypen, die Skalen, Formatierung und Farbschemata automatisch ableiten.

🟢 🏥 In der Praxis 7. Juli 2026 · 4 Min. Lesezeit

Wie Schneider Electric LLMOps-Grundlagen für 60+ KI-Agenten mit LangSmith aufgebaut hat

Redaktionelle Illustration: Schneider Electric führt Enterprise-LLMOps-Überwachung mit LangSmith ein

Schneider Electric, mit 160.000 Mitarbeitern in 107 Ländern, hat Self-hosted LangSmith auf AWS EKS zur Verwaltung von 60+ KI-Agenten deployt. Die Architektur basiert auf drei Säulen — Observierbarkeit, Evaluierung und Deployment — mit rund 200 aktiven Nutzern. Der interne Assistent One Jo bedient die gesamte Organisation; ein Quotation-Workflow wurde von Tagen auf 15 Minuten reduziert.

🟡 🏥 In der Praxis 6. Juli 2026 · 4 Min. Lesezeit

Alberta scannte 466 Millionen Codezeilen in 20 Stunden: Regierung nutzt Claude für Cybersicherheit

Editorial-Illustration: Anthropic entdeckt Sicherheitslücken in umfangreichem staatlichem Quellcode

Die Regierung der kanadischen Provinz Alberta setzte Claude Code mit ~50 parallelen KI-Agenten ein, um 466 Millionen Codezeilen in 20 Stunden zu scannen – eine Aufgabe, die mit traditionellen Methoden 6,5 Jahre gedauert hätte. Das Projekt umfasste 1.280 Anwendungen und 3.400 Repositories in 27 Ministerien, von denen keines je eine systematische Sicherheitsrevision durchlaufen hatte.

🟢 🏥 In der Praxis 6. Juli 2026 · 4 Min. Lesezeit

AWS automatisiert PII-Schwärzung in Bildern mit Nova 2 Lite und SAM 3

Editorial-Illustration: AWS Nova schwärzt personenbezogene Daten aus Bildern für Compliance und Datenschutz

Amazon Web Services hat eine sechsstufige Pipeline zur automatischen Entfernung personenbezogener Daten (PII) aus Bildern vorgestellt, durch Kombination von Amazon Nova 2 Lite, Meta SAM 3 und Amazon Textract. Die Lösung zielt auf regulatorische Konformität mit DSGVO und PCI DSS ohne eigenes Modelltraining.

🟡 🏥 In der Praxis 3. Juli 2026 · 4 Min. Lesezeit

PASE: Neuro-symbolisches System verkürzt Cloud-Fehlerwiederherstellung um mehr als 40 Prozent

Redaktionelle Illustration: Autonome Wiederherstellung von Cloud-Infrastruktur durch neuro-symbolische Synthese

Chinesische Forscher schlagen PASE vor — einen Planning-Aware Semantic Self-Healing Engine, der LLM-Planung, symbolische Verifikation und Deep-RL-Prompt-Optimierung kombiniert. Ergebnis: mehr als 40 Prozent Reduktion der mittleren Wiederherstellungszeit bei Cloud-Fehlern gegenüber bisherigen Ansätzen.

🟢 🏥 In der Praxis 3. Juli 2026 · 3 Min. Lesezeit

Wie PyTorch Tausende von Tests aus wenigen Template-Klassen generiert — ein Leitfaden zur Test-Infrastruktur

Redaktionelle Illustration: PyTorch-Werkzeuge für automatisiertes Testen und CI-Infrastruktur-Optimierung

Der PyTorch-Blog-Beitrag von Riya Punia (Red Hat) erklärt, warum CI-Fehlschläge seltsame Namen wie TestMatmulCUDA.test_basic_cuda_float32 statt des ursprünglichen TestMatmul.test_basic tragen — die Tests werden beim Import durch Gerät- und dtype-Kombinationen dynamisch generiert.

🟡 🏥 In der Praxis 2. Juli 2026 · 4 Min. Lesezeit

AWS SageMaker-Leitfaden: Bei Multi-Turn-RL sind Belohnungsfunktion und Evaluierung wichtiger als der Algorithmus

Redaktionelle Illustration: AWS SageMaker Agentic Fine-Tuning-Workflows und Reinforcement Learning in mehreren Runden

Der AWS SageMaker AI-Leitfaden für Multi-Turn-Reinforcement-Learning stellt die Qualität der Belohnungsfunktion und die Unabhängigkeit der Evaluierung vor die Algorithmenwahl. Dichte Belohnungen verhindern Varianzkollaps, und Reward-Hacking entsteht, wenn der Agent eine Metrik optimiert, ohne die eigentliche Aufgabe zu lösen. Auf dem SOP-Bench-Benchmark erzielte korrekt eingestelltes Training eine um 13 Prozent bessere Task-Success-Rate und eine rund 16 Prozent höhere Feldgenauigkeit.

🟢 🏥 In der Praxis 2. Juli 2026 · 3 Min. Lesezeit

GitHub Copilot in CI/CD: Kein persönlicher Token mehr und Kostenkontrolle pro Team

Redaktionelle Illustration: GitHub Copilot Kostenkontrolle und KI-Credit-Pools für Enterprise-Teams

GitHub hat am selben Tag zwei Enterprise-Updates für Copilot veröffentlicht: Der CLI in GitHub Actions benötigt keinen persönlichen Zugriffstoken mehr, und Cost Center unterstützen jetzt KI-Credit-Pools mit automatischen Limits, die Teams voreinander schützen.

🟢 🏥 In der Praxis 2. Juli 2026 · 4 Min. Lesezeit

Wie man Kostenexplosionen bei Coding-Agenten eindämmt: Vierphasiger Ansatz mit LangSmith

Redaktionelle Illustration: LangSmith-Plattform für Unified Observability und Kostenverfolgung von Coding-Agenten

LangChain beschreibt, wie Coding-Agenten durch Tool-Fragmentierung und eine Tokenmaxxing-Mentalität unkontrollierte Kosten erzeugen, und schlägt als Lösung einen vierphasigen Ansatz über die LangSmith-Plattform vor, der Sichtbarkeit, Normalisierung, Optimierung und Steuerung abdeckt.

🟢 🏥 In der Praxis 1. Juli 2026 · 3 Min. Lesezeit

Anthropic führt Zugriffskontrolle für Modelle für Enterprise-Administratoren ein

Redaktionelle Illustration: Anthropic Enterprise-Verwaltung des Modellzugriffs für Organisationsadministratoren

Anthropic startet Enterprise Model Entitlements als Beta: Organisationsadministratoren können jetzt festlegen, auf welche Claude-Modelle Nutzer Zugriff haben, und Aufwandsstufen-Einstellungen pro Nutzer oder Gruppe konfigurieren.

🟡 🏥 In der Praxis 30. Juni 2026 · 4 Min. Lesezeit

Claude Science: Anthropics eigenständige Workbench für Wissenschaftler in den Life Sciences

Redaktionelle Illustration: Anthropic Claude Science Arbeitsumgebung für Genomik und biowissenschaftliche Forschung

Anthropic hat Claude Science in der Beta veröffentlicht — eine eigenständige Desktop-Applikation (macOS/Linux) für Forscher in Genomik, Proteomik und verwandten Bereichen, mit mehr als 60 kuratierten Skills, nativer Integration von NVIDIA-BioNeMo-Modellen und einem Reviewer-Agenten, der Zitate und Berechnungen validiert.

🟡 🏥 In der Praxis 30. Juni 2026 · 4 Min. Lesezeit

OECD: GenAI-Chatbot-Nutzung stieg von 18 % auf 28 % der Bevölkerung in einem Jahr

Redaktionelle Illustration: OECD-Studie zur Nutzung generativer KI-Chatbots in 37 Ländern weltweit

Eine OECD-Analyse auf Basis von SimilarWeb-Daten für 37 GPAI-Länder zeigt, dass die Nutzung generativer KI-Chatbots zwischen Januar 2025 und Januar 2026 von etwa 18 % auf 28 % der Bevölkerung gestiegen ist. Singapur führt mit 63 % Adoption, die Altersgruppe 25–34 überschreitet 50 %, und Nutzer von Claude und Copilot tendieren zu professionellen Tools.

🟡 🏥 In der Praxis 29. Juni 2026 · 2 Min. Lesezeit

AWS: Nova 2 Lite und Claude — kostenoptimierte Pipeline zur Verarbeitung gescannter Dokumente

Redaktionelle Illustration: Nova 2 Lite und Claude — kostenoptimierte Pipeline zur Verarbeitung gescannter Dokumente, ohne Text und Gesichter

AWS demonstriert eine zweistufige (Two-Stage) Pipeline zur Massendigitalisierung gescannter Dokumente auf Amazon Bedrock. Amazon Nova 2 Lite übernimmt die anfängliche Extraktion schnell und günstig, während Claude das räumlich anspruchsvolle Verständnis übernimmt — ein hybrider Ansatz, der zwei Drittel weniger kostet als Single-Model-Alternativen.

🟡 🏥 In der Praxis 28. Juni 2026 · 2 Min. Lesezeit

GitHub: Copilot Agentic Harness erreicht Vendor-Niveau mit geringerem Token-Verbrauch über 20+ Frontier-Modelle

Redaktionelle Illustration: Vergleichsbalken für Performance und Tokens auf einem Bildschirm, ohne Text und Gesichter

Der GitHub Copilot Agentic Harness ist eine Schicht, die dem Modell Werkzeuge und eine Ausführungsschleife für autonomes Coding bereitstellt. GitHub testete ihn mit Claude Sonnet 4.6, Claude Opus 4.7, GPT-5.4 und GPT-5.5 in fünf Benchmarks und stellte fest, dass er Aufgabenabschlussraten auf Vendor-Harness-Niveau bei geringerem Token-Verbrauch erzielt und über 20 Frontier-Modelle unterstützt.

🟡 🏥 In der Praxis 27. Juni 2026 · 2 Min. Lesezeit

Anthropic: Economic Index zeigt Tagesrhythmen und Nutzungsmuster bei KI

Editorial illustration: Zeitverlaufsgrafiken der KI-Nutzungsmuster im Tagesverlauf mit ansteigenden Kurven in den Morgen- und Abendstunden

Der dritte Anthropic Economic Index analysiert, wann und wie Menschen Claude nutzen — von den Morgennachrichten bis zu spätabendlichen Rezepten. Der Autonomy Score von Claude Code liegt 0,37 Punkte über dem Chat, und Gespräche in hochbezahlten Berufen verbrauchen 2,5-mal mehr Token.

🟡 🏥 In der Praxis 27. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.27009: Semantisches frühzeitiges Stoppen senkt Kosten von Agenten-Schleifen um 38%

Editorial illustration: Diagramm einer Agenten-Schleife mit Stoppunkt basierend auf Vektorkonvergenz, ohne Text und Gesichter

Semantic Early-Stopping for Iterative LLM Agent Loops schlägt eine Methode vor, die eine Agenten-Iterationsschleife stoppt, sobald das Embedding aufeinanderfolgender Entwürfe keine semantischen Änderungen mehr zeigt — ohne feste Schrittanzahl — und so den Token-Verbrauch um 38% bei identischer Qualität reduziert.

🟡 🏥 In der Praxis 26. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.25519: Quantisierung bläht das Schlussfolgern auf — verborgene Kosten von Niedrigbit-Modellen

Redaktionelle Illustration: schematische Darstellung eines komprimierten Gehirns, das eine lange Kette von Gedankenblasen ausstößt — symbolisiert Token-Inflation bei quantisierten KI-Modellen

Die Quantisierung von Sprachmodellen auf INT4/INT3 erhält die Antwortgenauigkeit, verlängert aber die Schlussfolgerungskette und negiert die erwartete Inferenzbeschleunigung. Microsoft-Forscher führten die Metrik CoT Token Inflation Ratio ein und testeten sie in Mathematik, Code, Wissenschaft und agentischen Aufgaben.

🟢 🏥 In der Praxis 26. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.25524: Cliff-Token — einzelne Token, die mathematisches Schlussfolgern zum Scheitern bringen

Editorial illustration: abstract graph showing sharp probability drop at a single token in a mathematical reasoning chain

Cliff-Token sind einzelne Token im LLM-Ausgabestrom, an denen die Wahrscheinlichkeit erfolgreichen mathematischen Schlussfolgerns abrupt sinkt. Forscher entwickelten eine Erkennungsmethode und zeigten: Das Entfernen des ersten Cliff-Tokens bringt die Genauigkeit nahezu auf ein perfektes Niveau; Cliff-DPO-Training liefert +6,6 Prozentpunkte.

🟢 🏥 In der Praxis 26. Juni 2026 · 2 Min. Lesezeit

Microsoft: Generative Causal Testing — KI-Hypothesen über das Gehirn, mit dem Scanner getestet

Editorial illustration: AI neural network overlaid on abstract brain scan imagery showing highlighted cortical regions

Generative Causal Testing (GCT) ist ein zweiphasiger KI-Rahmen, der undurchsichtige Modelle zur Vorhersage von Gehirnaktivität in testbare Hypothesen umwandelt — und diese dann mit echten fMRI-Experimenten an menschlichen Probanden überprüft.

🟡 🏥 In der Praxis 25. Juni 2026 · 2 Min. Lesezeit

AWS: Huntington Bank schwärzte PII aus 400 Millionen Dokumenten mit 95 % Genauigkeit

Redaktionelle Illustration: digitale Dokumente mit geschwärzten Textblöcken und AWS-Cloud-Infrastruktur im Hintergrund

Huntington Bank schwärzte mit dem AWS-Stack (Textract, SageMaker, Step Functions) personenbezogene Daten aus über 400 Millionen Dokumenten mit einer Genauigkeit von mehr als 95 %, senkte die Projektkosten auf nur 5 % der ursprünglichen Schätzung und verkürzte die Laufzeiten von Jahren auf Monate.

🟡 🏥 In der Praxis 25. Juni 2026 · 2 Min. Lesezeit

Microsoft: Talos — Open-Source-System für automatische iterative Genomreanalyse bei seltenen Krankheiten

Redaktionelle Illustration: genomische Datenpipeline mit DNA-Helix und medizinischen Diagrammen auf dunklem Hintergrund, keine Gesichter

Talos ist ein Open-Source-System, das Genome von Patienten mit seltenen Krankheiten automatisch iterativ reanalysiert. Bei 4.735 nicht diagnostizierten Patienten wurden 241 neue Diagnosen (+5,1 %) gefunden, bei einer Sensitivität von 90 % und Annotationskosten von nur 11 USD pro 1.000 Genome.

🟡 🏥 In der Praxis 24. Juni 2026 · 2 Min. Lesezeit

AWS: Bedrock AgentCore Pool-Modell-Mandantenfähigkeit — gemeinsame Infrastruktur, isolierte Mandanten

Editorial illustration: cloud infrastructure diagram showing layered tenant isolation tiers with data flow arrows

AWS Bedrock AgentCore bringt eine Pool-Modell-Mandantenfähigkeitsarchitektur mit dreistufiger Isolierung (Tier → Mandant → Nutzer), Cedar-Richtlinien für Werkzeuggrenzen und einen Token Vending Machine für Speicherisolierung — ein Referenz-SaaS-Design für Produktions-KI-Agenten.

🟢 🏥 In der Praxis 24. Juni 2026 · 2 Min. Lesezeit

OpenAI: GPT-5 Pro half, ein 3-jähriges immunologisches Rätsel über T-Zellen zu lösen

Editorial illustration: glowing T-cell structure with abstract neural network pattern in laboratory setting

GPT-5 Pro half dem Immunologen Derya Unutmaz vom Jackson Laboratory, ein dreijähriges wissenschaftliches Rätsel über das Verhalten von T-Zellen — Immunzellen, die für die Körperabwehr entscheidend sind — zu lösen, und eröffnet neue Möglichkeiten in der Krebs- und Autoimmunforschung.

🟢 🏥 In der Praxis 23. Juni 2026 · 2 Min. Lesezeit

AWS: Semantische Suche in Luftaufnahmen mit Amazon Nova Multimodal Embeddings (Vexcel)

Editorial illustration: aerial photograph grid with semantic search query overlay and highlighted detected pools and roads

Vexcel und AWS demonstrierten die semantische Suche in Luftbildern mit Amazon Nova Multimodal Embeddings. Nach Tests mit ~100 Konfigurationen verbesserten KI-generierte Beschreibungen den F1-Wert für Schwimmbäder um 11 % und für Straßen um 13 %, woraus das kommerzielle Produkt Vexcel Intelligence in 45+ Ländern entstand.

🟢 🏥 In der Praxis 23. Juni 2026 · 2 Min. Lesezeit

CNCF: Warum klassische Observability für agentische KI-Systeme und LLMs nicht funktioniert

Editorial illustration: pipelines of AI data flowing through monitoring dashboards in a cloud-native environment, abstract nodes and graphs

Der CNCF-Blog erklärt, warum klassische Systemüberwachung für KI-Agenten und LLM-Modelle, die probabilistisch arbeiten, nicht funktioniert — dieselbe Anfrage kann völlig unterschiedliche Ergebnisse liefern, und Fehler sind semantischer, nicht technischer Natur.

🟢 🏥 In der Praxis 21. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.20474: UltraQuant reduziert KV-Cache-Latenz um das 3,47-Fache mit 4-Bit-Präzision

Redaktionelle Illustration: UltraQuant reduziert die KV-Cache-Latenz um das 3,47-Fache mit 4-Bit-Präzision

UltraQuant ist eine Technik zur Komprimierung des KV-Caches auf 4-Bit-Präzision für mehrstufige LLM-Agenten. Entwickelt von AMD, UCLA und Purdue, erreicht das System eine 3,47-fach schnellere P50-TTFT in späten Runden bei hohem Kontextdruck sowie einen 1,63-fach höheren Ausgabedurchsatz im Vergleich zur FP8-Basislinie.

🟡 🏥 In der Praxis 20. Juni 2026 · 2 Min. Lesezeit

Anthropic: Claude Code v2.1.183 blockiert destruktive Git- und Infrastrukturbefehle im Auto-Modus

Redaktionelle Illustration: Terminalfenster mit Schutzschild, der rote Befehle stoppt

Claude Code v2.1.183 ist die neue Version von Anthropics CLI-Tool, veröffentlicht am 19. Juni 2026. Im Auto-Modus blockiert es destruktive Git-Befehle (git reset --hard, git clean -fd, git stash drop) sowie Infrastrukturbefehle (terraform, pulumi und cdk destroy) ohne explizite Nutzeranforderung. Die Version bringt auch Korrekturen für WebSearch in Subagenten, TUI-Korruption und MCP-Authentifizierung.

🟡 🏥 In der Praxis 20. Juni 2026 · 2 Min. Lesezeit

AWS: SageMaker erhält über 100 detaillierte Inference-Metriken und Insights-Dashboard auf CloudWatch

Redaktionelle Illustration: Überwachungs-Dashboard mit Latenz- und Token-Durchsatz-Graphen

Amazon SageMaker, AWSs Plattform für maschinelles Lernen, gibt jetzt mehr als 100 detaillierte Metriken für generativen KI-Inference an CloudWatch aus, verfügbar über das neue Insights-Dashboard. Das Dashboard zeigt Token-Level-Latenz (TTFT, Inter-Token-Latenz), KV-Cache-Tracking und Kaltstart-Diagnostik und ist über einen PromQL-Endpunkt mit Grafana und Datadog kompatibel.

🟢 🏥 In der Praxis 20. Juni 2026 · 1 Min. Lesezeit

GitHub: Copilot stellt Opus 4.6 (fast) am 29. Juni ein, fügt AGENTS.md zu Code Review hinzu und ai_credits_used-Feld zur API

Redaktionelle Illustration: Kalender mit hervorgehobenem Datum und Copilot-Symbol neben einem Kreditmesser

GitHub gab über das Changelog drei Änderungen für Copilot bekannt. Das Modell Opus 4.6 (fast) wird am 29. Juni 2026 auf allen Copilot-Oberflächen eingestellt, mit Empfehlung zum Wechsel zu Opus 4.8 (fast); Copilot Code Review liest nun Repository-AGENTS.md-Dateien; die Copilot Usage Metrics API erhält das Feld ai_credits_used zur Verfolgung des KI-Kreditverbrauchs pro Nutzer.

🟡 🏥 In der Praxis 19. Juni 2026 · 2 Min. Lesezeit

arXiv:2606.19245: TxBench-PP — KI-Agenten auf der Suche nach neuen Medikamenten

Redaktionelle Illustration: arXiv:2606.19245: TxBench-PP — KI-Agenten auf der Suche nach neuen Medikamenten

TxBench-PP ist ein Benchmark, der KI-Agenten in der präklinischen Pharmakologie kleiner Moleküle über 4.800 Trajektorien und 11 Modelle testet. Claude Opus 4.8 erreicht 59,3 % Erfolg vor GPT-5.5 mit 55,3 %, aber kein Modell erreicht die für medizinische Anwendungen nötige Zuverlässigkeit.

🟡 🏥 In der Praxis 19. Juni 2026 · 2 Min. Lesezeit

GitHub: MAI-Code-1-Flash auf 8 Entwicklungsoberflächen innerhalb von Copilot verfügbar

Redaktionelle Illustration: MAI-Code-1-Flash auf 8 Entwicklungsoberflächen innerhalb von Copilot verfügbar

MAI-Code-1-Flash, Microsofts kompaktes Coding-Modell mit best-in-class-Qualität für seine Größe, ist nun auf 8 Entwicklungsoberflächen innerhalb von GitHub Copilot verfügbar — vom CLI bis zu mobilen Plattformen — in allen Plänen von Free bis Max Tier.

🟡 🏥 In der Praxis 19. Juni 2026 · 2 Min. Lesezeit

OpenAI: KI hilft Ärzten bei der Diagnose seltener genetischer Erkrankungen bei Kindern

Redaktionelle Illustration: KI hilft Ärzten bei der Diagnose seltener genetischer Erkrankungen bei Kindern

OpenAIs Reasoning-Modell identifizierte 18 neue Diagnosen in bisher ungelösten Fällen seltener genetischer Erkrankungen bei Kindern in Zusammenarbeit mit Ärzten und Forschungseinrichtungen. Die Ergebnisse werfen neue Fragen über die Rolle von KI in der klinischen Diagnostik auf.

🟢 🏥 In der Praxis 19. Juni 2026 · 1 Min. Lesezeit

PyTorch: LLMs reduzieren GPU-Kernel-Optimierung von Minuten auf Sekunden

Redaktionelle Illustration: LLMs reduzieren GPU-Kernel-Optimierung von Minuten auf Sekunden

Das PyTorch-Core-Team veröffentlichte LLM-geführtes Autotuning für Helion-Kernel, das die GPU-Code-Optimierung von Minuten auf Sekunden beschleunigt. Statt erschöpfender Suche über alle Konfigurationen führen große Sprachmodelle die Parameterraum-Suche intelligent.

🟡 🏥 In der Praxis 18. Juni 2026 · 2 Min. Lesezeit

GitHub: Copilot-Desktop-App allgemein verfügbar — parallele Sitzungen und Cloud-Automatisierungen

Redaktionelle Illustration: Desktop-Anwendung für einen KI-Coding-Assistenten

GitHub hat bekanntgegeben, dass die Copilot-Desktop-Anwendung für macOS, Windows und Linux allgemein verfügbar ist. Die App bietet parallele Sitzungen, eine Canvas-Oberfläche, Cloud-Automatisierungen sowie die Integration eigener Modelle und Werkzeuge. Sie vereint GitHub Spark, Copilot Chat und Copilot CLI in einem einzigen Desktop-Erlebnis. Die Veröffentlichung ist Teil einer größeren Welle von Copilot-Ankündigungen am selben Tag, darunter HyDRA-Modellrouting und der für alle Nutzer verfügbare Auto-Modus.

🟡 🏥 In der Praxis 18. Juni 2026 · 2 Min. Lesezeit

IBM: Studie zeigt, dass 91 % der Unternehmen keine vollständige Sicht auf KI-Abhängigkeiten haben, Lock-in ernst

Redaktionelle Illustration: geschäftliche Abhängigkeit von KI-Anbietern und das Risiko des Lock-ins

Eine IBM-Studie zeigt, dass 91 % der Unternehmen keine vollständige Sicht auf ihre eigenen KI-Abhängigkeiten von Anbietern, Modellen und Infrastruktur haben. Ganze 71 % hätten Schwierigkeiten, ihren primären KI-Anbieter zu wechseln, und 81 % geben an, dass ein siebentägiger Anbieterausfall eine schwere oder kritische Betriebsstörung verursachen würde. Nur 7 % verfügen über erweiterte KI-Kontrollfähigkeiten, doch schützen diese Unternehmen ihren Betriebsgewinn vor Störungen um 55 % besser. Bis zu 72 % würden 20 % mehr zahlen für Anbieterflexibilität.

🟢 🏥 In der Praxis 18. Juni 2026 · 1 Min. Lesezeit

Anthropic: Claude Code v2.1.181 führt /config-Syntax und Bun 1.4 sowie Auto-Retry bei API-Ausfällen ein

Redaktionelle Illustration: Konfiguration und Zuverlässigkeit eines KI-Entwicklungswerkzeugs

Anthropic hat Claude Code v2.1.181 mit einer neuen /config-key=value-Syntax zur Konfiguration direkt aus dem Prompt sowie einem Upgrade des Bun-Runtimes auf Version 1.4 veröffentlicht. Das Release fügt automatische Wiederholungsversuche bei API-Verbindungsabbrüchen in der „Thinking”-Phase hinzu, blendet inaktive Subagenten nach 30 Sekunden aus und beschleunigt den Start in neuen Umgebungen um 120 ms. Auch das Prompt-Caching mit benutzerdefinierter ANTHROPIC_BASE_URL und Foundry wurde behoben.

🟡 🏥 In der Praxis 17. Juni 2026 · 2 Min. Lesezeit

Anthropic: Studie zu agentischem Coding — Nutzer treffen 70% der Planungsentscheidungen, Claude 80% der Ausführungsentscheidungen

Redaktionelle Illustration: Aufteilung der Entscheidungen zwischen Mensch und KI-Agent beim Programmieren

Anthropic veröffentlichte eine Wirtschaftsstudie über agentisches Coding mit Claude Code. Nutzer treffen etwa 70% der Planungsentscheidungen, während Claude etwa 80% der Ausführungsentscheidungen übernimmt. Erfahrene Nutzer erhalten 12 Aktionen und 3.200 Wörter pro Prompt gegenüber 5 Aktionen und 600 Wörtern bei Anfängern, mit verifizierten Aufgabenerfolgsquoten von 28–33% gegenüber 15%. Der Anteil der Debugging-Sitzungen sank von Oktober 2025 bis April 2026 von 33% auf 19%, während der durchschnittliche Aufgabenwert um etwa 25% stieg.

🟡 🏥 In der Praxis 17. Juni 2026 · 1 Min. Lesezeit

AWS: Container-Caching in SageMaker AI verkürzt Inferenz-Skalierungslatenz um bis zu 50%

Redaktionelle Illustration: schnellere KI-Inferenzskalierung durch Container-Image-Caching

AWS führte das Caching von Container-Images in Amazon SageMaker AI ein, das ECR-Abrufe beim Skalieren automatisch und ohne Opt-in eliminiert. Für Qwen3-8B sank die Startlatenz von 525 auf 258 Sekunden, etwa 51%. Nutzer berichten von 38–65% geringerer P50-Latenz und bis zu 2× schnellerer End-to-End-Skalierung. Die Funktion ist auf allen Beschleuniger-Instanztypen in allen kommerziellen AWS-Regionen verfügbar.

🟡 🏥 In der Praxis 17. Juni 2026 · 1 Min. Lesezeit

Google DeepMind: KI-Tool für britische Baugenehmigungen zielt auf 50% schnellere Entscheidungen und 1,5 Millionen neue Wohnungen

Redaktionelle Illustration: KI beschleunigt die Bearbeitung von Baugenehmigungen und Stadtplanung

Google DeepMind, die britische Regierung, Google Cloud und Faculty AI entwickeln einen KI-Prototyp, der auf 50% kürzere Entscheidungszeiten bei Bauanträgen abzielt. Das Ziel der Regierung sind 1,5 Millionen neue Wohnungen bis 2029. Anträge von Hauseigentümern machen fast 70% aller jährlichen Anträge aus, mit geschätzten Einsparungen von etwa 255 Stunden pro Jahr und Gemeinde. Das Tool wird derzeit in Barnet, Camden und Dorset getestet, mit geplanter landesweiter Einführung 2027.

Vollständiges Archiv ansehen →