🤝 エージェント

257 件

🟢 🤝 エージェント 2026年7月11日 · 2 分で読めます

arXiv:2607.08093:CausalDS — データサイエンスタスクにおける AI エージェントの因果推論を測定する新ベンチマーク

編集用イラスト:「原因」と「相関」と書かれた二本の絡み合った曲線を分離するエージェント

CausalDS は arXiv で発表されたベンチマークで、AI エージェントがデータサイエンスのワークフロー内で因果性と相関性を区別できるかをテストします。自律的な分析エージェントの評価における空白を埋めるものです。標準的なテストは実行ステップの正確さを測るものの、正しい因果推論の能力は測っていませんでした。

🟢 🤝 エージェント 2026年7月11日 · 2 分で読めます

arXiv:2607.08681:SolarChain-Eval — 分散型エネルギー市場の AI エージェント向け物理制約付きベンチマーク

編集用イラスト:AI エージェントがエネルギーを取引するネットワークでつながれたソーラーパネル

SolarChain-Eval は arXiv で発表されたベンチマークで、実際のシステムの物理的制約を考慮した上で分散型エネルギー市場における経済的 AI エージェントを評価します。エージェントのリスク挙動を検出する言語モデルベースの監査レイヤーを含み、AI エージェントとサイバーフィジカルエネルギーインフラを統合します。

🟡 🤝 エージェント 2026年7月10日 · 2 分で読めます

LangChain: OpenWiki BrainsがエージェントにプロアクティブなメモリをGmail・Notion・GitからMarkdownで自動収集

編集用イラスト: メール・メモ・リポジトリからMarkdownのシートでwikiを組み立てるロボット

OpenWiki BrainsはLangChainのオープンソースフレームワークで、AIエージェントにプロアクティブなメモリを付与します: 外部ソースからコンテキストを自動収集し、ディスク上のMarkdownファイルとして保存します。最初のバージョンはGmail・Notion・Git・Twitter/X・Hacker News・Web検索の6コネクターをサポートし、クラウドに依存せずスケジュールされたジョブでローカルに動作します。

🟢 🤝 エージェント 2026年7月10日 · 2 分で読めます

arXiv:2607.08403: ゲーム理論でLLMの幻覚に対抗——マルチエージェント枠組みがモデルを戦略的プレイヤーとして均衡へ

編集用イラスト: チェス盤を囲む複数のAIプレイヤーが真実に向けて手を合わせる様子

本論文は、大規模言語モデルの幻覚を減らすためにゲーム理論を活用したマルチエージェント枠組みを提案します。モデル間の相互作用を戦略的プレイヤーによるゲームとして定式化し、均衡(equilibrium)が一貫した非幻覚的な回答に対応するよう設計することで、標準的なRLHFやRAGとは異なるアプローチを提供します。

🟡 🤝 エージェント 2026年7月9日 · 2 分で読めます

arXiv:2607.06906:「Harness Effect」——オーケストレーション設計が AI エージェントのコストを 41% 削減、モデル変更より効果的

編集イラスト:指揮棒がモデルとツールの間のトークンの流れを指揮している

Harness Effect は 32 名の著者による実証研究の発見で、オーケストレーション層の設計が AI エージェントのコストに与える影響はモデルの選択より大きいことを示しています。22 タスク・6 モデルにわたって、最適化されたオーケストレーションはタスクあたりコストを 41%(0.21 から 0.12 ドル)、トークンを 38%、実行時間を 44% 削減しつつ品質を向上させました。

🟡 🤝 エージェント 2026年7月9日 · 2 分で読めます

IBM: Bob がマルチエージェントプラットフォームに——COBOL 現代化の 9 か月プロジェクトが 3 日で完了

編集イラスト:メインフレームの筐体から小さなエージェントの群れがコードを現代的なサーバーに運んでいる

IBM Bob はソフトウェア開発向けエージェントプラットフォームで、新バージョンで開発ライフサイクル全体をカバーするマルチエージェントアーキテクチャ、Bobalytics 分析、COBOL と PL/I のメインフレーム現代化向け Premium パッケージを獲得しました。IBM はクライアント Blue Pearl が Bob を使って 9 か月の現代化プロジェクトを 3 日で完了したと報告しています。

🟡 🤝 エージェント 2026年7月9日 · 2 分で読めます

OpenAI: ChatGPT が本格的な仕事のエージェントに——アプリをまたいで操作し、何時間も自律的に作業して成果を出す

編集イラスト:複数の画面を持つ作業デスクに自動化タスクフローが流れている

ChatGPT Work は OpenAI のエージェント的な作業への大きな転換です。ChatGPT はアプリやファイルをまたいでアクションを実行し、プロジェクトを何時間も自律的に処理して目標を完成した成果に変えます。OpenAI はこれを最も野心的なタスクのパートナーとして位置づけ、Anthropic や GitHub のエージェント製品と直接競合します。

🟡 🤝 エージェント 2026年7月8日 · 4 分で読めます

プローブのカスケードが第1ステップの隠れた活性化からAIエージェントの失敗を予測し、トークンを最大47%節約

エディトリアルイラスト:ニューラルネットワークの隠れた状態から失敗に確定したエージェントエピソードの予測と早期中止

研究者たちがLLMエージェントの隠れた活性化に対する軽量プローブを開発した。インタラクションの第1ステップですでに「失敗が確定した」エピソードを検出し、90%リコール保証のもとでQwen-2.5-7Bで47.1%、Llama-3.2-3Bで37.2%のトークン消費削減を達成する。

🟡 🤝 エージェント 2026年7月8日 · 4 分で読めます

反復的な反省がLLMに指数関数的な改善をもたらす条件を形式理論が正確に定義

エディトリアルイラスト:AIシステムの推論を改善する自己分析とコンテキスト内検索の条件に関する理論

研究者Wolf・Wies・Shashuaは、LLMの自己改善が確実に誤りを局所化できる場合にのみ指数関数的な利得をもたらすことを証明するベイズ理論的フレームワークを開発した。そうでない場合、逐次的な試みは並列サンプリングに対して漸近的な優位性をもたらさない。

🟡 🤝 エージェント 2026年7月8日 · 4 分で読めます

LangChainとNVIDIAがNemoClawを発表:オープンエージェントスタックが競合の10倍低コストを実現

エディトリアルイラスト:Nemotron 3 Ultraアーキテクチャを採用したLangChainとNVIDIAのNemoClawオープンエージェントセット

LangChainとNVIDIAは共同でNemoClaw——Nemotron 3 Ultraモデル、LangChain Deep Agents Codeハーネス、OpenShellランタイムを組み合わせたオープンブループリントを発表した。評価1件あたり4.48ドルで集計スコア0.86を達成し、次点の競合43.48ドルに対して約10倍安価で、完全なセルフホスト型データ管理を実現する。

🟡 🤝 エージェント 2026年7月7日 · 4 分で読めます

LLM-as-a-Verifier:検証は言語モデルの新しい第4のスケーリング軸

エディトリアルイラスト:LLMが検証者として機能し、検証がAIモデルスケーリングの新次元に

スタンフォードとUCバークレーの研究者らが検証――解答の正しさを評価する能力――をLLMにとってこれまでのパラダイムと直交する新しいスケーリング軸として特定した。このフレームワークは連続的な検証スコアを生成し、Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)、MedAgentBench(73.3%)の4つのベンチマークでSOTAを達成する。

🟡 🤝 エージェント 2026年7月7日 · 4 分で読めます

GoogleがGemini APIのManaged Agentsを本番環境向けに拡張

エディトリアルイラスト:GoogleがGemini APIのマネージドエージェントを開発者向けに拡張

GoogleはGemini APIにバックグラウンド実行、リモートMCP統合、カスタム関数呼び出し、クレデンシャル更新の4機能を追加した。これにより開発者はプロトタイプ環境を超えてエージェントをデプロイできるようになる。

🟡 🤝 エージェント 2026年7月7日 · 5 分で読めます

LangChain:エージェントの改善はデータマイニングの問題だ

エディトリアルイラスト:LangChainエージェントと実行トレースのデータマイニングによるオブザーバビリティ向上

LangChainのVivek Trivedyは、AIエージェントを体系的に改善することは本質的に実行トレースを大規模にマイニングする問題だと主張する。推奨される順序はハーネスエンジニアリング、次にファインチューニング、次に追加のハーネス最適化だ。重要なアドバイス:データ収集ループを開始するために早期にエージェントをデプロイせよ。

🟢 🤝 エージェント 2026年7月7日 · 4 分で読めます

Claude Code v2.1.203――セッション期限切れ警告、小さなバイナリ、高速起動

エディトリアルイラスト:ログイン期限切れ修正とセッション復旧を搭載したClaude Code v2.1.203

Anthropicは7月7日にClaude Code v2.1.203をリリースした。ログイントークンの期限切れ警告、フリーズしたバックグラウンドセッションの自動復旧、バイナリサイズの約7MB削減が含まれる。またmacOSの速度低下やサブエージェントの動作を妨げていたバグも修正されている。

🟢 🤝 エージェント 2026年7月7日 · 4 分で読めます

AgentGym2:新ベンチマークがLLMエージェントを非理想的な条件でテスト

エディトリアルイラスト:AgentGym2ベンチマーク:AIウェブエージェントの非理想化リアルタスク

研究者らがAgentGym2を公開した。15のLLMエージェントを不完全な情報と未知のツールを持つ現実的な条件でテストする評価フレームワークだ。GPT-5やGeminiを含むすべてのモデルが大幅に失敗し、現在の技術と本番デプロイの要件の間の大きなギャップを明らかにした。ACL 2026に採択。

🟡 🤝 エージェント 2026年7月3日 · 4 分で読めます

Claude Code v2.1.200:デフォルトのパーミッションモードがManualに変更

エディトリアルイラスト:新しいセキュリティ修正と手動パーミッションを備えたClaude Code CLIエージェント

Anthropicは2026年7月3日にClaude Code v2.1.200をリリースした。デフォルトのパーミッションモードがすべてのインターフェースでManualに変更され、AskUserQuestionダイアログは明示的な設定なしには自動継続しなくなった。デーモン乗っ取りのセキュリティ脆弱性が修正され、バックグラウンドセッションおよびサブエージェントのレート制限処理が改善、tmux 3.4以降でのレンダリングフリッカーも解消された。

🟡 🤝 エージェント 2026年7月2日 · 3 分で読めます

ICML 2026研究:SFTとRLエージェントは制御されたベンチマーク外で劇的に性能が低下

編集イラスト:ツール使用時の分布シフトにおけるAIエージェントの脆弱性と汎化ロバスト性

ICML 2026で採択された論文は、ツール使用LLMエージェントを4つのレベル——知覚・インタラクション・推論・内在化——にわたる環境のシフト下で体系的にテストする。発見:SFTとRLの両トレーニングは分布シフトが軽微でも大幅な性能劣化を示し、制御されたベンチマークの精度は実際のロバスト性を予測しない。PAFT(Perturbation-Augmented Fine-Tuning)が軽減策として提案される。

🟡 🤝 エージェント 2026年7月2日 · 3 分で読めます

SEA:リアルタイムの形式的安全保証を持つ自己修正エージェント

編集イラスト:形式的安全証明書と動作検証を持つ自己進化AIエージェント

SEA(Self-Evolving Agents with Anytime-Valid Certificates)アーキテクチャは、形式的な学習理論的保証を維持しながらエージェントが自身のパラメータを更新できるようにする。5つの検証メカニズムと監査可能な証明書が各自己修正をリアルタイムで承認または却下し、SWE-bench Verified評価では強力なベースモデル上で+4〜+5のインスタンス解決を達成した。

🟡 🤝 エージェント 2026年7月2日 · 4 分で読めます

GitHub Copilotエージェントがパブリックプレビューでセッションストリーミングを取得

編集イラスト:パブリックプレビューにおけるGitHub Copilotエージェントセッションのライブストリーミング

GitHubはCopilotエージェントのセッションストリーミングのパブリックプレビューを開始した。これによりエンタープライズ組織は、すべてのCopilotクライアントでエージェントが実行するプロンプト、レスポンス、ツール呼び出しへの直接アクセスが得られる。

🟢 🤝 エージェント 2026年7月2日 · 3 分で読めます

AutoMem:人手なしに記憶管理を学習する認知スキルとしてのメモリ

編集イラスト:認知スキルとして学習可能なメモリ——エージェントの学習と記憶のためのグラフエンジン

スタンフォードの研究者たちはAutoMem——何を記憶するか、いつ忘れるかを自動的に学習する2つの最適化ループを持つシステム——を開発した。人手によるアノテーションなしで、ベースラインに対して2〜4倍の改善を達成した。

🟡 🤝 エージェント 2026年7月1日 · 4 分で読めます

Claude Code v2.1.198: バックグラウンドエージェントが自動でPRを作成、/datavizスキル追加

エディトリアルイラスト: Claude Codeエージェントビューがプルリクエストとバックグラウンドエージェントを自動化

AnthropicはClaude Code v2.1.198をリリースした。主な変更点として、worktree内で動作するバックグラウンドエージェントが停止・確認不要で自動的にコミット・プッシュ・ドラフトプルリクエストを作成するようになった。Claude in ChromeがGA(一般提供)に到達し、グラフデザイン向けの新しい/datavizスキルが追加され、AWSがアップストリームゲートウェイプロバイダーとして追加された。

🟡 🤝 エージェント 2026年7月1日 · 4 分で読めます

AWSが190のポイントツーポイント接続を中央レジストリに置き換えるサーバーレスA2Aゲートウェイを発表

エディトリアルイラスト: エージェント間通信とルート探索のためのAWSサーバーレスゲートウェイ

Amazon Web ServicesはAIエージェント間のディスカバリ、ルーティング、アクセス制御を集中化するサーバーレスA2Aゲートウェイのリファレンスアーキテクチャを公開した。20のエージェントが連携なしに動作すると最大190の接続が発生するが、ゲートウェイはそれを1つの入口ポイントに集約する。

🟡 🤝 エージェント 2026年7月1日 · 4 分で読めます

AWS AgentCore Memoryがメタデータフィルタリングを導入——精度が40%から64%に向上

エディトリアルイラスト: AIエージェント向けメタデータフィルタリングを備えたAWS AgentCoreメモリスペース

Amazon Bedrock AgentCore Memoryがセマンティック検索の前に適用される属性メタデータフィルタリングを導入した。151問のベンチマークで全体の精度が40%から64%に向上し、コンテキスト依存クエリでは16%から69%に改善した。

🟡 🤝 エージェント 2026年7月1日 · 3 分で読めます

LangChainがRLMエージェントを導入:再帰モデルが長いコンテキストで79%高い精度を達成

エディトリアルイラスト: LangChainのDeepAgentsとQuickJSオーケストレーターによる長いコンテキスト処理

LangChainはDeepAgentsフレームワークを通じてRecursive Language Models(RLM)を導入した。モデルがコンテキスト全体を一つのウィンドウに詰め込む代わりに、入力の断片に対して自分自身を再帰的に呼び出すアプローチだ。128kトークンのOOLONGベンチマークタスクで、RLMエージェントは標準エージェントの0.44に対し0.79を記録し、79%の改善を達成した。

🟡 🤝 エージェント 2026年6月30日 · 4 分で読めます

Claude Sonnet 5がGitHub Copilotに登場、JetBrainsにはエージェントモード:開発チームへの二重の恩恵

エディトリアルイラスト:GitHub CopilotがClaude Sonnet 5とJetBrains IDEへのエージェントモードを導入

AnthropicがClaude Sonnet 5を公開した同日、GitHub CopilotはすべてのプラットフォームでSonnet 5を一般提供(GA)開始し、Copilot AgentモードがVS CodeからJetBrains開発環境——IntelliJ、PyCharm、GoLand、WebStorm——へ拡大された。

🟡 🤝 エージェント 2026年6月30日 · 3 分で読めます

SkillOpt:Microsoft Researchがエージェントの指示ファイルを訓練可能パラメータとして扱う

エディトリアルイラスト:Microsoft SkillOptがエージェントのスキルを最適化のための訓練可能パラメータとして扱う

Microsoft Researchは、モデルの重みに触れることなく反復的なforward-backwardサイクルでエージェントのスキルファイルを最適化するシステム「SkillOpt」を発表した。52の評価セルで最良または同等の結果を達成し、最適化されたスキルを持つGPT-5.5の平均精度は58.8%から82.3%に向上した。

🟢 🤝 エージェント 2026年6月30日 · 3 分で読めます

TRIAGE:エージェント強化学習において適切なトークンに適切なクレジットを割り当てる方法

エディトリアルイラスト:TRIAGE手法によるエージェント強化学習での役割別クレジット割り当て

研究者たちはTRIAGEを提案した——軌跡セグメントを四つの意味的役割に分類し、すべてのトークンを均一に扱うGRPOとは異なり、各役割に異なる報酬シグナルを割り当てるフレームワーク。ALFWorld、Search-QA、WebShopベンチマークでTRIAGEは環境へのアクション数を10.4〜14.8%削減する。

🔴 🤝 エージェント 2026年6月29日 · 3 分で読めます

Microsoft Research: Memora — AIエージェントの記憶を最大98%少ないトークンとSOTAの長期会話で実現

エディトリアルイラスト:最大98%少ないトークンと長期会話SOTAによるAIエージェントの記憶Memora、テキストと顔なし

MemoraはMicrosoft Researchによる長期ホライズンAIエージェント向けのスケーラブルな記憶フレームワークです。何を保存するかと何を取得するかを分離するハーモニックアーキテクチャ、キューアンカー、ポリシー駆動型リトリーバーを導入します。LoCoMoおよびLongMemEvalベンチマークでSOTAを達成し、全コンテキストアプローチと比べてトークン消費を最大98%削減します。

🟡 🤝 エージェント 2026年6月29日 · 2 分で読めます

arXiv:2606.27483: Internalizing the Future — LLMエージェントの世界モデル計画のための統一的なトレーニングパラダイム

エディトリアルイラスト:LLMエージェントの世界モデル計画のための統一的なトレーニングパラダイム、テキストと顔なし

Internalizing the Futureは、Xuan Zhangら9名のTencent研究者が2026年6月25日にarXivに投稿したプレプリントです。世界モデル能力 — 将来の状態の予測を生成し、計画の成功を評価する能力 — をLLMエージェントに付与する3段階のトレーニング(WM-AMT、FE-SFT、FC-RL)を提案します。単なる反応的な対応に替わる手法です。

🟡 🤝 エージェント 2026年6月29日 · 2 分で読めます

LangChain: Deep AgentsのDynamic Subagents — エージェントが数百のサブエージェントを並列ディスパッチするコードを記述

エディトリアルイラスト:数百のサブエージェントを並列ディスパッチするコードを記述するDynamic Subagents、テキストと顔なし

Dynamic SubagentsはLangChain Deep Agentsフレームワーク内のオーケストレーションアーキテクチャで、モデルが数百のサブエージェントを並列ディスパッチするJavaScriptスクリプトを記述できます。QuickJSインタープリタがスクリプトを決定論的に実行し、300以上の逐次的なツール呼び出しを排除します。6つのオーケストレーションパターンを定義しています。

🟢 🤝 エージェント 2026年6月29日 · 2 分で読めます

Microsoft: 2026 Agent Confidence Index — 300人のビルダーがAIエージェントへの平均信頼度64/100と評価

エディトリアルイラスト:300人のビルダーがAIエージェントへの平均信頼度64/100と評価した2026 Agent Confidence Index、テキストと顔なし

2026 Agent Confidence IndexはMicrosoftがMIT Technology Review Insightsと共同で実施した調査で、12業種の300人の技術専門家にAIエージェントへの101のタスクにおける信頼度を尋ねました。平均スコアは64/100で、70点を超えるのは30のタスクのみ、59%の専門家が主な懸念事項として人間のループ維持を挙げています。

🟢 🤝 エージェント 2026年6月28日 · 2 分で読めます

arXiv:2606.26806:EVAFがエージェントの記憶をモデルパラメータに統合しコンテキスト削除後も目標を維持

編集用イラスト:削除後も残るネットワーク構造に刻み込まれた痕跡、テキストと顔なし

arXiv:2606.26806の研究者Haoliang Hanによる研究はEVAFを提案しています。これはgated LoRA統合メカニズムで、長期動作エージェントにとって作業コンテキストが削除された後も目標を維持します。EVAFは200イベントにつきわずか2〜3件のパラメータ書き込みのみを必要とし、目標持続性(0.812〜0.904)に優れており、一方でRAGは事実的想起(0.956〜0.973)でリードします。

🟡 🤝 エージェント 2026年6月27日 · 2 分で読めます

arXiv:2606.26758: EGG——マルチエージェントフレームワークがPyTorch比2.13倍高速なGPUカーネルを生成

Editorial illustration: multi-agent sustav optimizira GPU dijagram s tokovima podataka i blokirajućim matricama, bez lica

EGGはLLM推論向けに最適化されたGPUカーネルを自動生成するマルチエージェントフレームワークです。アルゴリズム構造の設計とハードウェア固有のチューニングの2段階アプローチにより、KernelBenchでPyTorchベースラインと比較して平均2.13倍の高速化を達成し、エージェントベースおよびRLベースのアプローチの両方を上回っています。

🟡 🤝 エージェント 2026年6月27日 · 2 分で読めます

AWS:Stripeが金融コンプライアンス向けに100以上のAIエージェントを本番稼働——現場からの教訓

Editorial illustration: クラウドインフラ内で金融取引を監視するAIエージェントのネットワーク

StripeとAWSは、年間1.4兆ドルを処理するプラットフォームが1年足らずで金融コンプライアンス向けに100以上のAIエージェントを稼働させた経緯を公開しました。ReActフレームワークとAmazon Bedrockを基盤とするエージェントは、審査時間26%短縮、不正検出率95%、コスト60%削減を実現しました。

🟢 🤝 エージェント 2026年6月27日 · 2 分で読めます

arXiv:2606.26649: エージェントへの指示を形式検証済みのpolicy-as-codeに変換

Editorial illustration: robotic arm converting text documents into verified code blocks on a secure policy shield

研究者たちはAIエージェントへの自然言語指示・MCPツール説明・ポリシー文書をCedar Policy LanguageとLLMのgenerator-criticループを用いて形式検証済みコードへと自動変換するパイプラインを開発しました。従来の手書きシンボリックエンフォースメントより仕様カバレッジが大幅に向上しています。

🟢 🤝 エージェント 2026年6月27日 · 2 分で読めます

Anthropic:Claude Code v2.1.195——マウス無効化、音声ディクテーション改善、フックの修正

Editorial illustration: Claude Codeロゴ、フックアイコン、音声波形を表示するダークバックグラウンドのターミナルインターフェイス

Claude Code v2.1.195はフルスクリーンモードでのマウスクリックを無効にする新しい環境変数、ハイフン付きフックマッチャーの修正、macOSでのCJK言語向け音声ディクテーション改善をもたらす小規模なQoLアップデートです。

🟢 🤝 エージェント 2026年6月27日 · 2 分で読めます

LangChain:Deep AgentsフレームワークのプロンプトキャッシングでLLMエージェントの遅延を削減

Editorial illustration: robot agent with layered memory cache diagram, circuit background, no text or faces

LangChainはDeep Agentsフレームワークにプロンプトキャッシング——エージェントのステップ間で以前に計算されたコンテキストを再利用する技術——を導入しました。長時間実行エージェントの遅延とコスト削減を目的としています。

🔴 🤝 エージェント 2026年6月26日 · 3 分で読めます

arXiv:2606.25996: Autodata — データサイエンティストとして高品質な合成データを生成するAIエージェント(Meta FAIR)

編集用イラスト:近代的な研究室でデータチャートと合成データパイプラインを調べるロボット科学者

AutodataはMeta FAIRのシステムで、AIエージェントがデータサイエンティストの役割を担い、高品質な合成データセットを自律的に構築します。Agentic Self-Instructメソッドがエージェント自身をメタ最適化し、CS研究・法律・数学的推論の各ドメインで静的ベースラインを一貫して上回る成果を示しています。

🟡 🤝 エージェント 2026年6月26日 · 3 分で読めます

Anthropic:Claude Code v2.1.193 — シェルコマンド用オートモード分類器とOpenTelemetryロギング

編集用イラスト:シェル分類器とテレメトリロギングを表示するターミナルインターフェース(顔なし)

Claude Code v2.1.193は2026年6月25日にリリースされたアップデートです。すべてのBashおよびPowerShellコマンドをオートモードにルーティングする分類器を導入し、UIに拒否理由を追加し、エンタープライズオブザーバビリティのための新しいOpenTelemetryログイベントを提供しています。

🟡 🤝 エージェント 2026年6月26日 · 2 分で読めます

LangChain:LangSmith Fleet On-Call Copilot、Computer Use、Deep Agents RubricMiddleware

編集用イラスト:アラートトリアージエージェントと隔離VM環境アイコンを持つLangSmithダッシュボード

LangChainは6月のニュースレターでアラートの自動トリアージを行うFleet On-Call Copilot、エージェント用の隔離VMを持つComputer Use、BoxのAgent開発を3倍速め、Harmonicのユーザー維持率を4倍向上させたオープンソースRubricMiddlewareを発表しました。

🟡 🤝 エージェント 2026年6月26日 · 2 分で読めます

OpenAI:エージェントが仕事を変える方法 — Codexが週500万ユーザー、400%成長

編集用イラスト:現代のオフィスでロボットアームと人間の手が輝くデジタルワークフローで協力している

OpenAIはビジネス環境でのAIエージェントの爆発的な成長を報告しています。Codexは2026年に400%成長して週500万ユーザーを達成し、30分以上の人間の作業を置き換えるタスクの割合は80.6%に達しました。

🔴 🤝 エージェント 2026年6月25日 · 3 分で読めます

Google: Gemini 3.5 FlashにComputer Use — ブラウザ・スマホ・デスクトップ対応エージェント

エディトリアルイラスト: 複数の画面でブラウザとモバイルインターフェースを操作するAIエージェント

GoogleはGemini 3.5 FlashにComputer Useツールを統合し、AIエージェントがブラウザ、モバイルデバイス、デスクトップアプリケーションを自律的に操作できるようにしました。モデルはこれまでで最高のOSWorldスコアを達成し、プロンプトインジェクション攻撃に対するエンタープライズ保護も備えています。

🟡 🤝 エージェント 2026年6月25日 · 2 分で読めます

Anthropic: Claude Code v2.1.191 — /rewindコマンド、CPU使用率37%削減、MCPリトライロジック

エディトリアルイラスト: rewindアイコンとCPU最適化アイコンが表示されたClaude Codeインターフェースのターミナル画面

Claude Code v2.1.191は2026年6月24日に公開されたアップデートで、/clear後の会話再開のための/rewindコマンドを導入し、ストリーミングのCPU消費を37%削減、一時的なネットワークエラー向けMCPリトライロジックと承認済みサンドボックスホストの記憶機能を追加しました。

🟢 🤝 エージェント 2026年6月25日 · 2 分で読めます

LangChain: AIエージェントに記憶を持たせる方法 — LangSmithでcapture・analyze・update

エディトリアルイラスト: capture・analyze・updateのラベルが付いたAIエージェントの3フェーズ記憶サイクルの概略図

LangChainはAIエージェントに記憶を追加するための実践的なガイドを発表しました。LangSmith Observability、Engine、Context Hubツールを使った3フェーズのサイクル(キャプチャ、分析、更新)で構成されています。

🔴 🤝 エージェント 2026年6月24日 · 3 分で読めます

Anthropic: Claude TagがSlackチームに直接マルチプレイヤーAIエージェントをもたらす

編集用イラスト:1つのAIエージェントを共有する複数ユーザーのSlackチャンネル、チームインターフェース内のメッセージとタグ

Claude TagはAnthropicの新製品で、チームがSlackチャンネルで@Claudeをタグ付けできます。チャンネルごとに共有された1つのエージェントが何時間・何日間も非同期で作業し、会話のコンテキストを記憶し、重要な情報を積極的にフラグします。Anthropicのプロダクトチームの内部版ではコードの65%が生成されました。

🟡 🤝 エージェント 2026年6月24日 · 3 分で読めます

Anthropic: Claude Code v2.1.187 — サンドボックス認証情報保護、組織モデル制限、CJKバグ修正

編集用イラスト:ロックアイコンと認証情報保護を表示したClaude Codeインターフェースのターミナル画面

Claude Code v2.1.187は2026年6月23日にリリースされたアップデートです。サンドボックスからシークレット変数の読み取りを禁止するsandbox.credentials設定、組織によるモデルピッカー制限、MCPコール停止のバグ修正、およびターミナルでのCJK文字化けの修正が含まれています。

🟡 🤝 エージェント 2026年6月24日 · 2 分で読めます

GitHub: CopilotがBYOKサポートで新しいCLIターミナルインターフェースを一般提供

編集用イラスト:タブとAIアシスタントインターフェースを持つターミナルウィンドウ、背景にGitHub Copilotのロゴ

GitHub Copilot CLIターミナルインターフェースが一般提供(GA)になりました。新しいBYOK(Bring Your Own Key)オプションにより、ユーザーはCopilotの必須モデルレイヤーなしにOpenAI、Anthropic、Ollama、その他のプロバイダーの独自APIキーを使用できます。

🟡 🤝 エージェント 2026年6月24日 · 2 分で読めます

NVIDIA: Agent Toolkit——NemotronモデルによるエンタープライズAIエージェントのオープン基盤

編集用イラスト:接続されたエンタープライズシステムを持つNVIDIA Agent Toolkitアーキテクチャのモジュール表示、顔とテキストなし

NVIDIA Agent Toolkitは、Nemotronオープンモデル、NemoClawガードレール、OpenShellセキュアランタイムを組み合わせたエンタープライズAIエージェント構築のためのオープンプラットフォームです。CrowdStrikeなどのパートナーはすでにセキュリティアラートのトリアージで98.5%の精度を達成しており、数ヶ月かかっていた研究が数日で完了しています。

🟢 🤝 エージェント 2026年6月24日 · 2 分で読めます

arXiv:2606.22844: RaMem——長期エージェントメモリのコンテキスト崩壊を解決

Editorial illustration: robotic agent retrieving glowing memory fragments organized by time and session context

RaMeMは、エージェントメモリシステムにおけるコンテキスト崩壊——圧縮されたフラグメントが周囲のコンテキストを失い、同等に関連性があるように誤って取得される状態——を防ぐ4フェーズのフレームワークです。長期メモリベンチマークで既存のベースラインと比較して平均F1スコアが10%以上向上しました。

🟢 🤝 エージェント 2026年6月24日 · 2 分で読めます

CNCF: Agent Auth——AIエージェントのための安全なIDと権限委任

編集用イラスト:エージェントとユーザーIDの間を通過するトークンを持つクラウドネイティブアーキテクチャ、委任の象徴的な表現

CNCFはAIエージェントが独自の暗号化IDと権限委任メカニズムを必要とする理由を解説しています。On-Behalf-Ofトークンはエージェントのアイデンティティとユーザーのプリンシパルの両方を明示的に定義されたスコープとともに運びます——従来のユーザーのみの認証モデルに欠けているすべてがここにあります。

アーカイブ全体を見る →