arXiv:2607.08093:CausalDS — データサイエンスタスクにおける AI エージェントの因果推論を測定する新ベンチマーク
CausalDS は arXiv で発表されたベンチマークで、AI エージェントがデータサイエンスのワークフロー内で因果性と相関性を区別できるかをテストします。自律的な分析エージェントの評価における空白を埋めるものです。標準的なテストは実行ステップの正確さを測るものの、正しい因果推論の能力は測っていませんでした。
257 件
CausalDS は arXiv で発表されたベンチマークで、AI エージェントがデータサイエンスのワークフロー内で因果性と相関性を区別できるかをテストします。自律的な分析エージェントの評価における空白を埋めるものです。標準的なテストは実行ステップの正確さを測るものの、正しい因果推論の能力は測っていませんでした。
SolarChain-Eval は arXiv で発表されたベンチマークで、実際のシステムの物理的制約を考慮した上で分散型エネルギー市場における経済的 AI エージェントを評価します。エージェントのリスク挙動を検出する言語モデルベースの監査レイヤーを含み、AI エージェントとサイバーフィジカルエネルギーインフラを統合します。
OpenWiki BrainsはLangChainのオープンソースフレームワークで、AIエージェントにプロアクティブなメモリを付与します: 外部ソースからコンテキストを自動収集し、ディスク上のMarkdownファイルとして保存します。最初のバージョンはGmail・Notion・Git・Twitter/X・Hacker News・Web検索の6コネクターをサポートし、クラウドに依存せずスケジュールされたジョブでローカルに動作します。
本論文は、大規模言語モデルの幻覚を減らすためにゲーム理論を活用したマルチエージェント枠組みを提案します。モデル間の相互作用を戦略的プレイヤーによるゲームとして定式化し、均衡(equilibrium)が一貫した非幻覚的な回答に対応するよう設計することで、標準的なRLHFやRAGとは異なるアプローチを提供します。
Harness Effect は 32 名の著者による実証研究の発見で、オーケストレーション層の設計が AI エージェントのコストに与える影響はモデルの選択より大きいことを示しています。22 タスク・6 モデルにわたって、最適化されたオーケストレーションはタスクあたりコストを 41%(0.21 から 0.12 ドル)、トークンを 38%、実行時間を 44% 削減しつつ品質を向上させました。
IBM Bob はソフトウェア開発向けエージェントプラットフォームで、新バージョンで開発ライフサイクル全体をカバーするマルチエージェントアーキテクチャ、Bobalytics 分析、COBOL と PL/I のメインフレーム現代化向け Premium パッケージを獲得しました。IBM はクライアント Blue Pearl が Bob を使って 9 か月の現代化プロジェクトを 3 日で完了したと報告しています。
ChatGPT Work は OpenAI のエージェント的な作業への大きな転換です。ChatGPT はアプリやファイルをまたいでアクションを実行し、プロジェクトを何時間も自律的に処理して目標を完成した成果に変えます。OpenAI はこれを最も野心的なタスクのパートナーとして位置づけ、Anthropic や GitHub のエージェント製品と直接競合します。
研究者たちがLLMエージェントの隠れた活性化に対する軽量プローブを開発した。インタラクションの第1ステップですでに「失敗が確定した」エピソードを検出し、90%リコール保証のもとでQwen-2.5-7Bで47.1%、Llama-3.2-3Bで37.2%のトークン消費削減を達成する。
研究者Wolf・Wies・Shashuaは、LLMの自己改善が確実に誤りを局所化できる場合にのみ指数関数的な利得をもたらすことを証明するベイズ理論的フレームワークを開発した。そうでない場合、逐次的な試みは並列サンプリングに対して漸近的な優位性をもたらさない。
LangChainとNVIDIAは共同でNemoClaw——Nemotron 3 Ultraモデル、LangChain Deep Agents Codeハーネス、OpenShellランタイムを組み合わせたオープンブループリントを発表した。評価1件あたり4.48ドルで集計スコア0.86を達成し、次点の競合43.48ドルに対して約10倍安価で、完全なセルフホスト型データ管理を実現する。
スタンフォードとUCバークレーの研究者らが検証――解答の正しさを評価する能力――をLLMにとってこれまでのパラダイムと直交する新しいスケーリング軸として特定した。このフレームワークは連続的な検証スコアを生成し、Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)、MedAgentBench(73.3%)の4つのベンチマークでSOTAを達成する。
GoogleはGemini APIにバックグラウンド実行、リモートMCP統合、カスタム関数呼び出し、クレデンシャル更新の4機能を追加した。これにより開発者はプロトタイプ環境を超えてエージェントをデプロイできるようになる。
LangChainのVivek Trivedyは、AIエージェントを体系的に改善することは本質的に実行トレースを大規模にマイニングする問題だと主張する。推奨される順序はハーネスエンジニアリング、次にファインチューニング、次に追加のハーネス最適化だ。重要なアドバイス:データ収集ループを開始するために早期にエージェントをデプロイせよ。
Anthropicは7月7日にClaude Code v2.1.203をリリースした。ログイントークンの期限切れ警告、フリーズしたバックグラウンドセッションの自動復旧、バイナリサイズの約7MB削減が含まれる。またmacOSの速度低下やサブエージェントの動作を妨げていたバグも修正されている。
研究者らがAgentGym2を公開した。15のLLMエージェントを不完全な情報と未知のツールを持つ現実的な条件でテストする評価フレームワークだ。GPT-5やGeminiを含むすべてのモデルが大幅に失敗し、現在の技術と本番デプロイの要件の間の大きなギャップを明らかにした。ACL 2026に採択。
Anthropicは2026年7月3日にClaude Code v2.1.200をリリースした。デフォルトのパーミッションモードがすべてのインターフェースでManualに変更され、AskUserQuestionダイアログは明示的な設定なしには自動継続しなくなった。デーモン乗っ取りのセキュリティ脆弱性が修正され、バックグラウンドセッションおよびサブエージェントのレート制限処理が改善、tmux 3.4以降でのレンダリングフリッカーも解消された。
ICML 2026で採択された論文は、ツール使用LLMエージェントを4つのレベル——知覚・インタラクション・推論・内在化——にわたる環境のシフト下で体系的にテストする。発見:SFTとRLの両トレーニングは分布シフトが軽微でも大幅な性能劣化を示し、制御されたベンチマークの精度は実際のロバスト性を予測しない。PAFT(Perturbation-Augmented Fine-Tuning)が軽減策として提案される。
SEA(Self-Evolving Agents with Anytime-Valid Certificates)アーキテクチャは、形式的な学習理論的保証を維持しながらエージェントが自身のパラメータを更新できるようにする。5つの検証メカニズムと監査可能な証明書が各自己修正をリアルタイムで承認または却下し、SWE-bench Verified評価では強力なベースモデル上で+4〜+5のインスタンス解決を達成した。
GitHubはCopilotエージェントのセッションストリーミングのパブリックプレビューを開始した。これによりエンタープライズ組織は、すべてのCopilotクライアントでエージェントが実行するプロンプト、レスポンス、ツール呼び出しへの直接アクセスが得られる。
スタンフォードの研究者たちはAutoMem——何を記憶するか、いつ忘れるかを自動的に学習する2つの最適化ループを持つシステム——を開発した。人手によるアノテーションなしで、ベースラインに対して2〜4倍の改善を達成した。
AnthropicはClaude Code v2.1.198をリリースした。主な変更点として、worktree内で動作するバックグラウンドエージェントが停止・確認不要で自動的にコミット・プッシュ・ドラフトプルリクエストを作成するようになった。Claude in ChromeがGA(一般提供)に到達し、グラフデザイン向けの新しい/datavizスキルが追加され、AWSがアップストリームゲートウェイプロバイダーとして追加された。
Amazon Web ServicesはAIエージェント間のディスカバリ、ルーティング、アクセス制御を集中化するサーバーレスA2Aゲートウェイのリファレンスアーキテクチャを公開した。20のエージェントが連携なしに動作すると最大190の接続が発生するが、ゲートウェイはそれを1つの入口ポイントに集約する。
Amazon Bedrock AgentCore Memoryがセマンティック検索の前に適用される属性メタデータフィルタリングを導入した。151問のベンチマークで全体の精度が40%から64%に向上し、コンテキスト依存クエリでは16%から69%に改善した。
LangChainはDeepAgentsフレームワークを通じてRecursive Language Models(RLM)を導入した。モデルがコンテキスト全体を一つのウィンドウに詰め込む代わりに、入力の断片に対して自分自身を再帰的に呼び出すアプローチだ。128kトークンのOOLONGベンチマークタスクで、RLMエージェントは標準エージェントの0.44に対し0.79を記録し、79%の改善を達成した。
AnthropicがClaude Sonnet 5を公開した同日、GitHub CopilotはすべてのプラットフォームでSonnet 5を一般提供(GA)開始し、Copilot AgentモードがVS CodeからJetBrains開発環境——IntelliJ、PyCharm、GoLand、WebStorm——へ拡大された。
Microsoft Researchは、モデルの重みに触れることなく反復的なforward-backwardサイクルでエージェントのスキルファイルを最適化するシステム「SkillOpt」を発表した。52の評価セルで最良または同等の結果を達成し、最適化されたスキルを持つGPT-5.5の平均精度は58.8%から82.3%に向上した。
研究者たちはTRIAGEを提案した——軌跡セグメントを四つの意味的役割に分類し、すべてのトークンを均一に扱うGRPOとは異なり、各役割に異なる報酬シグナルを割り当てるフレームワーク。ALFWorld、Search-QA、WebShopベンチマークでTRIAGEは環境へのアクション数を10.4〜14.8%削減する。
MemoraはMicrosoft Researchによる長期ホライズンAIエージェント向けのスケーラブルな記憶フレームワークです。何を保存するかと何を取得するかを分離するハーモニックアーキテクチャ、キューアンカー、ポリシー駆動型リトリーバーを導入します。LoCoMoおよびLongMemEvalベンチマークでSOTAを達成し、全コンテキストアプローチと比べてトークン消費を最大98%削減します。
Internalizing the Futureは、Xuan Zhangら9名のTencent研究者が2026年6月25日にarXivに投稿したプレプリントです。世界モデル能力 — 将来の状態の予測を生成し、計画の成功を評価する能力 — をLLMエージェントに付与する3段階のトレーニング(WM-AMT、FE-SFT、FC-RL)を提案します。単なる反応的な対応に替わる手法です。
Dynamic SubagentsはLangChain Deep Agentsフレームワーク内のオーケストレーションアーキテクチャで、モデルが数百のサブエージェントを並列ディスパッチするJavaScriptスクリプトを記述できます。QuickJSインタープリタがスクリプトを決定論的に実行し、300以上の逐次的なツール呼び出しを排除します。6つのオーケストレーションパターンを定義しています。
2026 Agent Confidence IndexはMicrosoftがMIT Technology Review Insightsと共同で実施した調査で、12業種の300人の技術専門家にAIエージェントへの101のタスクにおける信頼度を尋ねました。平均スコアは64/100で、70点を超えるのは30のタスクのみ、59%の専門家が主な懸念事項として人間のループ維持を挙げています。
arXiv:2606.26806の研究者Haoliang Hanによる研究はEVAFを提案しています。これはgated LoRA統合メカニズムで、長期動作エージェントにとって作業コンテキストが削除された後も目標を維持します。EVAFは200イベントにつきわずか2〜3件のパラメータ書き込みのみを必要とし、目標持続性(0.812〜0.904)に優れており、一方でRAGは事実的想起(0.956〜0.973)でリードします。
EGGはLLM推論向けに最適化されたGPUカーネルを自動生成するマルチエージェントフレームワークです。アルゴリズム構造の設計とハードウェア固有のチューニングの2段階アプローチにより、KernelBenchでPyTorchベースラインと比較して平均2.13倍の高速化を達成し、エージェントベースおよびRLベースのアプローチの両方を上回っています。
StripeとAWSは、年間1.4兆ドルを処理するプラットフォームが1年足らずで金融コンプライアンス向けに100以上のAIエージェントを稼働させた経緯を公開しました。ReActフレームワークとAmazon Bedrockを基盤とするエージェントは、審査時間26%短縮、不正検出率95%、コスト60%削減を実現しました。
研究者たちはAIエージェントへの自然言語指示・MCPツール説明・ポリシー文書をCedar Policy LanguageとLLMのgenerator-criticループを用いて形式検証済みコードへと自動変換するパイプラインを開発しました。従来の手書きシンボリックエンフォースメントより仕様カバレッジが大幅に向上しています。
Claude Code v2.1.195はフルスクリーンモードでのマウスクリックを無効にする新しい環境変数、ハイフン付きフックマッチャーの修正、macOSでのCJK言語向け音声ディクテーション改善をもたらす小規模なQoLアップデートです。
LangChainはDeep Agentsフレームワークにプロンプトキャッシング——エージェントのステップ間で以前に計算されたコンテキストを再利用する技術——を導入しました。長時間実行エージェントの遅延とコスト削減を目的としています。
AutodataはMeta FAIRのシステムで、AIエージェントがデータサイエンティストの役割を担い、高品質な合成データセットを自律的に構築します。Agentic Self-Instructメソッドがエージェント自身をメタ最適化し、CS研究・法律・数学的推論の各ドメインで静的ベースラインを一貫して上回る成果を示しています。
Claude Code v2.1.193は2026年6月25日にリリースされたアップデートです。すべてのBashおよびPowerShellコマンドをオートモードにルーティングする分類器を導入し、UIに拒否理由を追加し、エンタープライズオブザーバビリティのための新しいOpenTelemetryログイベントを提供しています。
LangChainは6月のニュースレターでアラートの自動トリアージを行うFleet On-Call Copilot、エージェント用の隔離VMを持つComputer Use、BoxのAgent開発を3倍速め、Harmonicのユーザー維持率を4倍向上させたオープンソースRubricMiddlewareを発表しました。
OpenAIはビジネス環境でのAIエージェントの爆発的な成長を報告しています。Codexは2026年に400%成長して週500万ユーザーを達成し、30分以上の人間の作業を置き換えるタスクの割合は80.6%に達しました。
GoogleはGemini 3.5 FlashにComputer Useツールを統合し、AIエージェントがブラウザ、モバイルデバイス、デスクトップアプリケーションを自律的に操作できるようにしました。モデルはこれまでで最高のOSWorldスコアを達成し、プロンプトインジェクション攻撃に対するエンタープライズ保護も備えています。
Claude Code v2.1.191は2026年6月24日に公開されたアップデートで、/clear後の会話再開のための/rewindコマンドを導入し、ストリーミングのCPU消費を37%削減、一時的なネットワークエラー向けMCPリトライロジックと承認済みサンドボックスホストの記憶機能を追加しました。
LangChainはAIエージェントに記憶を追加するための実践的なガイドを発表しました。LangSmith Observability、Engine、Context Hubツールを使った3フェーズのサイクル(キャプチャ、分析、更新)で構成されています。
Claude TagはAnthropicの新製品で、チームがSlackチャンネルで@Claudeをタグ付けできます。チャンネルごとに共有された1つのエージェントが何時間・何日間も非同期で作業し、会話のコンテキストを記憶し、重要な情報を積極的にフラグします。Anthropicのプロダクトチームの内部版ではコードの65%が生成されました。
Claude Code v2.1.187は2026年6月23日にリリースされたアップデートです。サンドボックスからシークレット変数の読み取りを禁止するsandbox.credentials設定、組織によるモデルピッカー制限、MCPコール停止のバグ修正、およびターミナルでのCJK文字化けの修正が含まれています。
GitHub Copilot CLIターミナルインターフェースが一般提供(GA)になりました。新しいBYOK(Bring Your Own Key)オプションにより、ユーザーはCopilotの必須モデルレイヤーなしにOpenAI、Anthropic、Ollama、その他のプロバイダーの独自APIキーを使用できます。
NVIDIA Agent Toolkitは、Nemotronオープンモデル、NemoClawガードレール、OpenShellセキュアランタイムを組み合わせたエンタープライズAIエージェント構築のためのオープンプラットフォームです。CrowdStrikeなどのパートナーはすでにセキュリティアラートのトリアージで98.5%の精度を達成しており、数ヶ月かかっていた研究が数日で完了しています。
RaMeMは、エージェントメモリシステムにおけるコンテキスト崩壊——圧縮されたフラグメントが周囲のコンテキストを失い、同等に関連性があるように誤って取得される状態——を防ぐ4フェーズのフレームワークです。長期メモリベンチマークで既存のベースラインと比較して平均F1スコアが10%以上向上しました。
CNCFはAIエージェントが独自の暗号化IDと権限委任メカニズムを必要とする理由を解説しています。On-Behalf-Ofトークンはエージェントのアイデンティティとユーザーのプリンシパルの両方を明示的に定義されたスコープとともに運びます——従来のユーザーのみの認証モデルに欠けているすべてがここにあります。