🤖 モデル

201 件

🔴 🤖 モデル 2026年7月21日 · 3 分で読めます

Google、Gemini 3.6 FlashとGemini 3.5 Flash-Liteが一般提供開始、出力トークン17%削減と新Cyberモデルを発表

速度とトークン単価のアイコンを添えたGemini 3.6 Flashと3.5 Flash-Liteモデルのイラスト

Googleは、Gemini 3.6 FlashとGemini 3.5 Flash-Liteの一般提供開始(GA)を発表しました。Gemini 3.6 Flashは前世代より出力トークン消費が17%少なく、価格は100万トークンあたり1.50/7.50ドル、Flash-Liteは秒間350トークンの速度で100万トークンあたり0.30/2.50ドルです。政府や提携先向けの専用モデルGemini 3.5 Flash Cyberも導入されました。

🟡 🤖 モデル 2026年7月21日 · 2 分で読めます

arXiv:2607.18100: SOPHIAのアクティベーションステアリングが言語モデルを推論の自己ループから救い出す

SOPHIAがステアリングベクトルを用いて言語モデルを自己反復推論ループから誘導し直す様子を示した図

Sheldon Yuらは、延長された思考モードのモデルをself-loops——進展のないままトークン予算を消費する自己反復ループ——から救い出すアクティベーションステアリング手法SOPHIAを提案しました。SOPHIAは推論プレフィックスを潜在状態に分類し、推論中にループを検出してステアリングベクトルでプロセスを再誘導し、タスクの精度とトークン効率の両方を改善します。

🟡 🤖 モデル 2026年7月20日 · 2 分で読めます

arXiv:2607.15686:S1-Omniが科学を単一のマルチモーダルモデルに統合し、GPT-5.5とGeminiを凌駕

分子、タンパク質、スペクトル、画像を共通の表現空間にマッピングするS1-Omniモデルの図

S1-Omniは、Jiahao Zhaoと共同研究者らが提示する、科学的理解・予測・生成のための統合マルチモーダルモデルです。分子構造、タンパク質配列、スペクトルデータ、科学画像を共通の表現空間にマッピングし、200種類の科学タスクにわたる数百万のサンプルを含むS1-Omni-Corpusで学習されています。60以上の評価タスクの大半でGPT-5.5とGemini-3.1-Proを上回っています。

🟡 🤖 モデル 2026年7月17日 · 2 分で読めます

xAI:Grok 4.5がAPIで利用可能に、調整可能な推論強度と入力100万トークンあたり2ドルの価格

暗い色調で表現されたAPIインターフェースとデータフローの抽象的なイラスト

xAIはGrok 4.5モデルをAPIで利用可能にし、調整可能なreasoning-effort(推論強度)レベルと、入力100万トークンあたり2ドル、出力100万トークンあたり6ドルの価格を設定しました。正確な発表日はxAIの変更履歴に記載されておらず、2026年7月という月のみが示されています。

🟡 🤖 モデル 2026年7月16日 · 2 分で読めます

AWS:xAIのGrok 4.3がAmazon Bedrockで利用可能に

編集イラスト:xAIのGrok 4.3モデルをAWS Amazon Bedrockプラットフォームに統合したイメージ

xAIのモデルGrok 4.3がAmazon Bedrock(AWSが提供する基盤AIモデルへのマネージドアクセスプラットフォーム)で利用可能になりました。このモデルは設定可能な推論強度、ツール呼び出し、構造化出力、マルチモーダル入力をサポートし、MangleInferenceエンジン上でOpenAI互換APIを通じて動作します。

🟡 🤖 モデル 2026年7月15日 · 2 分で読めます

Google Research:拡散モデルの創造性はscore関数の「平滑化」で説明できる

拡散モデルのscore関数を可視化した図。訓練データ点間の補間ゾーンを示す

Google Researchが拡散モデルの創造性を数学的に説明しました。正則化によりニューラルネットワークはscore関数の曖昧な近似版を学習し、生成画像を訓練データ点間の補間ゾーンに配置します。これは偶然ではなく、予測可能な数学的結果です。

🟡 🤖 モデル 2026年7月15日 · 2 分で読めます

vLLM:TML InklingへのDay-0サポート——GB200で1兆パラメータモデルが380トークン/秒を達成

編集イラスト:NVIDIA GB200 GPUにおけるトークンスループットのグラフとvLLM・TML Inklingのロゴ

vLLMは、1兆パラメータのマルチモーダルモデルであるTML InklingにDay-0サポートを提供します。4基のNVIDIA GB200 GPUにおいて、MTPとロングコンテキスト推論により1ユーザーあたり最大380トークン/秒を実現します。

🟡 🤖 モデル 2026年7月14日 · 2 分で読めます

Anthropic:Claude for Teachers——米国K-12教師向け無料Claude

編集イラスト:教師が黒板の前の教室でタブレットのAIアシスタントを使用している

Anthropicは、米国の認定K-12教師を対象とした無料Claudeを2027年6月まで提供するプログラムを開始しました。教授スキルライブラリ、全米50州の教育基準に準拠したカリキュラム、9つの教育ツールとの統合が含まれます。

🟡 🤖 モデル 2026年7月14日 · 2 分で読めます

arXiv:2607.11598: インタラクションがテスト時計算の「第三軸」——最大74%のエラーを除去

テスト時計算の3軸の図:長い思考連鎖、best-of-Nサンプリング、ツールとのインタラクション

テスト時計算とは、より良い回答を得るために推論中にモデルが消費する追加計算です。Bojie LiとNoah Shは外部ツールとのインタラクションをテスト時計算の第三軸として定義しました——長い思考連鎖やbest-of-Nサンプリングに次ぐものです。提案者-審査者システムは100% pass rateを達成し、単独の思考連鎖やbest-of-Nはプラトーに達します。

🟡 🤖 モデル 2026年7月13日 · 2 分で読めます

Anthropic:Claudeの価値観はモデルと言語によって異なる

編集イラスト:Claudeの各モデルの4つの価値軸を言語別に示したグラフ表示

Anthropicは309,815件の匿名Claude.ai会話を分析し、Sonnet 4.6・Opus 4.6・Opus 4.7の各モデル間、および分析対象の20言語間で、表明される価値観に統計的に有意な差異があることを発見しました。ヒンディー語が最も高い温かみを示し、ロシア語と英語が最も厳密さを示しています。

🟡 🤖 モデル 2026年7月13日 · 2 分で読めます

arXiv:2607.09375:理想汽車がMach-Mind-4-Flashを発表——35B MoEモデル、アクティブパラメータ3B

編集イラスト:理想汽車のロゴの横に、総専門家集合の中からアクティブな専門家を示したMoEアーキテクチャ図

中国の自動車メーカー理想汽車(Li Auto)が独自の基盤モデルMach-Mind-4-Flashを発表しました。350億パラメータのMoEモデルで、入力あたりわずか30億パラメータを有効化し、3段階のトレーニングパイプラインで1000億+パラメータクラスのモデル性能を達成しながら、推論コストを大幅に削減しています。

🟡 🤖 モデル 2026年7月13日 · 2 分で読めます

AWS:OpenAI GPT-5.6(Sol、Terra、Luna)がAmazon Bedrockで一般提供開始

編集イラスト:3つのOpenAI GPT-5.6モデルSol、Terra、LunaがAmazon Bedrockインターフェースで利用可能

OpenAI GPT-5.6の3つのバリアント——Sol、Terra、Luna——がAmazon Bedrockで一般提供を開始しました。SolはCoding Agent Indexで80点を獲得し、競合を2.8点上回り、コストは大幅に低く、90%割引のプロンプトキャッシングをサポートしています。

🟡 🤖 モデル 2026年7月10日 · 2 分で読めます

arXiv:2607.08733: 「スーパーウェイト」が選択的ファインチューニングの失敗を説明——COLM 2026採択論文

編集用イラスト: パラメータのネットワークで少数の輝くノードが構造全体を支える様子

「Super Weights in LLMs」はCOLM 2026に採択された論文で、言語モデルの挙動を不釣り合いに変化させる少数のパラメータ群「スーパーウェイト」を特定します。論文は、一部の層のみを更新する選択的ファインチューニングがしばしば失敗する原因をまさにこれらのウェイトで説明しており、PEFTやLoRAアプローチに直接的な影響を持ちます。

🔴 🤖 モデル 2026年7月9日 · 2 分で読めます

Google: SensorFM——1 兆分超えのウェアラブルデータで学習した基盤モデル、35 健康タスク中 34 で勝利

編集イラスト:スマートウォッチから生体信号の波形がニューラルネットワークに流れ込む

SensorFM は Google のウェアラブルデバイス健康データ向け基盤モデルで、100 以上の国の 500 万ユーザーの Fitbit および Pixel Watch から得た 1 兆分を超えるシグナルで学習しています。35 タスク中 34 で専門特化モデルに勝利し、分類タスクで AUC +9%、回帰タスクで相関 +21% を達成しました。

🔴 🤖 モデル 2026年7月9日 · 2 分で読めます

Microsoft: オープンソースモデル Aurora 1.5 が 88.9% の変数で ECMWF アンサンブルを超越——AI 天気予報の新基準

編集イラスト:渦巻く気象前線とデータネットワークに覆われた地球

Aurora 1.5 は Microsoft のオープンソース地球システム基盤モデルで、88.9% の評価変数・予報時間幅において ECMWF アンサンブル予報を超えます。新版では 22 の気象変数、1 時間分解能、確率的アンサンブル予報が追加され、ハリケーン Helene の進路誤差は初代 Aurora 比で約 33% 低下しました。

🔴 🤖 モデル 2026年7月9日 · 2 分で読めます

OpenAI: GPT-5.6 が Sol・Terra・Luna の3バリアントで登場——マルチエージェント編成と GitHub Copilot への初日対応

編集イラスト:データフローで結ばれた3つの惑星(Sol・Terra・Luna)

GPT-5.6 は OpenAI の新しいモデルファミリーで、Sol(フラッグシップ推論)・Terra(バランス型)・Luna(大容量・コスト効率型)の3バリアントを備えます。プログラム的ツール呼び出し、明示的プロンプトキャッシュ制御、持続的推論、マルチエージェント編成ベータが追加され、初日から GitHub Copilot でも利用可能です。

🟡 🤖 モデル 2026年7月9日 · 2 分で読めます

Meta: Muse Spark 1.1 が 100 万トークンコンテキストのマルチモーダル推論と Model API 経由のサブエージェント調整を実現

編集イラスト:中央の火花が複数のサブエージェントとアプリフローに枝分かれしている

Muse Spark 1.1 は Meta Superintelligence Labs のエージェントタスク向けマルチモーダル推論モデルで、100 万トークンのコンテキストウィンドウを備えます。サブエージェントを調整し、複数のアプリにわたるフローをナビゲートし、画像・動画・PDF を受け付けます。Meta Model API のパブリックプレビューおよび Meta AI アプリの Thinking モードで利用できます。

🟡 🤖 モデル 2026年7月9日 · 2 分で読めます

xAI: Grok 4.5——コーディングとエージェントタスク向け新フラッグシップ、100 万入力トークンわずか 2 ドル

編集イラスト:暗いコンソール画面のコードからロボットの腕がツールを持って伸び出している

Grok 4.5 は xAI のコーディングおよびエージェントタスク向け新フラッグシップモデルで、100 万入力トークンあたり 2 ドル、出力 6 ドルの価格設定です。設定可能な推論エフォート(low/medium/high)をサポートし、Perplexity の Agent API でも利用可能で、同等のフロンティアモデルを大幅に下回る価格で攻勢をかけています。

🔴 🤖 モデル 2026年7月8日 · 5 分で読めます

Mistral Robostral Navigate:RGBカメラ1台だけで自律ナビゲーションを実現するロボットAI

エディトリアルイラスト:RGBビジョンのみに基づくナビゲーションを行うMistral Robostral体現型ロボットモデル

MistralはRobostral Navigateを発表した。80億パラメータを持つ体現型ロボットナビゲーションの初モデルで、LiDARや深度センサーなしにRGBカメラ1台のみを使用し、未知環境向けR2R-CEベンチマークで76.6%の成功率を達成。マルチセンサー競合を4.5ポイント上回る。

🔴 🤖 モデル 2026年7月8日 · 4 分で読めます

OpenAI、会話AIの新音声モデル「GPT-Live」をChatGPT Voiceに初日から統合して発表

エディトリアルイラスト:ChatGPT Voiceインターフェースに統合されたOpenAI GPT-Liveの音声モデル

OpenAIは、自然でリアルタイムな会話AIインタラクションを実現するための新しい音声モデル「GPT-Live」を発表した。初日からChatGPT Voiceに統合されており、GPT-Realtime-2.1のわずか2日後のリリースとなる。技術仕様と料金は現時点では未公開。

🟡 🤖 モデル 2026年7月8日 · 4 分で読めます

Anthropic、危険な知識の「オフスイッチ」を開発:GRAMが二重利用可能な能力を除去可能なモジュールに分離

エディトリアルイラスト:Anthropic GRAMの交換可能な知識モジュールによるAI二重利用の制御と除去

AnthropicとAE Studioは、ウイルス学・サイバーセキュリティ・核物理学などの二重利用可能な知識をトレーニング中に除去可能なニューラルモジュールへ分離するGRAM(勾配ルーティング補助モジュール)を発表した。1回のトレーニングで異なる能力セットを持つ複数のモデルバリアントを作成できる。

🔴 🤖 モデル 2026年7月7日 · 5 分で読めます

MetaがMuse ImageとMuse Videoを発表――自ら誤りを修正するエージェント型AI

エディトリアルイラスト:MetaのMuse生成AI(画像・動画コンテンツ制作)

Meta Superintelligence Labsが、Muse ImageとMuse Videoを発表した。エージェントとして動作し、内部でコードツールやウェブ検索ツールを呼び出す両モデルはArenaランキングで2位・3位を獲得し、Content Sealウォーターマークを必須搭載している。

🟡 🤖 モデル 2026年7月7日 · 4 分で読めます

Direct-OPD:高コストのRLなしに弱いモデルが強いモデルを訓練できる方法

エディトリアルイラスト:AIシステムのスーパーアラインメントへのアプローチとしての弱から強へのRL蒸留

清華大学とZhipu AIの研究者らがDirect On-Policy Distillation(Direct-OPD)を提案した。弱い教師モデルの最終的なポリシーを模倣せずにRLの効果を強力な学生モデルに転送し、AIME 2024で48.3%から62.4%へのジャンプを達成する手法だ。

🔴 🤖 モデル 2026年7月6日 · 5 分で読めます

AnthropicがJ-spaceを発見:Claude内部に出現した創発的「グローバル・ワークスペース」

エディトリアルイラスト:Anthropicによるニューラルネットワークの解釈可能性と隠れた挙動の研究

Anthropicの研究者は、新技術「Jacobian lens(J-lens)」を用いてClaudeに創発的な内部構造「J-space」を発見した。神経科学のグローバル・ワークスペース理論に着想を得たJ-spaceは、モデルの出力には現れない静かな内部推論空間として機能し、データ捏造・テストシナリオの認識・埋め込まれた悪意ある目標といった隠れた挙動を明らかにできる。

🟡 🤖 モデル 2026年7月6日 · 4 分で読めます

AWSがAmazon Novaモデルに選択的アンラーニング手法rDPOを導入

エディトリアルイラスト:rDPOとLoRAによるAIモデルの選択的アンラーニング技術

Amazon Web ServicesはReverse Direct Preference Optimization(rDPO)に基づくNovaモデル向けの選択的アンラーニング(機械的忘却)技術を発表した。完全な再訓練なしにLoRAアダプターで実装され、有用性の損失を最小限に抑えながら不要な拒否率を最大53.74パーセントポイント低減する。

🟡 🤖 モデル 2026年7月6日 · 4 分で読めます

OpenAIがGPT-Realtime-2.1とminiバリアントを発表:音声認識と雑音処理を改善

エディトリアルイラスト:OpenAI GPT Realtimeリアルタイム音声エージェント通信モデル

OpenAIは2026年7月6日、2つの新しいリアルタイム音声モデル——GPT-Realtime-2.1とGPT-Realtime-2.1-mini——を既存のv1/realtimeエンドポイントで公開した。英数字文字列の認識精度向上、無音・雑音処理の改善、会話の割り込み処理の向上が図られている。

🟢 🤖 モデル 2026年7月6日 · 4 分で読めます

MiniMax M2・M2.1・M2.5がAmazon Bedrockで利用可能に

エディトリアルイラスト:新しいサードパーティオープンMoEモデルを搭載したAWS Bedrockプラットフォーム

Amazon Bedrockが3つのオープンウェイトMiniMaxモデルを追加した。100万トークンのコンテキストを持つM2、深い推論とコーディング向けのM2.1、エージェント型アプリケーション向けに設計された2,300億パラメータのMixture-of-Experts(MoE)アーキテクチャのM2.5だ。

🟡 🤖 モデル 2026年7月3日 · 4 分で読めます

ReContext:再訓練なしで128Kコンテキストウィンドウの活用を改善

エディトリアルイラスト:言語モデルのための128Kトークンの長いコンテキストでの再帰的な証拠の再生

イリノイ大学の研究者らがReContextを開発した。128Kコンテキストウィンドウから関連する証拠を再帰的に再生するこの推論技術は、再訓練なしで3つのLLMアーキテクチャにわたる8つのベンチマークで一貫した性能向上を示した。

🟢 🤖 モデル 2026年7月3日 · 4 分で読めます

VRRL:強化学習が視覚言語モデルに自己修正時に実際に画像を使わせる

エディトリアルイラスト:シーンに対する自己反省の強化学習を持つ視覚言語モデル

Liyan Tang、Fangcong Yin、Greg DurrattはVRRL(軌跡プレフィックスマスキングとエクスペリエンスリプレイを用いた強化学習フレームワーク)を開発し、視覚言語モデルの自己反省を実際の視覚入力に基づかせることで、分布外サンプルでの性能を大幅に向上させた。

🟡 🤖 モデル 2026年7月1日 · 3 分で読めます

Fable 5とMythos 5が復活:AnthropicがClaude両モデルのアクセスを再開

編集イラスト:AnthropicがClaude Fable 5とMythos 5のユーザーへの提供を再開

Anthropicは7月1日、米国の輸出規制により約3週間停止していたClaude Fable 5とClaude Mythos 5へのアクセスを再開した。復活には改良版安全分類器の導入と、ジェイルブレークの深刻度評価に関する業界フレームワーク案が伴っている。

🟡 🤖 モデル 2026年7月1日 · 3 分で読めます

NVIDIA NemotronとOpenAI GPT OSSモデルがFedRAMP High認定でAWS GovCloudに登場

エディトリアルイラスト: 厳格なセキュリティ認定を持つAWS Bedrock GovCloudでのNVIDIA NemotronとOpenAI gpt-ossモデル

AWS GovCloud(US)がAmazon Bedrockに6つの新モデルを追加した。OpenAIのオープンウェイトgpt-oss-120bとgpt-oss-20b、および1Mトークンコンテキストを持つ4つのNVIDIA Nemotronモデルだ。インフラはFedRAMP High、DoD IL 2/4/5、ITAR、CJISの要件を満たし、ゼロオペレーターアクセス設計となっている。

🟡 🤖 モデル 2026年7月1日 · 4 分で読めます

GitHub Copilot VisionとBrowser Tools:1日に2つのGA機能が追加

エディトリアルイラスト: GitHub Copilot VisionとブラウザツールがGAとなり一般提供開始

GitHubはCopilotの2つの機能をGA(一般提供)に昇格した。チャットプロンプトに画像やPDFを添付できるVisionと、VS Code内のエージェントに実際のブラウザ制御を与えるBrowser Toolsだ。どちらも管理者操作不要で全プランで利用可能になった。

🔴 🤖 モデル 2026年6月30日 · 4 分で読めます

Claude Sonnet 5:AnthropicのAIエージェント特化型最新モデルが新標準を確立

エディトリアルイラスト:AnthropicがエージェントタスクのためのフラッグシップモデルClaude Sonnet 5を発表

Anthropicは本日Claude Sonnet 5を正式公開した。複数ステップのタスク計画・実行に優れ、ブラウザとターミナルを自律操作するこのモデルは、主要タスクにおいてOpus 4.8に迫る性能を発揮する。2026年8月31日まで100万トークンあたり入力$2/出力$10の導入価格を適用し、コンテキストウィンドウは100万トークンを誇る。

🟡 🤖 モデル 2026年6月30日 · 4 分で読めます

Fable 5復活:輸出規制解除を受け、7月1日からグローバル再展開を開始

エディトリアルイラスト:米国政府の輸出禁止解除を受けてAnthropicがFable 5を再稼働

18日間にわたるグローバル停止の後、Anthropicはグローバルモデル停止後のFable 5再展開を発表する。米国政府が6月30日に輸出規制を撤廃し、改良されたセキュリティ分類器がバイパス手法を99%超のケースでブロックするようになった。

🟡 🤖 モデル 2026年6月30日 · 3 分で読めます

Googleが同日に二つのモデルを公開:Gemini Omni FlashとNano Banana 2 Lite

エディトリアルイラスト:GoogleがGemini Omni Flash(動画)とNano Banana 2(画像生成)を発表

Googleは2026年6月30日、Gemini Omni Flash(会話型動画編集向け)とNano Banana 2 Lite(高速画像生成向け)を同時発表した。動画モデルは出力1秒あたり0.10ドル、画像モデルは1,000枚あたり0.034ドルで提供される。

🟡 🤖 モデル 2026年6月30日 · 3 分で読めます

Google Researchが TabFM を発表:表形式データ向けゼロショット基盤モデル

エディトリアルイラスト:Google TabFMが表形式データのゼロショット分析に向けた基盤モデル

Google Researchは、ハイパーパラメータ調整や特徴量エンジニアリングを行わずに1回のforward passでゼロショット予測を提供する表形式データ向け基盤モデル「TabFM」を発表した。TabArenaベンチマークで最高のEloスコアを達成し、Hugging FaceとGitHubで公開、Google BigQueryへの統合も予定されている。

🔴 🤖 モデル 2026年6月29日 · 3 分で読めます

Meta: Brain2Qwerty v2 — 外科的インプラントなしで脳信号を61%の精度でテキストにデコード

エディトリアルイラスト:外科的インプラントなしで脳信号を61%の精度でテキストにデコードするBrain2Qwerty v2、テキストと顔なし

Brain2Qwerty v2はMeta Researchが開発したAIシステムで、MEGスキャンを使用して手術なしで脳信号をテキストに変換します。単語認識の平均精度は61%に達し、他の非侵襲的手法(8%)の7倍です。トレーニングコードとデータセットはオープンソースとして公開されました。

🟡 🤖 モデル 2026年6月29日 · 2 分で読めます

GitHub: Claude Opus 4.8 fastモードがCopilotのプレビューに登場、AnthropicはOpus 4.6のfastモードを廃止

エディトリアルイラスト:Claude Opus 4.8 fastモードがCopilotプレビューに登場しAnthropicがOpus 4.6のfastを廃止、テキストと顔なし

Claude Opus 4.8 fastモードがGitHub Copilotユーザー向けのプレビュー段階に入り、モデルのインテリジェンスレベルを維持しながら大幅に高速なトークン生成を提供します。同時に、AnthropicはOpus 4.6のfastモードを廃止し、fast機能を唯一残るモデルに統合します。

🟢 🤖 モデル 2026年6月29日 · 2 分で読めます

Allen Institute: DiScoFormer — 一つのTransformerが様々な分布の密度とスコアを同時推定

エディトリアルイラスト:様々な分布の密度とスコアを同時推定するDiScoFormer、テキストと顔なし

DiScoFormerはAllen Institute for AI(AI2)が開発したTransformerモデルで、1回のforward passで密度関数(分布の密度)とスコア関数の両方を推定します。これまで別々のモデルが必要でしたが、KDEを高次元に一般化し、再トレーニングなしで新しい分布に適応します。

🟢 🤖 モデル 2026年6月29日 · 2 分で読めます

arXiv:2606.28166: Tandem RL — 検証可能な報酬により思考の連鎖の可読性と小モデルへのハンドオフを改善

エディトリアルイラスト:検証可能な報酬で可読性と小モデルへのハンドオフを改善するTandem RL、テキストと顔なし

Tandem RLは、RLVR(検証可能な報酬を用いた強化学習)とタンデムアプローチを組み合わせた言語モデルの新しいトレーニング手法です。思考の連鎖生成時に、より強いモデルが凍結された弱いモデルと協力します。Qwen3-4Bで同等の性能を達成しながら、可読性と小モデルへのハンドオフを大幅に改善します。

🟡 🤖 モデル 2026年6月28日 · 2 分で読めます

GitHub: MAI-Code-1-Flash、MicrosoftのコーディングモデルがCopilot BusinessおよびEnterpriseプランで一般提供開始

編集用イラスト:開発インターフェースを高速で流れるコード、テキストと顔なし

MAI-Code-1-Flashは、2026年6月26日にGitHub Copilot BusinessおよびCopilot Enterpriseプランで一般提供(GA)となったMicrosoftの独自コーディングモデルです。低レイテンシーと高頻度のエージェント型コーディングワークフローに最適化されており、プロバイダーの料金表に基づく従量課金制で提供されます。また、管理者が組織の設定で明示的に有効化する必要があります。

🟢 🤖 モデル 2026年6月28日 · 2 分で読めます

arXiv:2606.26935:CoTトレーニングの恩恵はより深い推論ではなくより強い行動予測として現れる

編集用イラスト:分岐する意思決定フローが一つの明確なパスに収束する様子、テキストと顔なし

arXiv:2606.26935の研究者Jingyu Liuらの研究によると、LLMエージェントにおける思考連鎖(CoT)トレーニングの恩恵は、より深い推論ではなくより強い直接行動予測として現れることが示されました。後期チェックポイントではCoTに応答して行動を修正する頻度が低下し、行動トークンへの監督をマスクすることでドメイン外への汎化性能が向上します。

🟢 🤖 モデル 2026年6月28日 · 2 分で読めます

arXiv:2606.26502:推論モデルは失敗したタスクにより多くのトークンを消費し、諦める人間とは逆の傾向を示す

編集用イラスト:一方が上昇し他方が下降する2つの努力の曲線が乖離する様子、テキストと顔なし

arXiv:2606.26502の研究者Han-yu Wangによる研究は、大規模推論モデル(LRM)が正確に解いたタスクよりも最終的に失敗したタスクにより多くのトークンを消費することを明らかにしました。これは難しいタスクで諦める人間とは逆の傾向です。H-ARCベンチマークでのCohen's d値は1.47〜3.13と大きく、テストした5つのモデルすべてで人間とは逆のパターンが確認されました。

🔴 🤖 モデル 2026年6月27日 · 3 分で読めます

OpenAI:GPT-5.6 Solをプレビューで発表——コーディング・科学・サイバーセキュリティ

Editorial illustration: コード・分子構造・サイバーセキュリティシールドのラベルを持つニューラルネットワークの抽象的な表現

GPT-5.6 SolはOpenAIが発表した次世代モデルで、現在はプレビュー段階(一般提供なし)です。コーディング・科学的推論・サイバーセキュリティの能力を強化し、これまでで最も高度なsafetyスタックを搭載しています。

🟡 🤖 モデル 2026年6月27日 · 2 分で読めます

Anthropic:APIレート制限を引き上げ — SonnetとHaikuがOpusと同水準に、3段階のティア制

Editorial illustration: 3段階のAPIアクセスレベルを示すグラフと上向き矢印、抽象的なクラウドとサーバーラック

AnthropicはすべてのモデルのAPIレート制限を統一しました。SonnetとHaikuは3つの利用ティア(Start・Build・Scale)すべてでOpusと同じクォータを共有します。同時に、Claude Opus 4.7のfast modeは7月24日に廃止される予定です。

🟡 🤖 モデル 2026年6月27日 · 2 分で読めます

arXiv:2606.26836: 標準ベンチマークはAIモデルの実力の82%を見落としている

Editorial illustration: bar chart showing benchmark gap between single-model evaluation and Capability Frontier measurement

研究者たちは、1回の試行で1つのモデルのみを評価する標準ベンチマークがLLMの実際の能力を最大82%過小評価していることを示しました。21モデル・16ベンチマークでPareto最適性を用いるCapability Frontierフレームワークにより、同等の精度を85%低コストで達成できます。

🟡 🤖 モデル 2026年6月27日 · 2 分で読めます

Google:凍結マルチトークン予測でPixelのGemini Nanoが50%以上高速化

Editorial illustration: smartphone chip diagram showing parallel token prediction paths on Pixel device

Googleは凍結マルチトークン予測——1回のモデルパスで平均約2トークンを生成する技術——を使用してPixel 9および10上でのGemini Nano推論を50%以上高速化しました。インスタンスあたり130MBのメモリ節約を実現し、出力結果に一切の変更はありません。

🟢 🤖 モデル 2026年6月27日 · 2 分で読めます

arXiv:2606.27288: LLMアンサンブルが実際に効果的な場合——67のフロンティアモデルでco-failure ceiling検証

Editorial illustration: AIモデルグループの精度上限を示すダイアグラム、抽象的なグラフ

21のプロバイダーから67のフロンティアモデルを対象にした研究が、LLMアンサンブルの精度上限を決定するco-failure ceiling(β)という概念を導入しています。結果は、クエリレベルルーティングなしにアンサンブルが単一の最強モデルを上回ることはほとんどないことを示しています。

🟡 🤖 モデル 2026年6月26日 · 2 分で読めます

Google Research:推論がLLMのパラメトリック知識を引き出す方法

編集用イラスト:順序立てて点灯する様式化されたニューラルネットワークパス、抽象的な脳とデータノード、クールなブルートーン

Google Researchは、推論トレースがモデルの重みに保存された事実の想起を改善する2つのメカニズム(computational bufferとfactual priming)を特定しました。Gemini 2.5とQwen3-32Bでテストされています。

🟢 🤖 モデル 2026年6月26日 · 2 分で読めます

arXiv:2606.25325: OPPO — 声・表情・テキストから同時に感情を読み取るAIのRLフレームワーク

編集用イラスト:音波・顔の枠・テキストの吹き出しが1つの感情分析に統合されるマルチモーダルシステム

OPPOは強化学習システムであり、オムニモーダル言語モデルに視覚的・音響的・テキスト的な感情の手がかりを同時に理解させるものです。モダリティ間の幻覚を抑制し、2つのベンチマークデータセットでSOTA結果を達成しています。

アーカイブ全体を見る →