vLLM:266のCIジョブと夜間ベンチマークがオープンソースLLM推論エンジンの本番品質をどう守るか
vLLMチームは、NVIDIA H200、B200、AMDアクセラレーター上で毎晩17のモデル・ハードウェアレシピを37のテストグループ、266のジョブ、58のランナーキューを通じてテストする内部CI/QAインフラを公開しました。2026年6月には1,918件のコミットがマージされ、リリースは2週間ごとに行われています。
92 件
vLLMチームは、NVIDIA H200、B200、AMDアクセラレーター上で毎晩17のモデル・ハードウェアレシピを37のテストグループ、266のジョブ、58のランナーキューを通じてテストする内部CI/QAインフラを公開しました。2026年6月には1,918件のコミットがマージされ、リリースは2週間ごとに行われています。
OpenWiki 0.2はコードリポジトリのwikiドキュメントを自動生成するオープンソースCLIツールで、OKF(Open Knowledge Format)のサポートを導入しました。OKFはGoogle Cloudが提案した標準で、決定論的な構造によりエージェントがコードを検索する際のトークン消費量を削減します。
Sakana AIはNVIDIAのNemotronオープンモデルをFuguに統合しました——Fuguはひとつのが動的にエージェントプール内の他のモデル(再帰的に自身を含む)を呼び出すマルチエージェントシステムです。
PyTorch-Triton 3.7は動的プラグインシステムとMetaのTLXパッケージを導入します。H100ではcuBLASを+3.7%上回り、AMD MI350ではrocBLASと比較して最大+15%のスループット向上を達成します。
CNCF技術監視委員会がHAMi(Heterogeneous AI accelerator Management interface)をIncubatingプロジェクトとして承認しました。HAMiはKubernetesクラスタ内で物理GPUを共有可能な論理ユニットに仮想化し、AIワークロードのリソース断片化を解決します。2024年にSandboxへ参加して以来、550以上の組織と2,687名のGitHubコントリビューターを集めています。
LF AI & Data の TAC 議長 Peter Staar は、現代の AI システムにおいてモデルはもはやボトルネックではなく、ボトルネックはコンテキスト層にあると主張しています。オープンプロジェクトの Docling と DocLang がこの課題に対応する基盤を提供しています。
AMDがLogsLopを公開しました。正規化とクラスタリングで巨大なログファイルを要約するオープンソースのPython CLIツールです。73個の実際のログファイルで行数を11%、バイト数を7.5%に削減し、Llama 3.3 70Bと組み合わせるとトークンが78%節約されます。
Solo.ioのLin SunはKubernetesのPodがAIエージェントをスケジューリングする適切な抽象化かどうかを問い直します。エージェントは短命で——短時間だけ起動し、専用のアイドルPodはリソースを無駄にします。ActorとWorkerPoolを持つ新しい「agent-substrate」モデルを提案しています。
Soofi Sは、約27兆トークンでプレトレーニングされた30B MoEハイブリッドMamba-Transformerモデルで、アクティブパラメータは3B、強化されたドイツ語データを含みます。Deutsche Telekomのクラウドインフラのみでトレーニングされ、すべてのヨーロッパの主権代替案を上回り、17のオープンモデル中コードベンチマークでトップです。
MetaのPyTorchチームは正規化演算をGEMMおよびattentionカーネルに直接融合することでその計算コストを排除する「フリー正規化」技術を公開しました。コードはカーネルライブラリとしてGitHubで公開されており、Layer NormやRMS Normを頻繁に使用するモデルのトレーニングとinferenceの高速化が直接の効果です。
Ollama はオープン AI モデルをローカルで実行するプラットフォームで、Benchmark、Theory Ventures、Docker 創設者 Solomon Hykes などの投資家から 8,800 万ドルの資金調達を発表しました。890 万人の開発者と Fortune 500 企業の 85% が使用し、クラウドサービスのトークン処理量は毎月 2 倍になっています。
PyTorch 2.13が526名の貢献者による3,328コミットとともにリリース。主要な新機能:nn.LinearCrossEntropyLossがLLMトレーニングのピークGPUメモリフットプリントを最大4倍削減、Apple SiliconでのFlexAttentionが最大12.3倍高速化、新しいtorchcommsバックエンドが分散トレーニングを刷新。
CNCF TAG Infrastructureがクラウドネイティブなアプリケーション環境におけるデータストレージのボトルネックをマッピングするホワイトペーパーを発表。トレーニング・推論・エージェントAIの各フェーズの要件を区別し、Kubernetes AI/MLデプロイメントに向けたアーキテクチャガイダンスを提供する。
IBMとRed HatはJavaおよびPythonで6,500以上のデジタル署名済み修正済み依存関係カタログを持つLightwell Networkを一般公開し、金融サービス向けにパッチエンバーゴを調整するLightwell Clearinghouse Premierを発表した。オープンソースセキュリティへの50億ドルのコミットメントを背景とする。
Tencent Hunyuan AI InfraチームとvLLMチームが、8×NVIDIA H20構成でTTFTを24%・TPOTを17%削減するHPC_ATTNアテンションバックエンドとhpc MoEバックエンドをvLLMにアップストリームした。vLLMコードのフォークは不要だ。
Moonshot AIのKimi K2.7 CodeがGitHub Copilotのモデルピッカーに初のオープンウェイトモデルとして追加され、Microsoft Azureでホストされる。Pro、Pro+、Maxプランで使用量ベース課金で利用可能で、Business・Enterpriseへの拡張も予定されている。
LangChainはOpenWikiを公開した。コードリポジトリのドキュメンテーションWikiを自動生成・更新するオープンソースのCLIツールだ。AGENTS.mdやCLAUDE.mdのような指示ファイルを肥大化させることなく、コードエージェントにリポジトリの構造化されたコンテキストを提供することが目的だ。ツールはDeepAgentsフレームワーク上に構築され、複数のLLMプロバイダーをサポートする。
RadixArkはMilesを発表した。SGLang、Megatron-LM、Ray、PyTorchを統一された本番検証済みスタックに統合し、HopperおよびBlackwell GPUでの大規模言語モデルのポストトレーニングを行うオープンソース強化学習フレームワークだ。
CNCF sandboxプロジェクトのKeplerが完全に書き直された:新アーキテクチャはeBPFアプローチを、標準的な/procと/sysパスの読み取りに置き換え、数キロワット単位の計測の跳びを排除し、プロセスごとの電力帰属のギャップをミリワット単位まで縮小する。
LF AI & Data FoundationはトランスフォーマーアーキテクチャとLLM向けネイティブAttentionオペレーター、ブラウザでのモデル検査のためのWebAssemblyサポート、SLSA Level 2暗号化証明を搭載したONNX v1.22.0を公開した。27名のコントリビューターが参加し、そのうち16名が初参加だ。
PalantirはNVIDIA Nemotronオープンモデルを、米国政府機関や重要インフラ向けのSovereign AI Operating Systemに統合しました。システムはエアギャップ環境(インターネット接続のない完全に隔離されたネットワーク)で動作し、防衛、エネルギー、医療、教育、交通の各セクターをカバーします。
GitHub Desktop 3.6がmacOSとWindows向けにリリースされ、スタッシュなしで複数ブランチの並行作業を可能にするGit worktrees サポートと、コミットメッセージおよびマージコンフリクトのためのより深いCopilot統合が追加されました。
TokenSpeed-Kernelはオープンソースの3層カーネルサブシステムで、コードの書き直しなしにNVIDIAおよびAMD GPU上でLLM推論を最大3.6倍高速化し、すでにvLLM推論フレームワークに統合されています。
Allen Institute(AI2)はOLMo 3とOLMo Hybridアーキテクチャを分析し、ハイブリッドモデルが意味的・文脈依存トークンの予測に優れる一方、純粋なTransformerは逐語的テキスト複製において依然として優位性を持つことを明らかにしました。
OpenThoughts-Agentは、エージェント型言語モデル向けのオープンデータキュレーションパイプラインです。100件以上のアブレーション実験を経て、10万件のサンプルを構築し、Qwen3-32Bをファインチューニング。7つのエージェントベンチマークで44.8%を達成し、既存のオープンソースモデルをすべて上回りました。
Claude Code v2.1.185 は2026年6月20日にリリースされたUXパッチで、APIストリーム停止時のメッセージを変更し、アクティベーションしきい値を10秒から20秒の無音に延長しました。モデルやAPIへの変更はありません。
Multi-LCBはarXiv:2606.20517の論文で説明されるLiveCodeBenchベンチマークの拡張であり、ICLR 2026に採択されました。PythonからプログラミングはLiveCodeBench12言語への拡張テストにより、24の大型言語モデルに有意なPython過学習と言語固有のデータ汚染が発見され、現行モデルの多言語コード生成の限界が明らかになりました。
Engineering PlaybookはUK AI Safety Instituteが2026年6月18日に公開したオープンソースドキュメントで、フロンティアAIモデルを評価するための内部インフラを公開しています。PlaybookはEvaluate、Isolate、Connect、Run、Scaleの5層で構成され、200以上の既成評価と240名のコントリビューターを持つInspect AIツールを基盤としています。
Robin Rombach——Black Forest Labs(FLUXモデルの開発者)の共同創業者兼CEO——がG7リーダーに直接呼びかけました。開放的かつ責任あるAI開発を世界的規範とすべきだという訴えです。Rombachは、AIパラメーターの公開がイノベーションを促進し技術の民主化を進めると主張しています。
Allen Instituteは、動画と「ボウルを回転させて」などの自然言語指示から物体の3D軌跡を予測する完全オープンソースモデルMolmoMotionを発表しました。PointMotionBenchでSOTAを達成し、平均変位は前記録の0.134mに対して0.109mです。ロボティクスのpick-and-placeタスク成功率を56%から76.3%へ20.3ポイント向上させました。3D軌跡と動作説明付き116万本の動画からなるMolmoMotion-1Mデータセットで訓練されています。
vLLMはSemantic Router Fusionを発表しました。これは複数のモデルが並行してパネルとして動作し、審判モデルがコンセンサスと差異を分析して単一の回答を合成するプリミティブです。ローカルvLLMおよびプライベートエンドポイントに加え、Gemini、Kimi、DeepSeek、Claudeなどのパブリックプロバイダーをサポートします。OpenRouter DRACOでの外部検証では、統合パネルが69%を達成し、最良の単一モデルの65.3%を上回りました。完全なOpenAI API互換性も備えています。
GitHubは、4000万以上のリポジトリにわたる8000万以上の分類行を含む多言語リポジトリデータセットを、完全なオープンCC0-1.0ライセンスで公開しました。各リポジトリについてREADME、最もコメントの多いissue、最もコメントの多いpull requestの3つのテキストソースを記録し、fastText、gcld3、lingua-pyの3つのツールで言語検出を行います。非英語READMEではポルトガル語がトップで、issueの議論では韓国語が最も目立ちます。
CNCFはOracleの300万ドルのOCIコンピュートクレジット寄付がOpenTelemetry、containerd、Falco、Longhorn、Crossplane、Jaegerを含む12以上のプロジェクトのArm64 CI/CDサポートを可能にしていると報告しています。需要は月5,000ドルの初期ガイドラインをすぐに超えました。この転換は新しいAWSインスタンスの50%以上とAzureインスタンスの33%がArm64アーキテクチャで動作しているというデータと並行しています。
AI2はolmo-evalを公開した。OLMESスタンダードを単発のベンチマークから完全な開発ループへと拡張するオープンな評価プラットフォームだ。主要なイノベーションはチェックポイント間の個々の質問レベルでのペア比較で、実際の改善をデータのノイズから区別する統計的な手段を組み込んでいる。
vLLMチームはMiniMax M3のDay-0フルサポートを発表した――100万トークンのコンテキスト、ネイティブマルチモーダリティ、Mixture-of-Expertsアーキテクチャを持つモデルだ。主要なイノベーションはMiniMax Sparse Attentionであり、KVキャッシュを完全にマテリアライズすることなく長いコンテキストの実用的なサービングを可能にする。
OllamaはApple Silicon向けMLXエンジンを更新し、Metal kernelの融合とGPUサンプリングによってトークン生成を最大20%高速化しました。新しいNVFP4量子化フォーマットは非量子化BF16と比較して品質損失を半減させ、スナップショットシステムは分岐や再試行が可能なエージェンティックワークフローを容易にします。
Helionは直接的なCUDAコードなしでGPUカーネルを書くためのPyTorchネイティブDSLだ。9つのHelionカーネルがQwen3モデルのFP8推論のためにvLLMに統合された。非GEMMカーネルはH100で最大73%の高速化を記録し、全体的なスループットは従来の実装と比較して約5〜9%向上する。
LF AI & Data FoundationがIBM・Red Hat・NVIDIAを創設メンバーとしてDocLang Specification Working Groupを設立し、AIネイティブドキュメントのオープンでベンダー中立な標準を開発する。このフォーマットはセマンティックな意味と幾何学的レイアウトを保存し、ガバナンス制御を組み込み、現代のAIトークナイザーとエージェントワークフロー向けに最適化されている。
vimeはMegatron分散トレーニングとvLLM推論を統合したパイプラインでLLMのポストトレーニング向けの新しいRLフレームワークだ。GB200ハードウェアでQwen3-30B-A3B MoEモデルは1ステップあたり約147秒を達成——H200より1.72倍速い。R3ルーティングリプレイがログ確率の差異を0.019から0.013に削減する。
新しい論文が、資源の限られたロボットハードウェアで Vision-Language-Action ポリシーを実行する C++ 推論エンジン vla.cpp を提示する。このエンジンはベンチマーク LIBERO-Object で SOTA 水準に達し、わずか 1.3 GiB のメモリで BitVLA を実行する。
Ollama 0.30は、より良い性能とモデルのGGUF互換性のためのllama.cppとの統合をもたらし、NVIDIA GPUで最大20%高速なスループットを実現する。VulkanによりAMDおよびIntelデバイスへハードウェアサポートを拡張し、ツール呼び出しのサポートを追加する。Appleシリコン向けの既存のMLXエンジンを補完する。
vLLMチームは、自社のSemantic Routerのv0.3「Themis」、すなわちモデル間で問い合わせをルーティングするための初の本番対応バージョンをリリースした。正規の設定、検査可能な決定の流れ、Kubernetesデプロイメント向けの再現可能なルーティング動作をもたらす。
Google Research は2026年6月3日、グローバルな洪水予測サービス Flood Hub を駆動する Python/PyTorch フレームワークを、Apache 2.0 ライセンスのもと GitHub で公開した。フレームワークはオープンソースデータセット Caravan の上で LSTM とより新しい ME-LSTM アーキテクチャを用い、アップグレードされた v2 モデルは観測流域での信頼できる予測期間を6日延長する。
vLLM Semantic Router にセッション対応エージェントルーティング(SAAR)が加わった。これは各メッセージを個別に扱うのではなく、長時間にわたるエージェント対話を理解する仕組みだ。21,600 のテスト回において、SAAR はモデル切り替えを79.29%削減し、危険な切り替えを完全になくし、推定コストを78.71%下げた。
vLLM は Intel の AutoRound 量子化を vLLM-Omni に統合し、マルチモーダルおよび拡散モデルの W4A16 圧縮を可能にした。結果として、チェックポイントは最大62%小さくなり、品質低下はごくわずかで、Intel XPU と NVIDIA グラフィックカード上での生成が高速になる。
vLLM チームは、GB10 チップをベースとする NVIDIA DGX Spark システムで vLLM を実行するための実践的なガイドを公開した。このガイドは、統合メモリの挙動、NVFP4 モデル Nemotron-3-Super の提供、Docker デプロイ、Prometheus メトリクス、そして新しいエッジハードウェアでのローカル評価の結果を扱う。
xAI は xai-sdk-python v1.15.0 をリリースした。3つの変更を含むリリースで、ChatModel クラスへの grok-build-0.1 モデルの追加、context compaction すなわちコンテキスト圧縮のサポート、そしてバージョンの 1.14.0 から 1.15.0 への引き上げである。すべての変更は3つの個別のプルリクエストを通じて行われた。
PithTrainは、AIコーディングエージェント向けに最適化されたMixture-of-Expertsモデル訓練の新システムです。論文はagent-task efficiencyという指標と付随するATE-Benchを導入し、その上でPithTrainはエージェントステップを最大62%、アクティブGPU時間を最大64%削減しつつ、同等のスループットを維持します。
vLLM は 2026 年 5 月 28 日、重み同期(weight synchronization)のための標準化された API を導入し、非同期強化学習のサポートを改善しました。各 RL フレームワークが訓練と推論の間の重み転送をその場限りで実装する断片化を解決し、大規模分散デプロイでの安定性の問題を修正します。
Data Formulator 0.7 は Microsoft Research のオープンソースシステムで、企業内の断片化したデータソースを接続し、反復的な分析フローをサポートします。永続的なデータコネクタと文脈を意識した AI エージェントをもたらし、SQL やプログラミングの知識なしに分析を可能にします。