🔧 ハードウェア

54 件

🟢 🔧 ハードウェア 2026年7月10日 · 2 分で読めます

AMD: SGLang DiffusionをROCmで実現——LLM向けinferenceフレームワークがInstinct GPUでの画像生成・編集に拡張

編集用イラスト: AMD GPUチップから拡散の層を通じて生成された画像が浮かび上がる様子

AMDは、Instinct GPU上でSGLang DiffusionとROCmスタックを使って拡散モデルによる画像生成・編集を実行するためのガイドを公開しました。大規模言語モデル向けinferenceフレームワークとして知られるSGLangが画像拡散モデルへの対応を拡充し、AMDはNVIDIAエコシステム外でのAI inferenceの訴求力を強化しています。

🟢 🔧 ハードウェア 2026年7月9日 · 2 分で読めます

AMD: FlyDSL——より少ないコードで手書き HIP C++ GPU カーネルの性能を約束する Python DSL

編集イラスト:Python の蛇が GPU チップに巻きつき、チップから最適化されたデータフローが流れ出ている

FlyDSL は AMD の GPU カーネル記述用 Python ドメイン固有言語で、新しい ROCm ガイドによれば、手動で最適化した HIP C++ コードの性能を少ないコード量で達成できます。AMD は既存の HIP カーネルの移植ガイドを公開し、NVIDIA の CUDA ツールチェーンに対する Python ファーストの代替として FlyDSL を位置づけています。

🟢 🔧 ハードウェア 2026年7月7日 · 4 分で読めます

AMDがMI355XのGPU占有率の計算を解説:高い占有率がピークスループットの条件ではない

エディトリアルイラスト:AMD CDNA4 MI355X GPUの占有率数学とカーネルコード最適化

AMD ROCmチームがCDNA4アーキテクチャ向けのGPU占有率を手動で計算するための技術ガイドを公開した。重要な発見:MI355X上のマトリクス依存カーネルはたった12%の占有率でピークスループットを達成する――CUDAエコシステム出身の実務者にとって直感に反する結果だ。

🟢 🔧 ハードウェア 2026年7月7日 · 3 分で読めます

NVIDIA Vera:エージェント型AIに必要なのは多くのコアではなく速いコアだ

エディトリアルイラスト:AIエージェントのループに最適化されたOlympusコアを搭載したNVIDIA Vera CPU

Olympusコアを搭載したNVIDIA Vera CPUはGraceプロセッサ比50%高いIPCと3.4 TB/sのコア間帯域幅を実現。Perplexityはコーディングエージェントのワークフローで1.5倍高速なジョブ完了を記録している。

🟢 🔧 ハードウェア 2026年7月6日 · 4 分で読めます

AMD QuarkがInstinct MI350向けFLUX.1-devのMXFP4量子化で1.92倍高速化を実現

エディトリアルイラスト:AMD MI350 MXFP4量子化が拡散モデルによる画像生成を高速化

AMD Quark 0.12はDiffusersとxDiTフレームワークを通じてInstinct MI350 GPU上でのFLUX.1-dev画像生成モデルのMXFP4量子化を可能にする。torch.compileを使用すると、MXFP4 ASMはリファレンスと同一のCLIPスコアを維持しながらBF16 eagerベースラインに対して1.92倍の高速化を達成する。

🟢 🔧 ハードウェア 2026年7月6日 · 4 分で読めます

AMD Primus Tuning AgentがMI355Xクラスター向けの最適LLM設定を自動発見

エディトリアルイラスト:MI355X上の言語モデル訓練設定の自動チューニングAMD Primus

AMD ROCm Primus Tuning Agentは、確定的シードプランナーとLLM誘導の探索ループを組み合わせ、AMD Instinct GPU上でのLLM訓練の最適設定を自動的に発見する。Mixtral 8×22Bでは約30分の探索でAMDのリファレンスを27%上回るスループットを達成した。

🟢 🔧 ハードウェア 2026年7月6日 · 4 分で読めます

量子技術とAI:今日現実的なものと未来にとどまるもの

エディトリアルイラスト:先進材料研究における量子技術とAIの相補性

Multiverse ComputingとToshiba Corporationの業界専門家がOECD.aiで、量子技術が今日すでにAIを変えている領域と、楽観的な期待が証拠に裏付けられていない領域を解説。テンソルネットワークが計算需要を10〜100倍削減する一方、広範な量子MLの応用は次の10年間は現実的でない。

🟡 🔧 ハードウェア 2026年7月3日 · 4 分で読めます

AMD AgentKernelArena:AIエージェントのGPUカーネル最適化を測るオープンベンチマーク

エディトリアルイラスト:ベンチマークでAIエージェントのカーネルコード最適化に使用されるAMD MI355X GPUチップ

AMD Researchは2026年7月3日、AIコーディングエージェントが実際のGPUカーネルをどの程度最適化できるかを測るオープンベンチマークフレームワーク「AgentKernelArena」を公開した。4カテゴリ214タスクのうち、AMDの独自エージェントGEAKv3(Claude Opus 4.6)がHIPカーネルで9.04倍の速度向上でトップ、Claude Code(Opus 4.6)が6.08倍で2位につけた。すべての実験はAMD Instinct MI300X上でROCm 7.1.1環境下で実施された。

🟡 🔧 ハードウェア 2026年7月3日 · 4 分で読めます

AMD Eagle3とQuark FP8:投機的デコーディングがMI355Xで最大2.00倍のスループットを実現

エディトリアルイラスト:高速推論のためのAMD Instinct GPU上のAMD Eagle3投機的デコーディング

AMD ROCmチームは2026年7月3日、AMD GPU向けEagle3投機的デコーディングの本番適用に関する詳細を公開した。Eagle3マルチレイヤーアプローチ、vLLMバックエンド、AMD Quark FP8量子化の組み合わせにより、AMD Instinct MI355X上でKimi-K2.5が1.69〜2.00倍、MiniMax-M2.5が1.38〜1.79倍のスループット向上を達成し、出力品質の損失はない。

🟢 🔧 ハードウェア 2026年7月3日 · 4 分で読めます

AMD ROCm:GPU常駐型YOLO26パイプラインがデコードから検出まで動画フレームをVRAMに保持

エディトリアルイラスト:YOLO26パイプラインを使用したAMD Radeon GPUの動画物体検出

AMDは、rocDecode、DLPack、PyTorch、MIGraphXを組み合わせたGPU常駐型物体検出パイプラインを発表した。動画フレームが最終的な検出結果が得られるまでVRAMから一切出ないアーキテクチャを実証した。

🟢 🔧 ハードウェア 2026年6月30日 · 4 分で読めます

NVIDIA:BlackwellのソフトウェアスタックがDeepSeek V4のトークンコストを1カ月で5倍削減

エディトリアルイラスト:NVIDIAのBlackwellソフトウェア推論スタックがトークンあたりコストを5倍削減

NVIDIAはBlackwellアーキテクチャでのソフトウェア最適化の積み重ね——NVFP4精度から投機的デコーディングまで——が最大20倍のスループット向上とDeepSeek V4モデルの5倍低いトークンコストを達成する方法を説明する。

🟡 🔧 ハードウェア 2026年6月29日 · 2 分で読めます

AMD: ROCm低レイテンシGEMMカーネルがInstinct MI355XのLLM推論を最大1.79倍高速化

エディトリアルイラスト:Instinct MI355X上でLLM推論を最大1.79倍高速化するROCm低レイテンシGEMMカーネル、テキストと顔なし

AMDはAITERフレームワーク(AI Tensor Engine for ROCm)内にFlyDSLシステムを発表しました。AMD GPU上のLLMデコードフェーズ向けに特化したGEMMカーネルを自動生成します。結果:M≤8トークンの最も重要なシナリオで平均1.64倍のレイテンシ削減と1.79倍の高速化を達成し、256コンピュートユニットを搭載したInstinct MI355Xでテスト済みです。

🟢 🔧 ハードウェア 2026年6月28日 · 2 分で読めます

AMD: Resource Managerが非アクティブなGPUワークロードを自動的にプリエンプションしクラスタの共有プールにリソースを返還

編集用イラスト:データセンターのGPUアクセラレーターの列とリソースフロー、テキストと顔なし

AMD Resource Managerに自動プリエンプション機能が追加されました。ワークロードごとのGPU使用率を監視し、設定可能な閾値(例:10%)を下回るジョブを指定のアイドルタイマー(例:15分)経過後に停止します。2つのポリシーを提供しており、GPU負荷時のみプリエンプションするか常にプリエンプションするかを選択でき、非アクティブな開発環境が占有するリソースを共有プールに返還します。

🟡 🔧 ハードウェア 2026年6月27日 · 2 分で読めます

AMD: MI355XでMXFP4/MXFP6混合精度量子化 — スループット最大29%向上

Editorial illustration: AMD Instinct MI355X GPUアクセラレーターの混合精度量子化ダイアグラムとスループットグラフ

AMDはInstinct MI355X上でW_MXFP4_A_MXFP6混合精度量子化を実証しました。4ビット重みと6ビット活性化を組み合わせ、vLLMフレームワークを用いた本番推論でFP8に近い精度を維持しながら最大29%のスループット向上を実現しています。

🟡 🔧 ハードウェア 2026年6月26日 · 2 分で読めます

NVIDIAとAWS:EC2 G7インスタンスがBlackwell GPUでAI推論を4.6倍向上

編集用イラスト:青い光の効果を持つAWSデータセンター内のNVIDIA BlackwellサーバーGPUラック

NVIDIAとAWSはRTX PRO 4500 Blackwell GPUを搭載したEC2 G7インスタンスを発表しました。前世代のG6比で4.6倍のAI推論性能を実現し、cuVSライブラリはAmazon OpenSearch Serverlessでデフォルトとなり、ベクター索引作成が10倍高速化されます。

🔴 🔧 ハードウェア 2026年6月25日 · 3 分で読めます

OpenAI: JalapeñoチップをBroadcomと共同開発 — NVIDIAへの依存から脱却を図るカスタムASIC

エディトリアルイラスト: 回路基板上にJalapenoとラベルされた未来的なAI推論チップ、グリーンのアクセント照明、顔やテキストなし

OpenAIとBroadcomはLLM推論に最適化されたカスタムASICチップ「Jalapeño」を共同発表しました。OpenAIが独自シリコンの分野に参入する戦略的な動きで、Google TPU・Apple Neural Engine・AWS Trainiumと並ぶ存在となり、NVIDIAのGPUへの依存を低減します。

🟢 🔧 ハードウェア 2026年6月25日 · 2 分で読めます

AMD: ATOMオプティマイザー — MI355X上でDeepSeek-V4向けDP AttentionとTwo-Batch Overlap

エディトリアルイラスト: AMD MI355X GPUチップと推論ワークロードのスループット最適化グラフ

ATOMはAMDのオープンソース推論エンジンで、MI355X GPU上でDeepSeek-V4に2つの最適化をもたらします。PrefillDelayerはランク間の調整ロスを排除し、Two-Batch Overlapはネットワーク操作のオーバーラップによりトークンのバランシングを高速化します。

🟢 🔧 ハードウェア 2026年6月24日 · 2 分で読めます

AMD ROCm: EAGLE3投機的デコードがMI325X上でKimi-K2.5を33%高速化

編集用イラスト:データセンター内のAMD Instinct MI325X GPUカードとテキスト生成速度の上昇グラフ

AMD ROCmチームが8基のInstinct MI325X上でEAGLE3投機的デコードをKimi-K2.5モデルに適用した結果、GSM8Kベンチマークの精度を維持したまま出力スループットが33%向上し、中央値トークン間レイテンシが58%低下しました。

🟡 🔧 ハードウェア 2026年6月23日 · 3 分で読めます

NVIDIA: JUPITER — ヨーロッパ初のエクサスケールスーパーコンピュータがISC 2026で科学記録を更新

Editorial illustration: Europski datacenter s NVIDIA Grace Hopper čipovima i plavim infiniband kabelima

JUPITERはドイツのフォルシュングスツェントルム・ユーリッヒに設置されたヨーロッパ初のエクサスケールスーパーコンピュータです。NVIDIA Grace Hopper SuperchipとQuantum-X800 InfiniBandネットワークで駆動するJUPITERは860億のニューロンをマッピングし、50量子ビットのシミュレーションで量子記録を更新し、気候シミュレーションで世界記録を達成しました。

🟡 🔧 ハードウェア 2026年6月23日 · 2 分で読めます

NVIDIA: ロスアラモスにVera CPU登場 — 核科学向けエージェントAIを7倍高速化、新スーパーコンピュータ3台

Editorial illustration: NVIDIA Vera CPU procesorski čip i shema superračunala u istraživačkom laboratoriju

OlympusコアとLPDDR5メモリを搭載したNVIDIA Vera CPUは、現在のCrossroads x86プロセッサと比べてロスアラモス国立研究所のURSAワークロードで7倍、熱移動モンテカルロシミュレーションで3倍の高性能化を実現します。Mission、Vision、Veritasの3つの新スーパーコンピュータが2027年に稼働予定です。

🟢 🔧 ハードウェア 2026年6月23日 · 2 分で読めます

NVIDIA: CUDA-Xライブラリ cuPhoton・DAQIRI・ALCHEMIが天文学・化学・素材研究を加速

Editorial illustration: NVIDIA GPU supercomputing hardware powering scientific data visualization with astronomical and molecular graphics

NVIDIAは科学AIのための3つの新しいCUDA-Xソフトウェアライブラリを発表しました。天文学向けcuPhotonは最大14,900倍の高速化、Lila SciencesのALCHEMIは素材スクリーニングで50倍の高速化、DAQIRIは物理検出器のリアルタイムネットワーキングを高速化します。

🟢 🔧 ハードウェア 2026年6月20日 · 1 分で読めます

AMD:ROCm最適化でMatrix3DのInstinct GPU向け3D世界生成が最大54%高速化

編集用イラスト:手続き的に生成された3D景観がGPUコアから浮かび上がる様子

AMDはROCmブログにて、AMD Instinct GPU上で探索可能な3D世界を生成するフレームワーク「Matrix3D」の最適化を紹介しました。CUDAコンポーネントをTritonカーネルに置き換え、gsplatライブラリを使った3DGSを活用することで、MI250では54%、MI300では50%レンダリングが高速化し、レンダリングカーネル自体もCUDA版より36%速くなりました。

🟡 🔧 ハードウェア 2026年6月19日 · 2 分で読めます

AMD:大規模言語モデル訓練におけるRoCEネットワークトラフィックパターン分析

編集イラスト:大規模言語モデル訓練におけるRoCEネットワークトラフィックパターン分析

AMDは、スケールアウトGPUクラスター環境においてGPT-4、Llama 3、DeepSeek-V2、Grok 4.0の4つの大規模言語モデルを訓練する際に発生するRoCEネットワークトラフィックパターンの比較分析を公開しました。これはAIインフラ構築の実践的なガイドとなります。

🟢 🔧 ハードウェア 2026年6月18日 · 1 分で読めます

AMD:オープンソース Schola が Unreal Engine と強化学習を接続し、ROCm 上でロボットアームをトレーニング

エディトリアルイラスト:シミュレーション環境での強化学習によるロボットアームのトレーニング

AMD は Schola を発表しました。これは Unreal Engine 向けのオープンソースプラグインで、Python フレームワークと gRPC を通じて Gymnasium 互換の強化学習トレーニングを可能にします。例では、協調ロボットアーム xArm6 が Unreal Engine 5.7 上で MuJoCo 物理エンジン・PPO アルゴリズム・PyTorch を AMD ROCm GPU スタックで使用してトレーニングされます。チュートリアルはアームの先端をランダムな目標位置に移動させるリーチタスクを示しています。

🟡 🔧 ハードウェア 2026年6月17日 · 1 分で読めます

AMD:Instinct MI355X がMLPerf Training v6.0でNVIDIAとの差を5%に縮小、前世代比3.5倍の性能

編集用イラスト:データセンター内のAMD Instinct MI355Xアクセラレーター

AMDはMLPerf Training v6.0でInstinct MI355XがLLMベンチマークにおいて同等のNVIDIA GPUとの性能差が約5%であることを示しました。MI355Xは昨年のMI300Xより3.5倍高速で、前ラウンドより13〜19%高速です。AMDはMXFP4(FP4)トレーニングレシピとPrimusユニファイドフレームワークを初めて導入し、512基のMI300X GPU、64ノードのマルチノード提出も行いました。

🟡 🔧 ハードウェア 2026年6月17日 · 2 分で読めます

NVIDIAのBlackwellがMLPerf Training 6.0を制覇 — 全7ベンチマーク首位、GB300は最大1.6倍高速

編集用イラスト:AIモデルトレーニング向けNVIDIA Blackwell GPUクラスター

NVIDIAはBlackwellプラットフォームがMLPerf Training 6.0の全7テストで最高成績を達成したと発表しました。GB300 NVL72はGB200 NVL72と比べて最大1.6倍高速なトレーニングを実現し、最大規模の提出では8192基のBlackwell GPUを使用して6710億パラメータのDeepSeek-V3モデルを学習しました。CoreWeaveは8192基のGPUでDeepSeek-V3 671Bを2.02分でトレーニングし、Microsoft AzureはLlama 3.1 405Bを7.07分で完了しました。

🟡 🔧 ハードウェア 2026年6月16日 · 2 分で読めます

AMD:Instinct GPU向けの新推論エンジンATOMがOpenAI互換APIとMoE最適化を提供

編集用イラスト:AIモデルサービング向けAMD Instinct GPUスタック

AMDはInstinct GPU向けの推論エンジンATOMを発表しました。OpenAI互換APIを公開し、KVキャッシュ、スケジューリング、並列性を調整します。ATOMはROCmスタックの最上位に位置し、AITERカーネルとMoRI RDMA通信を組み合わせ、TP・DP・EP並列性をサポートし、DeepSeek V2〜V4、Mixtral、Qwen3-MoEなどのMoEモデルに最適化されています。FP8、MXFP4、INT8、INT4量化とEAGLEプロポーザーを用いたMTP投機的デコーディングを提供します。

🟢 🔧 ハードウェア 2026年6月12日 · 4 分で読めます

リサイクルされたPixelスマートフォンがデータセンターに:2000台、炭素フットプリントを50%削減

社説イラスト:Googleが2000台の廃棄Pixelスマートフォンを低炭素データセンターに変換

UC San DiegoのGoogleが支援する研究者たちが、2000台の廃棄されたPixelスマートフォンからデータセンターを構築している。マザーボードを保持することで組み込み炭素を約50%節約でき、25〜50台のスマートフォンのクラスターがすでに75の並列コンピューティング学生コースのピーク負荷を処理している。

🟡 🔧 ハードウェア 2026年6月4日 · 3 分で読めます

Black Forest Labs: FLUX.2 [klein] がASUS ProArtノートPCにプリインストールで登場

編集イラスト:FLUX.2 [klein] がASUS ProArtノートPCにプリインストールで登場

Black Forest Labsは、ASUSおよびNVIDIAとの提携により、FLUX.2 [klein] をASUS ProArtの民生用ノートPCにプリインストールして提供する。これはFLUXモデルが民生用ハードウェアにプリインストールされて出荷される初の事例である。40億パラメータのこのモデルは、クラウドに依存せずローカルで、1秒未満での画像生成と編集を可能にする。

🟡 🔧 ハードウェア 2026年6月1日 · 2 分で読めます

OpenAI: ミシガン州に Stargate データセンターを発表

編集イラスト: ミシガン州に Stargate データセンターを発表

OpenAI は、米国ミシガン州に新たな Stargate データセンターを建設すると発表した。これは、OpenAI がいわゆる Intelligence Age の文脈に位置づける、計算能力のための Stargate インフラプログラムの拡張である。今回の発表では容量や投資に関する詳細は展開されていないため、公式の情報源を参照してほしい。

🟢 🔧 ハードウェア 2026年6月1日 · 2 分で読めます

AMD: Alibaba の ROLL フレームワークが Instinct GPU 上でネイティブ動作

編集イラスト: Alibaba の ROLL フレームワークが Instinct GPU 上でネイティブ動作

AMD は、Alibaba のオープンソース強化学習フレームワーク ROLL が、コード変更・カスタムパッチ・非標準ビルドなしに、ROCm ソフトウェアとともに AMD Instinct GPU 上でネイティブに動作するようになったと発表した。協業には vLLM 互換性、Ray 向けの修正、大規模言語モデルの分散 RL トレーニングへの対応が含まれる。

🟢 🔧 ハードウェア 2026年5月29日 · 2 分で読めます

AMD:MI300X上の投機的デコーディングが推論を4.3倍高速化

編集イラスト:MI300X上の投機的デコーディングが推論を4.3倍高速化

AMDはROCmブログで、Instinct MI300X GPU上での投機的デコーディングの実装を紹介しました。より小さいドラフトモデルがトークンを予測し、より大きいモデルがそれを検証するこの技術は、従来の自己回帰生成と比べて最大4.3倍のスループットを達成しました。

🟢 🔧 ハードウェア 2026年5月27日 · 3 分で読めます

AMD ROCm:4ウェーブインターリーブによるFP8 GEMMカーネル最適化でMI355Xのレジスタ予算を2倍に

Urednička ilustracija: 4-valna interleave optimizacija FP8 GEMM kernela za Instinct MI355X (CDNA 4) udostručuje regist

AMD ROCmブログが、CDNA 4アーキテクチャを搭載したInstinct MI355XアクセラレーターにおけるFP8 GEMM(混合精度行列乗算)カーネルの新しい4ウェーブインターリーブアプローチを解説しています。この最適化は8ウェーブのpingpongアプローチから512レジスタの完全なVGPR予算を持つ4ウェーブ構成に切り替え、XORベースのスウィズルによりLDSメモリの競合を排除し、MFMAとデータロードの精密な重複実行でメモリレイテンシを隠蔽します。

🟢 🔧 ハードウェア 2026年5月27日 · 1 分で読めます

PyTorch:TokenSpeedがNVIDIA Blackwell GPUでQwen3.5-397B-A17Bの580トークン/秒という記録を達成

Urednička ilustracija: TokenSpeed postiže rekordnih 580 token/s na Qwen3.5-397B-A17B s NVIDIA Blackwell GPU-ima

LightSeek FoundationのオープンソースLLM推論エンジン(MITライセンス)TokenSpeedが、TP8構成で8台のNVIDIA Blackwell B200 GPUを使用してQwen3.5-397B-A17Bモデルで毎秒580トークンを達成しました。この記録は、プレフィックスキャッシングとCPU-GPU実行のオーバーラップを備えたエージェント的ワークロードで達成され、100万トークンのコンテキストでも16%未満のパフォーマンス低下を示しています。

🟡 🔧 ハードウェア 2026年5月25日 · 2 分で読めます

AMD: Ryzen AI Max+ 395が最大1220億パラメータのLLMモデルを統合メモリで動作させる

Urednička ilustracija: Ryzen AI Max+ 395 pokreće LLM modele do 122 milijarde parametara uz zajedničku memoriju

AMD ROCmブログは、UMA(統合メモリアーキテクチャ)を採用したRyzen AI Max+ 395プロセッサでのLLM推論に関する詳細な分析を公開しました。128 GB LPDDR5Xメモリを搭載したシステムは、完全GPUオフロードでQwen3.5 35B MoEモデルにおいて42トークン/秒を達成し、CPUとGPUメモリを組み合わせることで最大1220億パラメータのモデルもサポートします。

🟢 🔧 ハードウェア 2026年5月23日 · 4 分で読めます

AMD:GluonブロックレベルモデルでInstinct MI355のMXFP4 5.255 TFLOPSを実現

編集イラスト:行列ユニットとパイプラインを持つGPUアクセラレータ

AMD ROCmチームがMI355 GPU向けGluonプログラミングモデルで高性能GEMMカーネルを作成するチュートリアルを公開しました。最適化されたFP16カーネルはMFMA効率98.75%で1.489 TFLOPSを達成し、BF8(3.257 TFLOPS)およびMXFP4(5.255 TFLOPS)への拡張は現代のAIワークロードへの有効性を示しています。チュートリアルにはL2キャッシュミスを530万から410万に削減するワークグループリマッピングとswizzleが含まれています。

🟡 🔧 ハードウェア 2026年5月21日 · 2 分で読めます

AMD:ROCm 7.13がMI350P GPU、マルチVF仮想化、TheRockモジュラーパッケージを導入

Editorial illustration: AMD ROCm 7.13がMI350P GPU、マルチVF仮想化、TheRockモジュラーパッケージを導入

AMDは2026年5月20日、オープンソースAIコンピュートスタックの新バージョンROCm 7.13を発表しました。MI350P GPUのサポート、MI300Xアクセラレーター1基あたり最大8つの分離vGPUによる仮想化、透明性のあるパフォーマンス分析のためのオープンソースROCprof Traceデコーダー、ドメイン固有SDKを備えたモジュラーTheRockパッケージングが新たに導入されます。Ubuntu 26.04とRHEL 9.6で検証済みで、MI350XとMI355XのVMware ESXi 9.1サポートも含まれます。

🟢 🔧 ハードウェア 2026年5月16日 · 4 分で読めます

AMD ROCm: BubbleFenceがメタデータヒューリスティックの代わりにVision Foundation Modelの埋め込みでビデオストリームを分割

Editorial illustration: 2D空間での埋め込みバブル可視化を持つビデオフレーム。

BubbleFenceは、AMDが2026年5月15日にROCmブログで発表した新しいAIツールで、意味的漏洩なしにビデオストリームを訓練/検証/テストセットに意味的に分割するという根本的なML問題を解決します。従来のメタデータベースのヒューリスティックの代わりに、BubbleFenceはVision Foundation Modelの埋め込み(CLIP)とLID重み付けを持つ適応バブルを使用して分割します。構成変更なしに自動運転(Zenseact Open Dataset)とMinecraftゲームプレイシナリオで実証されました。

🟢 🔧 ハードウェア 2026年5月15日 · 3 分で読めます

AMD ROCm: Quark + FlyDSL + AITER 推論スタックを通じた MI325X での Kimi-K2.5 W4A8 および W8A8 量子化

編集イラスト:W4A8 量子化レイヤーと推論加速アイコンを持つ AMD MI325X GPU の図。

AMD ROCm Kimi-K2.5 の MI325X 向け量子化は、2026 年 5 月 14 日に公開された新しい推論加速ブループリントです。AMD Quark 量子化ツールキットで Kimi-K2.5 モデルを W4A8 および W8A8 精度フォーマットに変換し、FlyDSL 推論サービングレイヤーと AITER 最適化スタックを組み合わせます。このアプローチは中国のフロンティアモデルに非 NVIDIA の推論パスを提供し、MI325X をオープンソース LLM サービングの H100/H200 の実行可能な代替として位置づける AMD の戦略を示しています。

🟡 🔧 ハードウェア 2026年5月12日 · 2 分で読めます

AMD: Instinct MI355X が ComfyUI ワークフロー 3 種で NVIDIA B200 を上回る——ROCm 7.2.0 の PyTorch 最適化が寄与

Editorial illustration: Instinct MI355X が ComfyUI ワークフロー 3 種で NVIDIA B200 を上回る——ROCm 7.2.0 の PyTorch 最適化が寄与

AMD Instinct MI355X はデータセンター GPU で、発表されたベンチマークで 3 つの ComfyUI 生成ワークフロー——テキストtoビデオ Wan2.2(1.44×)・テキストto画像 FLUX.1-dev(1.42×)・3D Hunyuan3D v2.1(1.20×)——において NVIDIA B200 を上回りました。ROCm 7.2.0 の AOTriton gfx950 カーネル・hipBLASLt GEMM チューニング・その他最適化によって実現しています。

🟡 🔧 ハードウェア 2026年5月12日 · 2 分で読めます

NVIDIA: Fleet Intelligence——大規模 GPU フリートの暗号学的整合性検証付きリアルタイム監視

Editorial illustration: Fleet Intelligence——大規模 GPU フリートの暗号学的整合性検証付きリアルタイム監視

NVIDIA Fleet Intelligence は、大規模な NVIDIA データセンター GPU フリートをリアルタイムで監視するマネージドサービスです——電力・温度・パフォーマンス・ECC エラーを監視し、NVIDIA Remote Attestation Service による GPU の暗号学的真正性確認を行います。Vera Rubin・Blackwell・Hopper GPU の所有者は無料で利用できます。

🟡 🔧 ハードウェア 2026年5月11日 · 2 分で読めます

vLLM: TurboQuant研究でFP8がKV-cacheで依然優位——3bit-ncは精度が約20ポイント低下

Editorial illustration: TurboQuant研究でFP8がKV-cacheで依然優位——3bit-ncは精度が約20ポイント低下

Red Hat AIチームはTurboQuantによる攻撃的なKV-cache量子化(3〜4ビット)とFP8標準を体系的に比較しました。結果はFP8がスループットと精度を維持する一方、3bit-nc変種がAIME25などの高難易度推論ベンチマークで約20ポイントの精度低下を示すことを明らかにしています。

🔴 🔧 ハードウェア 2026年5月7日 · 3 分で読めます

NVIDIA:Spectrum-X マルチパス信頼性接続がOCPオープン標準となり、ギガスケールAIネットワークへ

Editorial illustration: paralelne svjetlovodne staze između AI rack-ova s natpisom MRC, Spectrum-X i OCP open standard

NVIDIA Spectrum-X マルチパス信頼性接続(MRC)は、単一接続のトラフィックを複数のネットワークパスに分散させるRDMAトランスポートプロトコルで、Open Compute Projectを通じてオープン仕様として公開されました。MRCはすでにOpenAI、MicrosoftのFairwaterデータセンター、OracleのAbileneデータセンターで本番稼働しており、AMD・Broadcom・Intel・Microsoftとの共同開発で生まれました。

🟡 🔧 ハードウェア 2026年5月6日 · 2 分で読めます

AMD: FarSkip-Collective が AMD GPU 上の MoE 推論を 18〜34% 高速化

編集イラスト:アイドルブロックなしでの MoE 推論中に AMD GPU 間を流れる並列データストリーム

AMD ROCm チームが FarSkip-Collective を発表しました。これは Expert Parallelism 通信中の GPU アイドル時間を解消する改良型 MoE アーキテクチャです。結果:Llama-4 Scout の TTFT が 18% 短縮、DeepSeek-V3 で最大 1.34× の高速化、Moonlight の事前学習フェーズが 11% 高速化。

🟡 🔧 ハードウェア 2026年5月5日 · 3 分で読めます

ArXiv SAGA:AIエージェント向けワークフロー原子化GPUスケジューリング、64-GPUクラスターでタスク完了を1.64倍高速化、HPDC 2026採択

編集イラスト:原子的単位として接続されたエージェントワークフローを持つGPUクラスター、スケジューリングの象徴

Dongxin Guo、Jikun Wu、Siu Ming Yiuのチームは2026年5月1日、SAGA——GPUクラスター上のAIエージェント向けワークフロー原子化スケジューラーを発表しました。個々のLLM呼び出しではなく、エージェントのワークフロー全体を単一のスケジュール可能な単位として扱います。64-GPUクラスターでタスク完了時間の幾何平均1.64倍削減、マルチテナント負荷下でSLO達成率99.2%を実現します。論文はHPDC 2026(クリーブランド、2026年7月13-16日)に採択されました。

🟢 🔧 ハードウェア 2026年4月25日 · 3 分で読めます

AMD Primus Projection:InstinctGPUクラスターでLLMトレーニングを開始する前にメモリと速度を予測するツール

編集イラスト:AMD Primus Projection——LLMトレーニング予測

AMD Primus ProjectionはInstinct GPUクラスターでLLMトレーニングを開始する前にメモリ要件とスループットを予測するツールです。分析式と実際のGPUベンチマークを組み合わせ、LlamaとMixtralモデルに対するMI325XとMI355Xアクセラレーターでの予測誤差は約10%以内です。

🟢 🔧 ハードウェア 2026年4月24日 · 3 分で読めます

GoogleがCloud Next '26でTPU 8iとTPU 8tを発表:エージェントAIコンピューティング向け専用チップ

エディトリアルイラスト:Google TPU 8iと8t——専用AIチップ

GoogleはCloud Next '26カンファレンスでTPU 8i(AIエージェント推論用)とTPU 8t(最も複雑なモデルのトレーニング用)という2つの新世代TPUチップを発表しました。この動きはGoogleのTPUラインを「エージェント時代」のコンピューティングにおける2つの専門的なブランチに正式に分割するものです。

🟡 🔧 ハードウェア 2026年4月23日 · 3 分で読めます

NVIDIAとGoogle Cloudが共同インフラ上でエージェンティックAIとフィジカルAIの協力を発表

エディトリアルイラスト:AIチップ——hardware

NVIDIAとGoogle CloudはNVIDIAのGPUインフラとGoogle Cloudプラットフォームを組み合わせ、ロボティクス、自律型システム、エージェントの分野でエージェンティックAIとフィジカルAIのワークロードを加速する共同協力を発表しました。

🟢 🔧 ハードウェア 2026年4月23日 · 3 分で読めます

Gemma 4がNVIDIA Jetson Orin Nano Superでローカル動作するVision Language Agentとして実証

エディトリアルイラスト:AIチップ — hardware

NVIDIAとHuggingFaceは、Gemma 4がNVIDIA Jetson Orin Nano Super(8GBメモリ)上でVision Language Agent(VLA)として完全にローカルで動作するデモを披露しました。カメラ使用の自律判断から音声認識とTTSを含む完全なパイプライン処理まで、クラウド依存なしにすべてが実行されます。

🔴 🔧 ハードウェア 2026年4月22日 · 3 分で読めます

Googleが第8世代TPUチップを発表:エージェント型AI時代に向けた2つの専用バリアント

エディトリアルイラスト:エージェント型AIワークロードのトレーニングと推論向けの第8世代2種類のTPUチップ

GoogleはCloud Next '26カンファレンスにて、第8世代TPUチップを2つの専用バリアントとして発表しました。モデルのトレーニング向けのTPU 8tと、エージェント型推論向けのTPU 8iです。自律型AIエージェントとマルチステップ推論を主用途として設計された初めての世代となります。

アーカイブ全体を見る →