▮▮Coloprice
← ガイドと分析

· ai-data-centers

AIインファレンスとトレーニング:異なるインフラ要件

トレーニングクラスタは40-160+ kWのラック、液冷およびInfiniBandが必須。インファレンスはより低い密度、安価なチップ、ユーザー近くのサイトが必要。完全な比較。

AIインファレンスとトレーニング:異なるインフラ要件

トレーニングとインファレンスは、異なるハードウェアで対応する同一のワークロードではありません。トレーニングクラスタは数千の最先端GPUを少数のメガキャンパスに集約し、40-160+ kW/ラックでInfiniBandファブリックと必須の液冷で動作します。一方、インファレンスはより多数の小規模で、より安価なサイトで、エンドユーザーに近い場所で動作し、2026年の推定によれば、現在すべてのAIコンピュートの約3分の2を占めています。

主要なポイント

  • インファレンスは2026年中にコンピュート共有でトレーニングを上回りました。 IntrolおよびAgentMarketCapが編集した業界推定では、インファレンスは2023年のAIコンピュートの約3分の1、2025年には約半分、2026年には約3分の2を占めています。
  • 電力密度が大きく分岐しています。 H100/B200/GB200ハードウェア上のトレーニングラックは40-160+ kWで動作し、次世代パーツは300 kWを超えることが予想されます。インファレンスラックは通常12-60 kWで動作しますが、大規模推論モデルのインファレンスは同じトレーニングクラスのチップと密度に移行しています。
  • 冷却はワークロードラベルではなく密度で決定されます。 約30-40 kWを超えるラックは、トレーニングか推論かを問わず、チップ直結液冷または浸漬液冷が必要です。液冷ガイドをご覧ください。
  • トレーニングは距離を許容しますが、インファレンスはしません。 トレーニングはライブユーザーを待つバッチジョブではないため、最も安い電力の場所に移動します。インファレンスはリアルタイムリクエストを処理するため、オペレータはユーザーに近い大都市市場に配置します。
  • ネットワーク要件はコスト感度で1桁異なります。 トレーニングクラスタはポートあたり数千ドルのInfiniBandまたは800G Ethernetファブリックを正当化しますが、インファレンスワークロードはほとんどの場合、標準400G Ethernetで十分です。
  • チップ構成も異なります。 トレーニングは最高スループットパーツに集中したままですが、インファレンスはピークスループットではなくトークンあたりのコストで選択したより安価なアクセラレータ(L40S、L4、TPU、カスタムASIC)にシフトしています。
  • 購入者への意味は、チップ選択だけでなく容量計画です。 2030年までに、ほとんどの予測はインファレンス(トレーニングではなく)がデータセンター需要の主要なワークロードであることに同意しています。

両方のワークロードクラス全体でのライブGPUあたりのレンタル率はGPUプライスインデックスに、サイトレベルの電力および冷却仕様はデータセンターカタログにあります。

なぜこの分岐が今重要なのか

2023-2024年を通じて、「AIデータセンター」はほぼ1つのことを意味していました:トレーニングクラスタです。フロンティアラボは数万のGPUでますます大規模なモデルをトレーニングし、インフラの会話はそのビルドについてでした:InfiniBandファブリック、液冷、ギガワットスケールのキャンパス。その会話はもはや完全ではありません。基盤モデルが研究から本番へ移行したため—チャットボット、コパイロット、エージェント、検索、推奨—ユーザーのリクエストに答えるために費やされたコンピュートがモデルを構築するために費やされたコンピュートを上回り始めました。

IntrolおよびAgentMarketCapが編集した業界のコンピュート共有推定では、インファレンスは2023年のAIコンピュートの約3分の1、2025年までに約半分、2026年には約3分の2を占めています。クラウドインファレンスインフラの支出は2025年の92億ドルから2026年の206億ドルと推定されています。アナリスト全体にわたる方向性のコンセンサスは、インファレンスが10年間の残りを通じてシェアを取り続けることです。EdgeCoreとIntrolは両社とも2030年までにデータセンター需要の約70%がインファレンスから発生することを引用し、1つの長期容量予測では、インファレンスが2033年頃にトレーニングを上回り、2035年までに約46 GWの専用容量に達すると予想しています。

データセンター容量を購入または構築している人にとって、そのシフトはRFPを変更します。トレーニングエコノミクス向けに設計された施設—最大密度、最大相互接続帯域幅、エンドユーザー遅延への最小限の関心—は、数十の大都市市場から数百万の低遅延リクエストを提供することを目的としたインファレンスサイトのフリートには間違った仕様です。

電力密度:2つの曲線、上部で収束

ワークロード 典型的なラック密度(2026) ドライバー
レガシーインファレンス(L4/L40Sクラス) 12-30 kW コスト最適化チップ、空冷
高スペックインファレンス(大規模推論モデル) 30-60 kW レイテンシーとスループット要件がトレーニングクラスハードウェアへのシフトを強要
標準トレーニング(H100/H200) 40-100 kW マルチGPUノード、NVLinkドメイン
フロンティアトレーニング(B200/GB200 NVL72) 120-160+ kW ラックスケールNVLinkドメイン、次世代パーツは300+ kWへのトレンド

出典:EdgeCore、Introl、および当社の電力密度ガイド。GB200 NVL72の測定された130-132 kW消費について詳述しています。

2つの曲線は上端で収束しています。推論の多いインファレンスワークロードが複数ステップのエージェントクエリを提供することは、ますますトレーニングに使用されるのと同じH100またはB200クラスのシリコンで実行されるようになっています。これは、L4のような軽いインファレンスチップが経済的に処理できるのをはるかに上回っています。つまり、「低密度インファレンス」向けにのみ設計された施設は、2026年のインファレンストラフィックの重要な部分に対してすでに時代遅れです。

冷却:密度が決定、ワークロードラベルではなく

約30-40 kWを超えるラックは、トレーニングジョブを実行しているかインファレンスリクエストを提供しているかに関わらず、チップ直結液冷または浸漬液冷が必要です。空冷はその規模の熱を経済的に除去することはできません。2026年の実際の分割は次のとおりです:

  • レガシーおよび中堅インファレンス(L4、L40S、古いA100フリート)12-30 kW/ラックは空冷に留まり、通常はホットアイル周囲に対応します。
  • 高密度インファレンスとすべての最新トレーニング(H100以上)40 kW以上では、DLCまたは浸漬がベースライン設計要件です。オプションではありません。

単一目的のトレーニングキャンパスを構築しているオペレータは、1つの冷却アーキテクチャで標準化できます。インファレンス中心のコロケーションプロバイダーは、同一施設内で両方をサポートする必要があります。コモディティインファレンス用の空冷ホールと、推論モデルおよびトレーニング隣接ワークロード用の液冷ゾーンです。

ネットワーキング:InfiniBandエコノミクスはインファレンスに進出しません

トレーニングパフォーマンスは、数千のGPUが全削減操作全体で勾配をどれだけ速く同期できるかに制限されるため、ネットワークファブリックは事後考慮ではなく、一次コスト駆動因子です:

ファブリック 有効帯域幅(8ノードH100クラスタ) レイテンシー 典型的な用途
InfiniBand NDR 400G ~350 GB/s ~1-2 µs 大規模トレーニングクラスタ
Ethernet + RoCEv2(400GbE) ~270-290 GB/s ~5-10 µs 中規模トレーニング、高スペックインファレンス
標準Ethernet(400G) ほとんどのインファレンスで十分 この規模でレイテンシー非クリティカル コモディティインファレンス

IntrolおよびLightyearが公開NCCL Benchmarkからコンパイルしたデータ。

InfiniBandのレイテンシーと帯域幅の優位性はトレーニングで重要です。遅い相互接続が同期ステップ中に毎回数千のGPUを失速させるためです。ネットワーク不足供給のコストはトレーニング実行の全体的なクラスタを通じて複合します。インファレンスは同じ方法で全削減ボトルネックを持っていません。KVキャッシュ転送とリクエストルーティングはマイクロ秒レベルのレイテンシーに低感応性のため、InfiniBandはコスト効率に劣ります。800G Ethernetファブリックは2025年のAIクラスタスイッチ出荷を支配し、2026年を通じてトレーニングおよびインファレンスのローエンドからミッドエンドでInfiniBandを置き換え続けることが予想されます。一方InfiniBandは極端規模トレーニングセグメントを保持しています。

地理:トレーニングは電力に、インファレンスはユーザーに

これは最も顕著な運用上の違いです。トレーニングはスケジュール化されたバッチジョブです。個別のトークンをリアルタイムで待つ人はいないため、オペレータはリモートワイオミング州、リモートマレーシア、または専用の原子力隣接キャンパスでも最も安い電力と用地を最適化します。グリッド接続キューSMR/核電力データセンターについてのガイドを参照してください。トレーニングキャンパスが近接性よりも電力可用性をますます追求する理由について。

インファレンスは反対の問題です。チャットボットまたはコパイロットの応答には、1秒以下を待つユーザーがいます。ネットワークラウンドトリップ時間は物理的距離とともに増加します。クラウドリージョンは通常、ペイロードとネットワークパスに応じて10-50msの範囲でインファレンスを配信できます。これはほとんどの会話アプリケーション向けには十分ですが、人口密集地から距離が遠ざかるにつれてその数字は悪化します。これがハイパースケーラーが少数のメガキャンパスではなく、数十から数百の大都市隣接サイトにインファレンス容量を展開する理由です。これはエッジコンピューティングユースケースガイドでカバーされている同じロジックです。インファレンスはほとんどのエッジAI展開を実際に正当化するワークロードクラスですが、トレーニングは本質的にそうではありません。

チップ選択:トレーニング向けスループット、インファレンス向けクエリあたりのコスト

チップ オンデマンド率(中央値、2026) 主な役割
NVIDIA GB200(GPU単位) ~$18.79/時間 フロンティアトレーニング
NVIDIA B200 ~$6.99/時間 トレーニング、高スペックインファレンス
NVIDIA H100 ~$3.30/時間 トレーニング、推論モデルインファレンス
NVIDIA L40S ~$0.90/時間 コスト最適化インファレンス

Colopropriceオンデマンド率(Colopropriceオンデマンド率)から、2026年8月24日更新。プロバイダーによるレンジは、ここに示されている中央値をはるかに超えて異なります。

トレーニングはほぼ常に利用可能な最高スループットパーツを購入します。トレーニングコストは高額なマルチGPUジョブの経過時間に支配されるためです。実行を短縮するより速いチップはプレミアムの価値があります。インファレンスは反対の変数を最適化します。アプリケーションが必要とするレイテンシーでのトークンあたりまたはクエリあたりのコスト。これが本番インファレンスの大部分がL40SまたはL4クラスのハードウェアで実行される理由であり、GoogleのTPU、AWS Inferentia、およびハイパースケーラーからのカスタムASICなどの推論最適化シリコンがインファレンスで特に進出している理由です。Googleはパブリックにおいて、TPUフリートのインファレンスワークロードに対する実質的な価格パフォーマンス優位性を引用しています。推論の多いインファレンスは、複数ステップのエージェントクエリが単一パスのチャット完了より1桁多くのコンピュートを消費できるため、チップ選択をトレーニングクラスハードウェアに戻す例外です。

コロケーション購入者への意味

  1. インファレンス容量をトレーニングクラスタのようにスペックしないでください。 InfiniBandファブリックと100%液冷ホールをコモディティインファレンスの大部分を占めるワークロード向けにオーバービルドすることは、アプリケーションが実際に必要とするレイテンシーまたはスループットで何も購入しないキャピタルを浪費します。
  2. 推論モデルインファレンスもアンダービルドしないでください。 インファレンスワークロードにエージェントまたは複数ステップの推論が含まれている場合は、12-30 kWの空冷ベースラインではなく、トレーニング隣接密度(40 kW+)および液冷準備をバジェットしてください。
  3. トレーニングは電力に向け、インファレンスはユーザーに向けてサイト構築してください。 データセンターカタログを使用して、トレーニング向けの電力豊富なセカンダリー市場とインファレンス向けのより良い接続を持つ大都市市場を比較してください。2つのサイト選択問題は同じ施設を指すことはめったにありません。
  4. GPUあたりではなくワークロードあたりの総コストをモデル化してください。 低いトークンあたりのワット数を持つより安価なインファレンスチップは、電力コストが含まれると高価な方に負ける可能性があります。引用サービスを通じて両方の構成の見積もりをリクエストしてください。
  5. 施設要件が高スペックで収束し続けることを予期してください。 推論モデルがより多くのインファレンスをトレーニングクラスハードウェアに押しやるため、1つのワークロードタイプのみを構築したコロケーションプロバイダーは改装を見つけることになります。事実の後ではなく、今、混合密度、混合冷却容量を計画してください。

コロケーション価格インデックスおよび市場統計で両方のワークロードクラスのライブ価格と市場ベンチマークを追跡してください。

よくある質問

AIトレーニングとインファレンスのインフラの違いは何ですか?

トレーニングクラスタは、数千の最先端GPU(H100、B200、GB200)をメガキャンパスに集約し、40-160+ kW/ラックで動作し、InfiniBandまたは800G Ethernetファブリックと必須の液冷を搭載しています。インファレンスは、より多数の小規模で地理的に分散したサイトで動作し、通常は12-60 kW/ラック、安価なチップ上で標準Ethernet経由で実行され、ユーザーに近い場所に配置されて遅延を削減します。

2026年ではインファレンスとトレーニング、どちらが規模が大きいのですか?

インファレンスは2026年中にコンピュート共有でトレーニングを上回りました。IntrolおよびAgentMarketCapが編集した業界推定によれば、インファレンスは2023年のAIコンピュートの約3分の1、2025年には約半分、2026年には約3分の2を占めています。クラウドインファレンスインフラの支出は2025年の92億ドルから2026年の206億ドルに達すると予想されています。

AIインファレンスには液冷が必要ですか?

必ずしもそうではありませんが、ますます必要になっています。L4またはL40Sなどのチップ上のレガシーインファレンスは12-30 kW/ラックで動作し、空冷で対応可能です。ただしインファレンスは大規模な推論モデル向けのトレーニングクラスチップ(H100、B200)へシフトしており、これらのパーツはトレーニング稼働時も推論稼働時も40-140+ kW/ラックを消費するため、より多くのインファレンス展開をチップ直結液冷に押しやっています。液冷ガイドをご覧ください。

インファレンスはユーザーに近い必要がありますが、トレーニングはそうではないのはなぜですか?

トレーニングは個々のレスポンスを待つエンドユーザーなしで実行される長期バッチジョブであるため、電力と用地が最も安い場所に配置されます。トレーニングクラスタはアイオワ州、ワイオミング州、または農村部のマレーシアに配置されており、人口密集地に近くありません。インファレンスはライブリクエストを処理します。チャットボットやコパイロットは1秒以下の応答時間を必要とし、ラウンドトリップネットワーク遅延は物理的距離が増すと悪化するため、オペレータはユーザーに近い大都市市場にインファレンス容量を配置します。

AIインファレンスとトレーニングはどのようなネットワークファブリックを使用していますか?

トレーニングクラスタはInfiniBand(NDR 400G、XDR 800Gへの移行中)またはRoCEv2対応Ethernetに依存しています。数千のGPU間で勾配を同期する際のレイテンシーペナルティが大きいためです。InfiniBandは8ノードH100クラスタで有効全削減帯域幅として約350 GB/sを実現するのに対し、標準400GbE RoCEv2では270-290 GB/sです。インファレンスワークロードはGPU間でレイテンシー非感応性のため、標準400G Ethernetで十分であり、InfiniBandはコスト効率に劣ります。

インファレンスとトレーニングではどのGPUが使用されていますか?

トレーニングクラスタは利用可能な最高スループットパーツ(H100、H200、B200、GB200)でほぼ完全に構築されています。トレーニングコストは高額なマルチGPUジョブの経過時間に支配されるためです。インファレンスワークロードはより広範なチップをサポートしています。大規模推論モデル用には高スペックチップですが、本番推論の大部分はより安価で低消費電力なパーツ(L40S、L4、またはGoogleのTPUやAWSのInferentiaなどの推論最適化シリコン)で動作し、ピークスループットではなくトークンあたりのコストを最適化しています。

将来のデータセンター容量の何パーセントがインファレンスを必要とするでしょうか?

推定はソースで異なりますが、方向性は一致しています。EdgeCoreとIntrolは両社とも2030年までにデータセンター需要の約70%がAIインファレンスから発生することを引用しており、1つの容量消費予測では、インファレンスが2033年頃にトレーニングを上回り、2035年までに約46 GWの専用容量に達すると予想しています。購入者にとっての実際的な意味は、この10年間でインファレンス(トレーニングではなく)が最大のワークロードになるということです。

出典

本記事で引用した一次情報源。すべての数値は出典にリンクしています。

  1. Introl: AI Inference vs Training Infrastructure Economics Diverging
  2. EdgeCore: AI Inference vs. Training — Infrastructure Differences Hyperscalers Must Plan For
  3. Introl: InfiniBand vs Ethernet for GPU Clusters (800G Architecture)
  4. Datacenters.com: Training vs Inference — Why AI Workloads Are Splitting the Global Data Center Market
  5. GlobeNewswire: Cloud AI Inference Workload Capacity to Surpass Training by 2033, Reaching 46 GW by 2035
  6. AgentMarketCap: Inference Becomes the Main Event — Two-Thirds of 2026 AI Compute
  7. Lightyear: Ethernet vs InfiniBand — AI Workload Comparison
  8. Uptime Institute 16th Annual Global Data Center Survey 2026
  9. Coloprice GPU Price Index

見積もり依頼

要件をお知らせください。カタログ内のデータセンターとマッチングし、実際の見積もりをお返しします。購入者は無料です。

1営業日以内に返信します。スパムや連絡先の転売はありません。