AI推理与训练:不同的基础设施需求
训练集群需要40-160+ kW的机柜、液冷和InfiniBand;推理需要较低密度、更便宜的芯片和靠近用户的站点。完整对比。

训练和推理不是穿着不同硬件的相同工作负载——它们需要不同的设施。训练集群在少数几个超大规模校园中集中数千个顶级GPU,每机柜40-160+ kW,配置InfiniBand网络和强制液冷;推理运行在数量更多、规模更小、成本更低的靠近最终用户的站点上,根据大多数2026年估计,它现在约占所有AI计算的三分之二。
要点
- 推理在2026年期间超越了训练在计算份额中的地位。 根据Introl和AgentMarketCap汇编的估计,推理在2023年约占AI计算的三分之一,2025年约占一半,2026年约占三分之二。
- 功率密度差异明显。 H100/B200/GB200硬件的训练机柜运行在40-160+ kW,下一代部件预计将超过300 kW。推理机柜通常运行在12-60 kW,虽然大型推理模型推理正在逐渐转向相同的训练级芯片和密度。
- 冷却遵循密度,而不是工作负载标签。 任何超过大约30-40 kW的机柜都需要芯片级直冷或浸没式液冷,无论是用于训练还是服务——请参阅我们的「液冷指南」了解更多。
- 训练容忍距离;推理不容忍。 训练是没有实时用户等待的批处理作业,因此它会在电力最便宜的地方进行。推理处理实时请求,因此运营商将其放在靠近用户的都市市场中。
- 网络需求在成本敏感性上相差一个数量级。 训练集群需要InfiniBand或800G以太网网络,每个端口成本数千美元;推理工作负载大多可以在标准400G以太网上很好地运行。
- 芯片组合也在分化。 训练仍然集中在最高吞吐量部分;推理越来越多地转向更便宜的加速器(L40S、L4、TPU、定制ASIC),这些加速器是根据每个令牌的成本而非峰值吞吐量选择的。
- 对购买者的影响是容量规划,而不仅仅是芯片选择。 到2030年,大多数预测同意推理——而不是训练——将是主导数据中心需求的工作负载。
两个工作负载类别的实时每GPU租赁费率在我们的「GPU价格指数」中;按站点的设施级功率和冷却规格在「数据中心目录」中。
这种分裂为什么现在很重要
在2023-2024年期间,「AI数据中心」主要指一件事:训练集群。前沿实验室在数万个GPU上训练越来越大的模型,基础设施讨论围绕这个构建展开——InfiniBand网络、液冷、千兆瓦级校园。这个讨论已经不再完整。当基础模型从研究转向生产——聊天机器人、副驾驶、代理、搜索、推荐——时,用于回答用户请求的计算开始超过用于构建模型本身的计算。
根据Introl和AgentMarketCap汇编的行业计算份额估计,推理在2023年约占AI计算的三分之一,2025年约占一半,2026年约占三分之二。云推理基础设施支出预计为2026年的206亿美元,高于2025年的92亿美元。分析师之间的方向性共识是推理在整个十年中继续增加份额,EdgeCore和Introl都引用了到2030年推理产生约70%数据中心需求的数据,一份长期容量预测预计推理将在2033年左右超越训练,到2035年达到约46 GW的专用容量。
对于任何购买或建设数据中心容量的人来说,这种转变改变了RFP。一个为训练经济而设计的设施——最大密度、最大互连带宽、最小端用户延迟关注——对于一个旨在从数十个都市市场提供数百万低延迟请求的推理站点集群来说是错误的规范。
功率密度:两条曲线,在顶端收敛
| 工作负载 | 典型机柜密度(2026) | 驱动因素 |
|---|---|---|
| 旧版推理(L4/L40S级) | 12-30 kW | 成本优化芯片,风冷 |
| 高端推理(大型推理模型) | 30-60 kW | 延迟和吞吐量需求推向训练级硬件 |
| 标准训练(H100/H200) | 40-100 kW | 多GPU节点、NVLink域 |
| 前沿训练(B200/GB200 NVL72) | 120-160+ kW | 机架级NVLink域;下一代部件趋向300+ kW |
来源:EdgeCore、Introl和我们自己的「功率密度指南」,其中更详细地介绍了GB200 NVL72的测量130-132 kW功耗。
两条曲线在顶端收敛。一个推理密集型推理工作负载服务多步代理查询,越来越多地运行在用于训练的H100或B200级硅上,因为每个查询的计算已经远超过L4这样的轻型推理芯片能够经济处理的范围。这意味着只为「低密度推理」设计的设施已经对2026年推理流量的很大一部分过时了。
冷却:密度决定,而不是工作负载标签
任何超过大约30-40 kW的机柜都需要芯片级直冷液冷或浸没式冷却,无论是运行训练作业还是处理推理请求——风冷根本无法经济地移除这么多热量。2026年的实际分割:
- 旧版和中端推理(L4、L40S、较老的A100集群)每机柜12-30 kW保持风冷,通常采用标准热通道隔离。
- 高密度推理和所有现代训练(H100及以上)40 kW及以上需要DLC或浸没式作为基线设计要求,而不是选项。
构建单一用途训练校园的运营商可以标准化一个冷却架构。推理专注的托管提供商越来越必须在同一设施内同时支持两者——用于商品推理的风冷大厅和用于推理模型和训练邻近工作负载的液冷区。
网络:InfiniBand经济不适用于推理
训练性能受到数千个GPU如何快速同步梯度通过全规约操作的限制,因此网络结构是一阶成本驱动力,而不是事后想法:
| 网络结构 | 有效带宽(8节点H100集群) | 延迟 | 典型用途 |
|---|---|---|---|
| InfiniBand NDR 400G | ~350 GB/s | ~1-2 µs | 大型训练集群 |
| 以太网 + RoCEv2(400GbE) | ~270-290 GB/s | ~5-10 µs | 中型训练、高端推理 |
| 标准以太网(400G) | 足够用于大多数推理 | 在这个规模下不是延迟关键 | 商品推理 |
数据由Introl和Lightyear从已发布的NCCL基准汇编。
InfiniBand的延迟和带宽优势对训练很重要,因为缓慢的互连在每个同步步骤中会同时阻止数千个GPU——网络不足配置的成本在训练运行的整个生命周期中在整个集群中复合。推理不以相同的方式具有全规约瓶颈:KV缓存传输和请求路由对微秒级延迟的敏感性要低得多,因此InfiniBand很少具有成本效益。800G以太网网络在2025年主导了AI集群交换机出货,并预计通过2026年继续取代训练和推理部署低端和中端的InfiniBand,而InfiniBand保持极端规模训练部分。
地理:训练去往电力,推理去往用户
这是最明显的操作差异。训练是一个计划的批处理作业——没有人在实时等待单个令牌,因此运营商优化最便宜的可用电力和土地,即使这意味着农村怀俄明州、远程马来西亚或专用核邻接校园。请参阅我们关于「电网连接队列」和「数据中心的SMR/核电」的指南,了解为什么训练校园越来越多地追求电力可用性而不是邻接。
推理是相反的问题。聊天机器人或副驾驶响应在另一端有一个用户等待亚秒级,网络往返时间随物理距离增加而增加。云区域通常可以在10-50ms范围内提供推理,具体取决于有效负载和网络路径,这对大多数会话应用程序是充分的——但随着距离人口中心的增加,这个数字会恶化,这就是为什么超大规模运营商在数十到数百个都市邻接站点上部署推理容量,而不是少数几个超大规模校园。这与我们的「边缘计算用例指南」中涵盖的相同逻辑:推理是实际上调整大多数边缘AI部署的工作负载类别,而训练本质上从不调整。
芯片选择:训练中的吞吐量,推理中的每查询成本
| 芯片 | 按需费率(中位数,2026) | 主要角色 |
|---|---|---|
| NVIDIA GB200(每GPU) | ~$18.79/hr | 前沿训练 |
| NVIDIA B200 | ~$6.99/hr | 训练、高端推理 |
| NVIDIA H100 | ~$3.30/hr | 训练、推理模型推理 |
| NVIDIA L40S | ~$0.90/hr | 成本优化推理 |
来自「Coloprice GPU价格指数」的费率,更新于2026-08-24;按提供商的范围远超过这里显示的中位数。
训练几乎总是购买可用的最高吞吐量部分,因为训练成本由昂贵多GPU作业的实际运行时间主导——更快的芯片可以更快完成运行,值得溢价。推理优化相反的变量:每个令牌的成本或每个查询的成本,任何应用程序所需的延迟。这就是为什么生产推理的很大一部分仍在L40S或L4级硬件上运行,以及为什么推理优化的硅——Google TPU、AWS Inferentia和超大规模运营商的定制ASIC——已经在推理中获得立足,其中Google公开引用了其TPU集群对推理工作负载的实质性性能优势。推理密集型推理是例外,它将芯片选择拉回训练级硬件,因为多步代理查询可以消耗比单次聊天完成多一个数量级的计算。
这对托管购买者的意义
- 不要像训练集群一样规格推理容量。 为主要是商品推理的工作负载过度构建InfiniBand网络和100%液冷大厅浪费了不能为应用程序实际需要的延迟或吞吐量买入任何东西的资本。
- 也不要为推理模型推理欠建设。 如果您的推理工作负载包括代理或多步推理,预算用于训练邻近密度(40 kW+)和液冷就绪,而不是12-30 kW风冷基线。
- 为电力站点训练,为用户站点推理。 使用「数据中心目录」比较为训练提供电力丰富的次级市场与为推理提供更好连接的都市市场;这两个站点选择问题很少指向同一设施。
- 模型每个工作负载的总成本,而不是每个GPU小时。 一个更便宜的推理芯片,每瓦特的令牌更差,一旦包括功率成本,就可能输给一个更昂贵的芯片——通过我们的「报价服务」请求两个配置的报价,而不是假设更低的标价赢。
- 预期设施要求在高端继续收敛。 随着推理模型将更多推理推向训练级硬件,只为一个工作负载类型构建的托管提供商将发现自己在改造——现在计划混合密度、混合冷却容量,而不是事后。
在「托管价格指数」和「市场统计」中跟踪两个工作负载类别的实时定价和市场基准。
常见问题
AI训练和推理基础设施有什么区别?
训练集群将数千个顶级GPU(H100、B200、GB200)集中在少数几个超大规模校园中,每机柜运行在40-160+ kW,配置InfiniBand或800G以太网网络和强制液冷。推理运行在数量更多、规模更小、地理分布更分散的站点上——通常每机柜12-60 kW,使用更便宜的芯片,采用标准以太网,并靠近最终用户以降低延迟。
2026年推理还是训练的计算量更大?
推理在2026年期间超越了训练在计算份额中的地位。根据Introl和AgentMarketCap汇编的分析,行业计算工作负载估计表明推理在2023年约占AI计算的三分之一,2025年约占一半,2026年约占三分之二。云推理基础设施支出预计将在2026年达到206亿美元,高于2025年的92亿美元。
AI推理需要液冷吗?
不一定,但越来越需要。L4或L40S等GPU上的旧版推理每机柜运行在12-30 kW,可用风冷处理。但推理正在转向训练级芯片(H100、B200)以支持大型推理模型,无论这些芯片是用于训练还是提供服务,它们每机柜都消耗相同的40-140+ kW——促使更多推理部署转向芯片级直冷液冷。详见我们的「液冷指南」了解技术对比。
为什么推理需要靠近用户而训练不需要?
训练作为一个长期批处理作业运行,没有最终用户等待单个响应,因此它会在电力和土地最便宜的地方进行——训练集群位于爱荷华州、怀俄明州或马来西亚农村地区,而不是人口中心附近。推理处理实时请求:聊天机器人和副驾驶需要亚秒级响应时间,往返网络延迟随物理距离增加而增加,因此运营商在靠近用户的都市市场中部署推理容量。
AI推理与训练使用什么网络结构?
训练集群依靠InfiniBand(NDR 400G,向XDR 800G转变)或带RoCEv2的以太网,因为在数千个GPU之间同步梯度会降低延迟——InfiniBand在8节点H100集群上提供约350 GB/s的有效全规约带宽,而标准400GbE RoCEv2为270-290 GB/s。推理工作负载在GPU之间的延迟敏感性要低得多,因此标准400G以太网通常就足够了,InfiniBand很少具有成本效益。
推理和训练使用哪些GPU?
训练集群几乎完全建立在可用的最高吞吐量芯片上——H100、H200、B200、GB200——因为训练成本随着昂贵多GPU作业的实际运行时间而扩展。推理工作负载跨越更广泛的范围:大型推理模型的高端芯片,但生产推理的很大一部分运行在更便宜、功耗更低的部分(L40S、L4或推理优化的硅,如Google TPU和AWS Inferentia)上,这些芯片是根据每个令牌的成本而不是原始吞吐量选择的。
未来数据中心容量中有多少会用于推理?
估计因来源而异,但方向一致:EdgeCore和Introl都引用了到2030年推理产生约70%数据中心需求的数据,一份容量消耗预测显示推理将在2033年左右超越训练,到2035年达到约46 GW的专用容量。对于购买者的实际意义是,推理而非训练是未来十年大多数托管和边缘容量需要服务的工作负载。
资料来源
本文引用的一手来源。每个数字都链接到其出处。
- Introl: AI Inference vs Training Infrastructure Economics Diverging
- EdgeCore: AI Inference vs. Training — Infrastructure Differences Hyperscalers Must Plan For
- Introl: InfiniBand vs Ethernet for GPU Clusters (800G Architecture)
- Datacenters.com: Training vs Inference — Why AI Workloads Are Splitting the Global Data Center Market
- GlobeNewswire: Cloud AI Inference Workload Capacity to Surpass Training by 2033, Reaching 46 GW by 2035
- AgentMarketCap: Inference Becomes the Main Event — Two-Thirds of 2026 AI Compute
- Lightyear: Ethernet vs InfiniBand — AI Workload Comparison
- Uptime Institute 16th Annual Global Data Center Survey 2026
- Coloprice GPU Price Index
获取报价
告诉我们您的需求——我们从目录中为您匹配数据中心并返回真实报价。买方免费。