Вывод и обучение AI: различные требования к инфраструктуре
Кластеры обучения требуют стоек 40-160+ кВт, жидкостного охлаждения и InfiniBand; инференс требует меньшей плотности, более дешёвых ускорителей и размещения рядом с пользователями. Полное сравнение.

Обучение и инференс — это не одна и та же рабочая нагрузка в разном оборудовании, это требуют разных объектов. Кластеры обучения концентрируют тысячи передовых графических ускорителей в горстке мега-центров при 40-160+ кВт на стойку с InfiniBand сетями и обязательным жидкостным охлаждением; инференс работает на намного более многочисленных, меньших и более дешёвых объектах рядом с конечными пользователями, и по большинству оценок 2026 года сейчас составляет примерно две трети всех AI-вычислений.
Ключевые выводы
- Инференс обогнал обучение по доле вычислений в 2026 году. По оценкам Introl и AgentMarketCap, инференс составлял около трети AI-вычислений в 2023 году, примерно половину в 2025 году и примерно две трети в 2026 году.
- Плотность мощности резко расходится. Стойки обучения на оборудовании H100/B200/GB200 работают при 40-160+ кВт, с ожиданием, что процессоры следующего поколения превысят 300 кВт. Стойки инференса обычно работают при 12-60 кВт, хотя инференс больших моделей рассуждений переходит на те же процессоры класса обучения и плотности.
- Охлаждение следует плотности, а не названию рабочей нагрузки. Любая стойка выше примерно 30-40 кВт требует прямого жидкостного охлаждения чипа или погружения независимо от того, используется ли она для обучения или обслуживания — см. наш гайд по жидкостному охлаждению.
- Обучение допускает расстояние; инференс нет. Обучение — это пакетное задание без живого пользователя, ожидающего ответ, поэтому операторы размещают его там, где электроэнергия дешевле. Инференс обслуживает запросы реального времени, поэтому операторы размещают его в мегаполисах рядом с пользователями.
- Требования к сетям отличаются на порядок по чувствительности к стоимости. Кластеры обучения оправдывают InfiniBand или 800G Ethernet сети, стоящие тысячи за порт; рабочие нагрузки инференса в основном хорошо работают на стандартном 400G Ethernet.
- Микросхемный состав тоже расходится. Обучение остаётся сосредоточено на самых быстродействующих процессорах; инференс всё больше переходит на более дешёвые ускорители (L40S, L4, TPU, пользовательские ASIC), выбранные за стоимость на токен, а не пиковую производительность.
- Следствие для покупателя — планирование ёмкости, а не только выбор чипа. К 2030 году большинство прогнозов согласны, что инференс — а не обучение — будет рабочей нагрузкой, доминирующей в спросе на мощности дата-центра.
Живые ставки сдачи в аренду на один GPU в обоих классах рабочей нагрузки находятся в нашем индексе цен GPU; спецификации мощности и охлаждения на уровне объектов находятся в каталоге дата-центров.
Почему разделение имеет значение сейчас
В 2023–2024 годах «AI дата-центр» обычно означал одно: кластер обучения. Передовые лаборатории обучали всё большие модели на десятках тысяч графических ускорителей, и разговор об инфраструктуре был об этом развитии — InfiniBand сети, жидкостное охлаждение, кампусы гигаватного масштаба. Такой разговор больше не полный. По мере того как фундаментальные модели переходили из исследований в производство — чатботы, копилоты, агенты, поиск, рекомендации — вычисления, потраченные на ответы на запросы пользователей, начали превышать вычисления, потраченные на создание модели в первую очередь.
По оценкам доли вычислений от Introl и AgentMarketCap, инференс составлял примерно треть AI-вычислений в 2023 году, около половины к 2025 году и примерно две трети в 2026 году. Расходы на облачную инфраструктуру инференса оцениваются в $20,6 млрд в 2026 году, что выше $9,2 млрд в 2025 году. Консенсус направления среди аналитиков заключается в том, что инференс продолжает набирать долю до конца десятилетия, с EdgeCore и Introl, оба ссылаясь примерно на 70% спроса на мощность дата-центра, поступающего от инференса к 2030 году, и один долгосрочный прогноз ёмкости, проецирующий инференс, обгоняющий обучение примерно в 2033 году, в пути к примерно 46 ГВт выделенной ёмкости к 2035 году.
Для всех, кто покупает или строит мощность дата-центра, этот сдвиг меняет РФП. Объект, спроектированный для экономики обучения — максимальная плотность, максимальная полоса пропускания взаимосвязи, минимальная забота о задержке конечного пользователя — неправильна спецификация для флота объектов инференса, предназначенного служить миллионам низколатентных запросов из десятков мегаполисов.
Плотность мощности: две кривые, сходящиеся в верхней части
| Рабочая нагрузка | Типичная плотность стойки (2026) | Драйвер |
|---|---|---|
| Традиционный инференс (класс L4/L40S) | 12-30 кВт | Оптимизированные по стоимости чипы, воздушное охлаждение |
| Высокопроизводительный инференс (большие модели рассуждений) | 30-60 кВт | Требования к задержке и пропускной способности подталкивают к оборудованию класса обучения |
| Стандартное обучение (H100/H200) | 40-100 кВт | Многопроцессорные узлы, домены NVLink |
| Передовое обучение (B200/GB200 NVL72) | 120-160+ кВт | Домены NVLink масштаба стойки; микросхемы следующего поколения тяготеют к 300+ кВт |
Источники: EdgeCore, Introl и наше собственное руководство по плотности мощности, которое рассматривает потребление 130-132 кВт GB200 NVL72 подробнее.
Две кривые сходятся в верхней части. Рабочая нагрузка инференса, сосредоточенная на рассуждениях, всё больше работает на том же кремнии класса H100 или B200, используемом для обучения, потому что вычисления на запрос выросли намного выше того, что лёгкий чип инференса, такой как L4, может обрабатывать экономически. Это означает, что объекты, спроектированные только для «низкоплотного инференса», уже устарели для значительной доли трафика инференса 2026 года.
Охлаждение: плотность решает, а не название рабочей нагрузки
Любая стойка, превышающая примерно 30-40 кВт, требует прямого жидкостного охлаждения чипа или погружения, независимо от того, работает ли она с заданием обучения или служит запросы инференса — воздушное охлаждение просто не может удалить столько тепла экономически. Практическое разделение в 2026 году:
- Традиционный и среднего уровня инференс (L4, L40S, более старые парки A100) при 12-30 кВт на стойку остаётся на воздушном охлаждении, часто со стандартным содержанием горячего прохода.
- Высокоплотный инференс и всё современное обучение (H100 и выше) при 40 кВт и выше требует DLC или погружения как требования базовой конструкции, а не вариант.
Операторы, строящие кампусы обучения однозначного назначения, могут стандартизировать одну архитектуру охлаждения. Операторы колокейшна, ориентированные на инференс, всё чаще должны поддерживать оба — залы, охлаждаемые воздухом, для товарного инференса и зоны с жидкостным охлаждением для рассуждений и смежных с обучением рабочих нагрузок — в одном объекте.
Сетевая архитектура: экономика InfiniBand не переходит к инференсу
Производительность обучения ограничена тем, насколько быстро тысячи графических ускорителей могут синхронизировать градиенты в операции всеобщего сокращения, поэтому сетевая архитектура является драйвером стоимости первого порядка, а не второстепенным:
| Архитектура | Эффективная полоса пропускания (кластер из 8 узлов H100) | Задержка | Типичное использование |
|---|---|---|---|
| InfiniBand NDR 400G | ~350 ГБ/с | ~1-2 мкс | Большие кластеры обучения |
| Ethernet + RoCEv2 (400GbE) | ~270-290 ГБ/с | ~5-10 мкс | Обучение среднего размера, высокопроизводительный инференс |
| Стандартный Ethernet (400G) | Достаточно для большинства инференса | Не критично на этом масштабе | Товарный инференс |
Данные собраны Introl и Lightyear из опубликованных бенчмарков NCCL.
Преимущество InfiniBand в задержке и полосе пропускания имеет значение для обучения, потому что медленная взаимосвязь останавливает тысячи графических ускорителей одновременно во время каждого этапа синхронизации — стоимость недостаточного обеспечения сети компонуется по всему кластеру на протяжении жизни работы обучения. Инференс не имеет того же узкого места всеобщего сокращения таким же образом: передача KV-кэша и маршрутизация запросов намного менее чувствительны к микросекундной задержке, поэтому InfiniBand редко оправдана. 800G Ethernet архитектуры доминировали в поставках коммутаторов AI-кластеров в 2025 году и ожидается, что будут продолжать вытеснять InfiniBand на нижнем и среднем уровне развёртываний обучения и инференса в 2026 году, в то время как InfiniBand держит крайний масштаб сегмента обучения.
География: обучение идёт за электроэнергией, инференс идёт за пользователями
Это самое резкое операционное различие. Обучение — это запланированное пакетное задание — никто не ждёт в реальном времени отдельный токен, поэтому операторы оптимизируют для самой дешёвой доступной электроэнергии и земли, даже если это означает сельский Вайоминг, удалённую Малайзию или выделенный кампус рядом с ядерным. См. наши гайды о очередях подключения к сети и SMR/ядерная энергия для дата-центров для понимания того, почему кампусы обучения всё больше преследуют доступность электроэнергии над близостью.
Инференс — противоположная проблема. Ответ чатбота или копилота имеет пользователя на другом конце, ожидающего менее секунды, и время обхода сети растёт с физическим расстоянием. Облачные регионы обычно могут доставить инференс в диапазоне 10-50 мс в зависимости от полезной нагрузки и пути сети, что адекватно для большинства приложений беседы — но это число ухудшается, когда расстояние от населённого центра растёт, что является причиной того, почему гиперскейлеры развёртывают ёмкость инференса в десятках до сотен сайтов, прилегающих к метро, а не в горстке мега-кампусов. Это та же логика, описанная в нашем гайде о вариантах использования краевых вычислений: инференс — это класс рабочей нагрузки, который на самом деле оправдывает большинство развёртываний краевого AI, тогда как обучение практически никогда не делает.
Выбор чипа: производительность для обучения, стоимость за запрос для инференса
| Чип | Ставка по требованию (медиана, 2026) | Основная роль |
|---|---|---|
| NVIDIA GB200 (за GPU) | ~$18,79/ч | Передовое обучение |
| NVIDIA B200 | ~$6,99/ч | Обучение, высокопроизводительный инференс |
| NVIDIA H100 | ~$3,30/ч | Обучение, инференс моделей рассуждений |
| NVIDIA L40S | ~$0,90/ч | Инференс, оптимизированный по стоимости |
Ставки из индекса цен GPU Coloprice, обновлено 2026-08-24; диапазоны по провайдерам варьируются хорошо за медиану, показанную здесь.
Обучение почти всегда покупает самый быстродействующий доступный процессор, потому что стоимость обучения определяется временем выполнения дорогостоящей многопроцессорной работы — более быстрый чип, который завершит работу раньше, стоит премии. Инференс оптимизирует противоположную переменную: стоимость за токен или стоимость за запрос при любой задержке, требуемой приложением. Вот почему значительная часть производственного инференса всё ещё работает на оборудовании класса L40S или L4, и почему инференс-оптимизированный кремний — Google TPU, AWS Inferentia и пользовательские ASIC от гиперскейлеров — набрал силу специально в инференсе, где Google публично ссылалась на значительное преимущество цены-производительности для своего флота TPU на рабочих нагрузках инференса. Инференс, сосредоточенный на рассуждениях, — исключение, которое тянет выбор чипа назад к оборудованию класса обучения, поскольку многошаговые запросы агентов могут потреблять на порядок больше вычислений за запрос, чем одноходовое завершение чата.
Что это означает для покупателей колокейшна
- Не проектируйте ёмкость инференса как кластер обучения. Переизбыток InfiniBand архитектур и 100%-жидкостного охлаждения залов для рабочей нагрузки, которая в основном товарный инференс, теряет капитал, который ничего не покупает в задержке или пропускной способности, которая приложению на самом деле нужна.
- Но и не недостраивайте для инференса больших моделей рассуждений. Если ваша рабочая нагрузка инференса включает агентов или многошаговые рассуждения, бюджетируйте плотность, смежную с обучением (40 кВт+) и готовность к жидкостному охлаждению, а не базовую линию 12-30 кВт с воздушным охлаждением.
- Размещайте обучение за электроэнергией, инференс за пользователями. Используйте каталог дата-центров для сравнения богатых электроэнергией вторичных рынков для обучения против мегаполисов с лучшей связью для инференса; две проблемы выбора сайта редко указывают на один и тот же объект.
- Моделируйте общую стоимость за рабочую нагрузку, а не за GPU-час. Более дешёвый чип инференса с худшими токенами-на-ватт может проиграть более дорогому, как только включены стоимости электроэнергии — запросите предложения для обеих конфигураций через нашу службу предложений вместо того, чтобы предполагать, что более низкая цена в прайс-листе победит.
- Ожидайте, что требования объектов будут продолжать сходиться в верхней части. По мере того как модели рассуждений подталкивают больше инференса на оборудование класса обучения, операторы колокейшна, которые построили только для одного типа рабочей нагрузки, обнаружат, что они переоборудуют — план ёмкости смешанной плотности, смешанного охлаждения сейчас, а не после этого факта.
Отслеживайте живые цены и рыночные бенчмарки для обоих классов рабочей нагрузки в индексе цен колокейшна и рыночной статистике.
Частые вопросы
В чём различие между инфраструктурой для обучения и вывода AI?
Кластеры обучения размещают тысячи передовых графических ускорителей (H100, B200, GB200) в горстке мега-центров данных, работая при 40-160+ кВт на стойку с использованием InfiniBand или 800G Ethernet сетей и обязательным жидкостным охлаждением. Инференс работает на намного более многочисленных, меньших по размеру и географически распределённых объектах — обычно 12-60 кВт на стойку, с использованием более дешёвых ускорителей, стандартного Ethernet и размещения рядом с конечными пользователями для снижения задержки.
Что больше в 2026 году: инференс или обучение?
Инференс обогнал обучение по доле вычислений в 2026 году. По оценкам Introl и AgentMarketCap, инференс составлял примерно треть AI-вычислений в 2023 году, около половины в 2025 году и примерно две трети в 2026 году. Расходы на облачную инфраструктуру инференса оцениваются в $20,6 млрд в 2026 году, что выше $9,2 млрд в 2025 году.
Нужно ли жидкостное охлаждение для AI-инференса?
Не всегда, но всё чаще да. Традиционный инференс на графических ускорителях L4 или L40S работает при 12-30 кВт на стойку, что укладывается в возможности воздушного охлаждения. Но инференс переходит на процессоры класса обучения (H100, B200) для больших моделей рассуждений, и они потребляют те же 40-140+ кВт на стойку независимо от того, используются ли они для обучения или обслуживания — это переводит всё больше развёртываний инференса на прямое жидкостное охлаждение. Подробнее см. наш [гайд по жидкостному охлаждению](/guides/liquid-cooling-guide/).
Почему инференс должен быть близко к пользователям, а обучение нет?
Обучение представляет собой длительное пакетное задание, на которое не ждёт конечный пользователь, поэтому оно размещается там, где дешевле всего электроэнергия и земля — кластеры обучения находятся в Айове, Вайоминге или сельской Малайзии, а не рядом с населёнными центрами. Инференс обслуживает живые запросы: чатботам и копилотам нужна задержка менее секунды, и время обхода сети растёт с физическим расстоянием, поэтому операторы размещают ёмкость инференса в мегаполисах рядом со своими пользователями.
Какую сетевую архитектуру использует AI-инференс по сравнению с обучением?
Кластеры обучения опираются на InfiniBand (NDR 400G, переход на XDR 800G) или Ethernet с RoCEv2, поскольку синхронизация градиентов между тысячами графических ускорителей требует низкой задержки — InfiniBand обеспечивает примерно 350 ГБ/с эффективной полосы пропускания всеобщей операции сокращения на кластере из 8 узлов H100 против 270-290 ГБ/с для стандартного 400GbE RoCEv2. Рабочие нагрузки инференса значительно менее чувствительны к задержке между графическими ускорителями, поэтому стандартный 400G Ethernet обычно достаточен и InfiniBand редко оправдывает затраты.
Какие GPU используются для инференса и обучения?
Кластеры обучения построены почти полностью на самых быстродействующих доступных процессорах — H100, H200, B200, GB200 — потому что стоимость обучения масштабируется с временем выполнения дорогостоящих многопроцессорных работ. Рабочие нагрузки инференса охватывают более широкий спектр: микросхемы высокого класса для больших моделей рассуждений, но значительная часть производственного инференса работает на более дешёвых, менее мощных процессорах (L40S, L4 или оптимизированном для инференса кремнии, таком как Google TPU и AWS Inferentia), выбранных для стоимости на токен, а не на сырую производительность.
Сколько ёмкости будущих дата-центров потребуется для инференса?
Оценки различаются по источникам, но все согласны в направлении: EdgeCore и Introl оба ссылаются примерно на 70% спроса на мощности дата-центра, поступающего от AI-инференса к 2030 году, и один прогноз потребления ёмкости на долгий срок имеет инференс, обгоняющий обучение примерно в 2033 году, в пути к примерно 46 ГВт выделенной ёмкости к 2035 году. Практическое следствие для покупателей в том, что инференс, а не обучение, — это рабочая нагрузка, которую большинство мощностей колокейшна и край будут обслуживать в течение этого десятилетия.
Источники
Первоисточники, на которые опирается статья. Каждая цифра ведёт туда, откуда она взята.
- Introl: AI Inference vs Training Infrastructure Economics Diverging
- EdgeCore: AI Inference vs. Training — Infrastructure Differences Hyperscalers Must Plan For
- Introl: InfiniBand vs Ethernet for GPU Clusters (800G Architecture)
- Datacenters.com: Training vs Inference — Why AI Workloads Are Splitting the Global Data Center Market
- GlobeNewswire: Cloud AI Inference Workload Capacity to Surpass Training by 2033, Reaching 46 GW by 2035
- AgentMarketCap: Inference Becomes the Main Event — Two-Thirds of 2026 AI Compute
- Lightyear: Ethernet vs InfiniBand — AI Workload Comparison
- Uptime Institute 16th Annual Global Data Center Survey 2026
- Coloprice GPU Price Index
Получить цены
Опишите задачу — мы подберём дата-центры из каталога и вернём реальные предложения. Бесплатно для покупателя.