▮▮Coloprice
← Гайди та аналітика

· ai-data-centers

AI-Інференція vs Навчання: Різні потреби інфраструктури

Кластери навчання потребують стійок на 40–160+ кВ, рідинного охолодження та InfiniBand; інференція потребує меншої щільності, дешевших чипів і локацій поблизу користувачів. Повне порівняння.

AI-Інференція vs Навчання: Різні потреби інфраструктури

Навчання та інференція — це не одне й те саме навантаження в різному обладнанні — вони потребують різних об’єктів. Кластери навчання концентрують тисячи найсучасніших GPU у кількох мега-кампусах з щільністю 40–160+ кВ на стійку з InfiniBand-фабриками та обов’язковим рідинним охолодженням; інференція працює на набагато більш численних, менших, дешевших сайтах поблизу кінцевих користувачів, і за більшістю оцінок 2026 вона зараз становить приблизно дві третини всіх AI-обчислень.

Основні висновки

  • Інференція перевищила навчання за часткою обчислень у 2026. Оцінки Introl та AgentMarketCap розміщують інференцію на рівні приблизно третини AI-обчислень у 2023, приблизно половини в 2025 та приблизно двох третин в 2026.
  • Щільність потужності різко розходиться. Стійки навчання на обладнанні H100/B200/GB200 працюють з потужністю 40–160+ кВ, очікується, що компоненти наступного покоління перевищать 300 кВ. Стійки інференції зазвичай працюють з потужністю 12–60 кВ, хоча інференція великих моделей міркування дедалі більше переходить на ті ж чипи класу навчання та щільності.
  • Охолодження слідує за щільністю, а не за назвою робочого навантаження. Будь-яка стійка вище приблизно 30–40 кВ потребує рідинного охолодження прямо на чипі або занурення, незалежно від того, чи це навчання чи обслуговування — див. наш посібник з рідинного охолодження.
  • Навчання толерує відстань; інференція — ні. Навчання — це пакетна робота без живого користувача, що чекає, тому воно йде туди, де електроенергія найдешевша. Інференція обслуговує запити в реальному часі, тому оператори розміщують її на метроринках поблизу користувачів.
  • Вимоги до мереж розрізняються на порядок величини за чутливістю вартості. Кластери навчання обґрунтовують вартість InfiniBand або 800G Ethernet-фабрик, які коштують тисячі на порт; робочі навантаження інференції переважно добре працюють на стандартному 400G Ethernet.
  • Комбінація чипів також розходиться. Навчання залишається зосередженим на найпродуктивніших компонентах; інференція дедалі більше переходить на дешевші прискорювачі (L40S, L4, TPUs, користувацькі ASIC), вибрані за вартістю за токен, а не за пікову пропускну здатність.
  • Значення для покупців — планування потужності, а не просто вибір чипів. До 2030 більшість прогнозів узгоджуються, що інференція — а не навчання — буде робочим навантаженням, що домінує в попиті на дата-центри.

Актуальні тарифи оренди на один GPU для обох класів робочого навантаження в нашому індексі цін GPU; технічні характеристики потужності та охолодження об’єктів за сайтами в каталозі дата-центрів.

Чому розділення має значення зараз

Протягом 2023–2024 років «AI дата-центр» переважно означав одне: кластер навчання. Лабораторії передового виробництва навчали все більші моделі на десятків тисяч GPU, і розмова про інфраструктуру йшла про цю побудову — InfiniBand-фабрики, рідинне охолодження, кампуси гігаватного масштабу. Ця розмова більше не є повною. Коли базові моделі перейшли від дослідження до виробництва — чат-боти, копілоти, агенти, пошук, рекомендації — обчислення, витрачені на відповідь на запити користувачів, почали переважувати обчислення, витрачені на побудову моделі на першому місці.

Оцінки частки обчислень за галуззю від Introl та AgentMarketCap розташовують інференцію на рівні приблизно третини AI-обчислень у 2023, приблизно половини до 2025 та приблизно двох третин в 2026. Витрати на інфраструктуру хмарної інференції розраховуються на рівні $20,6 мільярда в 2026, у порівнянні з $9,2 мільярда в 2025. Напрямний консенсус аналітиків полягає в тому, що інференція продовжує займати частку протягом решти десятиліття, причому як EdgeCore, так і Introl посилаються на приблизно 70% попиту на дата-центри від інференції до 2030, а один довгостроковий прогноз потужності прогнозує, що інференція перевищить навчання близько 2033 року на шляху до приблизно 46 ГВт виділеної потужності до 2035.

Для того, хто купує або будує дата-центрів потужність, цей зсув змінює RFP. Об’єкт, розроблений для економіки навчання — максимальна щільність, максимальна пропускна здатність взаємозв’язку, мінімальна турбота про затримку кінцевого користувача — це неправильна специфікація для флоту сайтів інференції, призначеного для обслуговування мільйонів запитів з низькою затримкою з десятків метроринків.

Щільність потужності: дві криві, що сходяться на вершині

Робоче навантаження Типова щільність стійки (2026) Причина
Застаріла інференція (клас L4/L40S) 12–30 кВ Чипи, оптимізовані за вартістю, повітряне охолодження
Високоякісна інференція (великі моделі міркування) 30–60 кВ Вимоги до затримки та пропускної здатності спонукають до обладнання класу навчання
Стандартне навчання (H100/H200) 40–100 кВ БагатоGPU-вузли, домени NVLink
Передове навчання (B200/GB200 NVL72) 120–160+ кВ Домени NVLink масштабу стійки; компоненти наступного покоління тяжіють до 300+ кВ

Джерела: EdgeCore, Introl, та наш посібник щільності потужності, який охоплює вимірюване споживання GB200 NVL72 130–132 кВ детальніше.

Дві криві сходяться на верхньому кінці. Важка на міркування інференція, що обслуговує запити агентів з кількома кроками, дедалі більше працює на тому ж кремнії класу H100- або B200, що використовується для навчання, тому що обчислення на запит значно виросли понад те, що легкий інфекційний чип, як L4, може обробити економічно. Це означає, що об’єкти, розроблені лише для «низькощільної інференції», вже застарівають для значної частки трафіку інференції 2026.

Охолодження: щільність вирішує, а не назва робочого навантаження

Будь-яка стійка, що перетинає приблизно 30–40 кВ, потребує рідинного охолодження прямо на чипі або занурення, чи то виконує робочу роботу навчання чи обслуговує запити інференції — повітряне охолодження просто не може економічно видалити таку кількість тепла. Практичний розподіл у 2026:

  • Застаріла та середньовартісна інференція (L4, L40S, старіші парки A100) з потужністю 12–30 кВ на стійку залишаються на повітряному охолодженні, часто зі стандартним утримуванням гарячого коридору.
  • Високощільна інференція та все сучасне навчання (H100 та вище) з потужністю 40 кВ і більше потребують DLC або занурення як базової вимоги проекту, а не опції.

Оператори, які будують спеціалізовані кампуси навчання, можуть стандартизувати одну архітектуру охолодження. Постачальники колокейшну, орієнтовані на інференцію, дедалі більше повинні підтримувати обидва — повітряохолоджені зали для товарної інференції та охолоджені рідиною зони для робочих навантажень моделей міркування та прилеглих до навчання — всередині однієї установи.

Мережа: економіка InfiniBand не поширюється на інференцію

Продуктивність навчання обмежена тим, наскільки швидко тисячі GPU можуть синхронізувати градієнти в операції all-reduce, тому мережева архітектура є первинним керуючим вартістю, а не запізнілою думкою:

Архітектура Ефективна пропускна здатність (кластер H100 з 8 вузлів) Затримка Типова використання
InfiniBand NDR 400G ~350 ГБ/с ~1–2 мкс Великі кластери навчання
Ethernet + RoCEv2 (400GbE) ~270–290 ГБ/с ~5–10 мкс Навчання середнього розміру, високоякісна інференція
Стандартний Ethernet (400G) Достатньо для більшої частини інференції Не критично для затримки в цьому масштабі Товарна інференція

Дані складені Introl та Lightyear з опублікованих бенчмарків NCCL.

Перевага затримки та пропускної здатності InfiniBand має значення для навчання, оскільки повільний взаємозв’язок зупиняє тисячи GPU одночасно під час кожного кроку синхронізації — вартість недостатнього забезпечення мережі збільшується по всьому кластеру впродовж всього навчального запуску. Інференція не має тієї ж вузької горлиці all-reduce: передача KV-cache та маршрутизація запитів набагато менше чутливі до затримок мікросекундного рівня, тому InfiniBand рідко виправдовує вартість. 800G Ethernet-фабрики домінували в поставках комутаторів AI-кластерів у 2025 році і очікується, що вони будуть продовжувати витісняти InfiniBand на нижньому та середньому кінці як розгортань навчання, так і інференції через 2026, тоді як InfiniBand утримує сегмент навчання екстремального масштабу.

Географія: навчання йде до електроенергії, інференція йде до користувачів

Це найбільш очевидна оперативна різниця. Навчання — це запланована пакетна робота — ніхто не чекає в реальному часі на окремий токен, тому оператори оптимізують найдешевшу доступну електроенергію та землю, навіть якщо це означає сільський Вайомінг, віддалену Малайзію або виділений кампус поруч з ядерним. Дивіться наші посібники про черги підключення до сітки та енергію SMR/ядерну для дата-центрів для того, чому кампуси навчання дедалі більше переслідують доступність електроенергії над близькістю.

Інференція — це протилежна проблема. Відповідь чат-бота або копілота має користувача на іншому кінці, що чекає субсекунди, а час циклу мережі зростає з фізичною відстанню. Хмарні регіони зазвичай можуть доставити інференцію в діапазоні 10–50 мс залежно від корисного навантаження та шляху мережі, що достатньо для більшості розмовних програм — але це число погіршується зі збільшенням відстані від центру населення, тому гіперскейлери розгортають потужність інференції на десятки до сотень сайтів, прилеглих до метро, а не на кілька мега-кампусів. Це тієї ж логіки, що висвітлюється в нашому посібнику варіантів використання edge-обчислень: інференція — це клас робочого навантаження, що насправді виправдовує більшість розгортань edge AI, тоді як навчання по суті ніколи.

Вибір чипів: пропускна здатність для навчання, вартість на запит для інференції

Чип Тариф на вимогу (медіана, 2026) Основна роль
NVIDIA GB200 (на один GPU) ~$18,79/год Передове навчання
NVIDIA B200 ~$6,99/год Навчання, високоякісна інференція
NVIDIA H100 ~$3,30/год Навчання, інференція моделі міркування
NVIDIA L40S ~$0,90/год Інференція, оптимізована за вартістю

Тарифи з індексу цін GPU Coloprice, оновлено 2026–08–24; діапазони за провайдерами значно відрізняються від медіани, показаної тут.

Навчання майже завжди купує найпродуктивніший доступний компонент, тому що вартість навчання домінується календарним часом на дорогій багатоGPU-роботі — швидший чип, який завершує запуск швидше, варто премії. Інференція оптимізує протилежну змінну: вартість за токен або вартість за запит при будь-якій затримці, яку вимагає програма. Ось чому велика частка виробничої інференції все ще працює на обладнанні класу L40S- або L4, і чому інференції-оптимізований кремній — Google TPUs, AWS Inferentia та користувацькі ASIC від гіперскейлерів — набув позиції спеціально в інференції, де Google публічно посилався на істотну перевагу ціна-продуктивність для свого флоту TPU на робочих навантаженнях інференції. Важка на міркування інференція — це винятковий випадок, який повертає вибір чипів назад до обладнання класу навчання, оскільки запити агентів з кількома кроками можуть споживати порядок величини більше обчислень на запит, ніж одноходовий чат-комплект.

Що це означає для покупців колокейшну

  1. Не проектуйте потужність інференції, як кластер навчання. Перебудова InfiniBand-фабрик та 100%-охолоджених рідиною залів для робочого навантаження, яке переважно є товарною інференцією, витрачає капітал, який не купує ніякої затримки або пропускної здатності, яка насправді потребує програма.
  2. Також не будуйте недостатньо для інференції моделей міркування. Якщо ваше робоче навантаження інференції включає агентів або міркування з кількома кроками, бюджет для щільності, прилеглої до навчання (40 кВ+), та готовності рідинного охолодження, а не базової лінії повітряного охолодження 12–30 кВ.
  3. Розмістіть навчання для електроенергії, інференцію для користувачів. Використовуйте каталог дата-центрів для порівняння вторинних ринків з багатою електроенергією для навчання проти метроринків з кращою підключеністю для інференції; дві проблеми вибору сайту рідко вказують на один і той же об’єкт.
  4. Модель загальної вартості на робоче навантаження, а не на GPU-год. Дешевший інференційний чип з гіршими токенами на ват може програти дорожчому, як тільки витрати на електроенергію будуть включені — запитайте пропозиції для обох конфігурацій через нашу службу котирування замість припущення, що нижча ціна виграє.
  5. Очікуйте, що вимоги до об’єктів продовжуватимуть сходитися на верхньому кінці. Коли моделі міркування спонукають більше інференції до обладнання класу навчання, постачальники колокейшну, які будували лише для одного типу робочого навантаження, виявлять себе під ремонтом — планують змішану щільність, змішану охолоджувальну потужність зараз, а не після цього.

Відстежуйте актуальні ціни та ринкові бенчмарки для обох класів робочого навантаження в індексі цін колокейшну та ринковій статистиці.

Часті питання

Яка різниця між інфраструктурою AI-навчання та AI-інференції?

Кластери навчання розміщують тисячи найсучасніших GPU (H100, B200, GB200) у кількох мега-кампусах, працюючи на 40–160+ кВ на стійку з InfiniBand або 800G Ethernet-фабриками та обов'язковим рідинним охолодженням. Інференція працює на набагато більш численних, менших і географічно розподілених сайтах — часто 12–60 кВ на стійку, з дешевшими чипами, у стандартних Ethernet-мережах, розташованих близько до кінцевих користувачів, щоб зменшити затримку.

Що більше в 2026 — інференція чи навчання?

Інференція перевищила навчання за часткою обчислень у 2026. Оцінки робочого навантаження за галуззю показують, що інференція становила приблизно третину AI-обчислень у 2023, близько половини в 2025 та приблизно дві третини в 2026, за аналізом Introl та AgentMarketCap. Витрати на інфраструктуру хмарної інференції очікуються на рівні $20,6 мільярда в 2026, у порівнянні з $9,2 мільярда в 2025.

Чи потребує AI-інференція рідинного охолодження?

Не завжди, але дедалі частіше так. Застаріла інференція на GPU, таких як L4 або L40S, працює на 12–30 кВ на стійку, в межах можливостей повітряного охолодження. Але інференція переходить на чипи класу навчання (H100, B200) для великих моделей міркування, і ці компоненти споживають одне й те саме 40–140+ кВ на стійку, чи то для навчання чи для обслуговування — спонукаючи більше розгортань інференції на рідинне охолодження, безпосередньо на чипах. Дивіться наш посібник з рідинного охолодження для порівняння технологій.

Чому інференція повинна бути близько до користувачів, а навчання — ні?

Навчання працює як довга пакетна робота без кінцевого користувача, що чекає на окрему відповідь, тому воно відбувається там, де електроенергія та земля найдешевші — кластери навчання розташовуються в Айові, Вайомінгу або сільській Малайзії, а не поблизу центрів населення. Інференція обслуговує живі запити: чат-боти та копілоти потребують відповідей субсекундної швидкості, а затримка мережі в оба кінці зростає зі збільшенням фізичної відстані, тому оператори розміщують потужність інференції на метроринках поблизу своїх користувачів.

Яку мережеву архітектуру використовує AI-інференція в порівнянні з навчанням?

Кластери навчання спираються на InfiniBand (NDR 400G, переходить до XDR 800G) або Ethernet з RoCEv2, тому що синхронізація градієнтів по тисячах GPU карає затримку — InfiniBand забезпечує приблизно 350 ГБ/с ефективної пропускної здатності all-reduce на кластері з 8 вузлів H100, порівняно з 270–290 ГБ/с для стандартного 400GbE RoCEv2. Робочі навантаження інференції набагато менше чутливі до затримок між GPU, тому стандартний 400G Ethernet зазвичай достатній і InfiniBand рідко виправдовує витрати.

Які GPU використовуються для інференції в порівнянні з навчанням?

Кластери навчання побудовані майже повністю на найпродуктивніших доступних компонентах — H100, H200, B200, GB200 — тому що вартість навчання масштабується з календарним часом на дорогих багатоGPU-роботах. Робочі навантаження інференції охоплюють ширший діапазон: високоякісні чипи для великих моделей міркування, але велика частка виробничої інференції працює на дешевших компонентах з меншою потужністю (L40S, L4, або інференції-оптимізованому кремнії, такому як Google TPUs та AWS Inferentia), вибираних за вартістю за токен, а не за сирову пропускну здатність.

Скільки майбутньої потужності дата-центру буде потребувати інференція?

Оцінки відрізняються за джерелами, але узгоджуються щодо напрямку: як EdgeCore, так і Introl посилаються на приблизно 70% попиту на дата-центри, що надходять з AI-інференції до 2030, а один прогноз споживання потужності прогнозує, що інференція перевищить навчання близько 2033 року на шляху до приблизно 46 ГВт виділеної потужності до 2035. Практичне значення для покупців полягає в тому, що інференція, а не навчання, є робочим навантаженням, яке більшість колокейшну та edge-потужності буде потребувати в межах цього десятиліття.

Джерела

Першоджерела, на які спирається стаття. Кожна цифра веде туди, звідки її взято.

  1. Introl: AI Inference vs Training Infrastructure Economics Diverging
  2. EdgeCore: AI Inference vs. Training — Infrastructure Differences Hyperscalers Must Plan For
  3. Introl: InfiniBand vs Ethernet for GPU Clusters (800G Architecture)
  4. Datacenters.com: Training vs Inference — Why AI Workloads Are Splitting the Global Data Center Market
  5. GlobeNewswire: Cloud AI Inference Workload Capacity to Surpass Training by 2033, Reaching 46 GW by 2035
  6. AgentMarketCap: Inference Becomes the Main Event — Two-Thirds of 2026 AI Compute
  7. Lightyear: Ethernet vs InfiniBand — AI Workload Comparison
  8. Uptime Institute 16th Annual Global Data Center Survey 2026
  9. Coloprice GPU Price Index

Отримати ціни

Опишіть задачу — ми підберемо дата-центри з каталогу та повернемо реальні пропозиції. Безкоштовно для покупця.

Відповідаємо протягом робочого дня. Без спаму та перепродажу контактів.