Аварійне відновлення
Вибір об'єкту для DR
Об'єкт для аварійного відновлення має бути достатньо далеким, щоб не поділяти катастрофу, і достатньо близьким для режиму репліки, який вам потрібен. Ці два обмеження — плюс те, які об'єкти насправді існують на ринку-кандидаті — визначають короткий список перед будь-якою розмовою з постачальником. Наведений нижче інструмент запускає всі три проти реальних даних: виміряні часи відповіді в мережі (RTT) між 14 ринками та 1629-об'єктний каталог.
Пошук DR-пари
Виберіть свій основний ринок. Кандидати ранжуються за часом RTT з режимом репліки для кожної відстані.
| Кандидат DR | RTT | Підтримувана репліка | Об'єкти на ринку |
|---|
Показники RTT — це опубліковані вимірювання хмари між регіонами (Azure, cloudping.co) — джерела на матриці затримки. Волоконні маршрути між колокейшн-об'єктами проходять подібними шляхами; перевірте точну пару з операторами, перш ніж застосовувати RPO для цієї пари.
Режим реплікації встановлюється фізикою
Світло у волокні долає приблизно 100 км за мілісекунду туди-назад. Це число визначає архітектуру: синхронна реплікація потребує затримки туди-назад в межах часового бюджету запису додатка, що обмежує дистанцію до близько 100 км — все, що далі, є асинхронне, незалежно від того, що обіцяє рівень сховища.
| Режим | Бюджет RTT | RPO | Що це означає |
|---|---|---|---|
| Синхронний | ≤ ~10 мс | Нуль | Кожне записування підтверджується на обох сайтах перед продовженням роботи додатку. Затримка транзакції включає туди і назад, тому відстань стає податком додатку. |
| Квазісинхронний | ~10–25 мс | Секунди | Записи потокують безперервно з розслабленим підтвердженням. Практичний вибір для сусідніх пар дата-центрів, як-от Франкфурт–Амстердам чи Сінгапур–Куала-Лумпур. |
| Асинхронний | Будь-яке | Хвилини | Сайт DR відстає на інтервал репліції. Єдиний варіант на великих відстанях — і правильний для більшості навантажень так чи інакше. |
Чотири схеми DR, оцінені честно
Вартість виражена як частка вартості експлуатації основного сайту. Схема визначає RTO, режим репліції визначає RPO, а комбінація визначає бюджет. Більшість організацій запускають різні схеми для різних рівнів навантаження — активно-активну для критичних систем, резервну копію–відновлення для всього, що може чекати день.
| Схема | RPO | RTO | Вартість проти основного | Як це працює |
|---|---|---|---|---|
| Резервна копія та відновлення | Години–день | Дні | ~5% | Резервні копії реплікуються за межами сайту, інфраструктура будується лише коли сталася катастрофа. Дешево, повільно, й відновлення — та частина, яку ніхто не тестував. |
| Резервна конфігурація | Minutes–hours | Hours | ~10–20% | Ядро даних реплікується до мінімального розміру, що масштабується під час переключення. Кілька стійок на сайті DR, що несуть базу даних; обчислювальні ресурси приходять за потребою. |
| Теплий резерв | Seconds–minutes | Minutes–hour | ~30–50% | Масштабована копія виробництва, що працює безперервно. Переключення — це просування, а не будування. |
| Активно-активна | ≈ Нуль | ≈ Нуль | 100%+ | Обидва сайти обслуговують трафік; втрата одного — подія зменшення потужності, а не простій. Вимагає, щоб програма була побудована для цього — модифікація існуючої — це переписування. |
Змоделюйте вартість резервного розміру за допомогою калькулятора вартості колокейшну за ставкою Індексу цільового ринку.
Що насправді відмовляє
DR планування часто уявляє землетруси. Журнал інцидентів говорить, що реальні загрози ближче до лічильника: перебої в електроживленні, пожежі батарей UPS, збої охолодження та несправності мережевого обладнання. Сайт DR на тій самій мережі електроживлення, в тій же зоні затоплення, за тим же готелем оператора зв'язку захищає від майже жодного з них. Останні записи:
- 2026-09-01Google Cloud: network degradation in us-central1-b takes down 15 products for up to 4h08mus-central1-b (Council Bluffs, Iowa)
- 2026-08-31Microsoft 365: authentication-configuration fault disrupts Exchange Online, Teams, SharePoint and Defender XDR for multiple daysGlobal (Microsoft 365 cloud services)
- 2026-08-27Proton: total cooling failure at Frankfurt datacenter takes down Mail, VPN, Drive and Pass for 2h18mFrankfurt, Germany (Proton-operated datacenter)
- 2026-08-20Google Cloud us-west1 (Oregon) region: multi-service degradation for about 3h40mus-west1 region (The Dalles, Oregon)
- 2026-08-17GitHub outage: retry storm and Central US datacenter network saturation cause 7h47m disruption to Issues, PRs, Actions and CopilotCentral US datacenter region, with failover traffic routed to Northern Virginia
Контрольний список сайту DR
- Інша мережа електроживлення від основної — перевірте фактичну підстанцію, а не маркетингову заяву
- За межами зони затоплення та сейсмічної зони основної
- Різні оптоволоконні маршрути: два сайти не повинні ділити готель оператора зв'язку або пункт приземлення кабелю
- RTT виміряно, не оцінено — і в межах бюджету вибраного вами режиму реплікації
- Об'єкт сертифікований на рівень, вимаганий законодавством — перевірте каталог сертифікацій
- Потужність розширюється за контрактом: сайт ДР, який ви не можете масштабувати під час справжньої катастрофи, — це декорація
- Служба технічної підтримки з гарантованим часом відповіді — у разі кризи вам не потрібно буде туди летіти
- Перемикання на резервний сайт протестовано від початку до кінця перед запуском, потім щорічно — план — це не можливість
Частозадавані питання
На якій відстані повинні розташуватися первинний та резервний дата-центри?
Достатньо далеко, щоб не ділити катастрофу, достатньо близько для вашого режиму репліцирування. Мінімум — окремі мережі електропостачання, окремі зони паводків та окремі траси операторів — практично 50 км і більше. Синхронне репліцирування обмежує відстань приблизно 100 км (близько 10 мс в обидва боки); асинхронне репліцирування цю межу знімає. Багато регуляторів у Азіатсько-Тихоокеанському регіоні вимагають ДР за кордоном, що змушує використовувати асинхронне.
Яка різниця між RPO та RTO?
RPO (recovery point objective) — це обсяг даних, втрату яких ви можете дозволити, встановлюється режимом репліцирування. RTO (recovery time objective) — це час, на який ви можете дозволити переривання послуг, встановлюється типом ДР — backup-restore відновлює за дні, active-active за секунди. Вартість масштабується з обома параметрами: зменшення будь-якого на порядок приблизно подвоює бюджет ДР.
Чи може синхронне репліцирування працювати між країнами?
Тільки між сусідніми. Singapore–Kuala Lumpur з ~8 мс RTT це підтримує; Frankfurt–Amsterdam з ~11 мс — на межі. Все понад ~25 мс — територія асинхронного режиму, незалежно від того, що каже технічний паспорт постачальника сховища — кожен запис матиме затримку туди-сюди, і команда додатків це відчує раніше за команду ДР.
Що насправді виводить дата-центри з ладу?
Наш журнал інцидентів переважно складається з подій, пов'язаних з електроживленням (мережеві збої та відмови резервного живлення), пожеж (приміщення літій-іонних батарей з'являються повторно), відмов охолодження та несправностей мережевого обладнання — не регіональних природних катастроф. Практичний висновок: сайт ДР у одному місті з однією мережею електропостачання захищає майже від жодних інцидентів, що насправді трапляються на рівні об'єкта, а сайт в іншій країні захищає майже від усіх.
Чи є публічна хмара дійсним сайтом ДР для робочих навантажень колокейшну?
Для типів backup-restore та pilot-light часто так — ви платите за резервну потужність тільки коли вона працює, що саме відповідає моделі ціноутворення хмари. Підвох у вихідному трафіку при поверненні та оперативній складності: відновлення колокейшну на хмарну інфраструктуру означає постійне утримання двох окремих середовищ розгортання. Тестуйте повне відновлення, не репліцирування.
Як часто слід тестувати ДР?
Повне перемикання на резервний сайт щонайменше щорічно, відновлення компонентів квартально та після кожної істотної зміни інфраструктури. Невідтестований план ДР — це документ, не можливість — і журнал інцидентів показує, що відмови групуються саме в механізмах (перемикання електроживлення, перезапуск охолодження), які тестує тільки реальна перевірка.
Обираєте ринок ДР?
Розкажіть нам про первинний сайт, потрібний RPO та режим комплайєнсу. Ми повернемося з об'єктами на життєздатних ринках ДР, еталонними цінами та запитаннями, які варто поставити кожному оператору.

