The post has been translated automatically. Original language: Russian
Infrastructure migration is one of the points where mistakes are expensive, and fuss is the main source of these mistakes. A small checklist that reduces risks.
Before migration: — make a complete inventory of the current infrastructure: servers, databases, dependencies between services; — determine the window with the minimum load to transfer; — prepare a rollback plan in case something goes wrong; — test backups in advance to make sure that they can be restored.
During migration: — migrate services in stages, rather than all at the same time, starting with non-critical components; — keep a log of each step — what was done and when, who answered; — check the functionality of each migrated component before moving on to the next one.
After migration: — monitor the workload and metrics for at least one to two weeks with increased attention; — keep the old infrastructure in standby mode for an agreed period of time before shutting it down completely; — record the conclusions — what worked well and what should be done differently next time.
Migration, stretched over several controlled stages, is almost always safer than trying to do everything overnight.
Миграция инфраструктуры — один из моментов, где ошибки дорого стоят, а суета — главный источник этих ошибок. Небольшой чек-лист, который снижает риски.
До миграции: — составить полную инвентаризацию текущей инфраструктуры: серверы, базы данных, зависимости между сервисами; — определить окно с минимальной нагрузкой для переноса; — подготовить план отката на случай, если что-то пойдёт не так; — заранее протестировать резервные копии — убедиться, что из них можно восстановиться.
Во время миграции: — переносить сервисы поэтапно, а не всё одновременно, начиная с некритичных компонентов; — вести журнал каждого шага — что и когда было сделано, кто отвечал; — проверять работоспособность каждого перенесённого компонента до перехода к следующему.
После миграции: — мониторить нагрузку и метрики минимум одну-две недели повышенное внимание; — сохранить старую инфраструктуру в режиме ожидания на согласованный срок, прежде чем полностью её отключать; — зафиксировать выводы — что сработало хорошо, а что в следующий раз стоит сделать иначе.
Миграция, растянутая на несколько контролируемых этапов, почти всегда безопаснее, чем попытка сделать всё за одну ночь.