The post has been translated automatically. Original language: Russian
There are several areas that have a significant impact on the development of the data center industry in recent years.
The growing load from the AI infrastructure. Training and inference of machine learning models require a fundamentally different density of computing power and, consequently, different solutions for cooling and energy supply of racks — this changes the requirements for designing new sites.
Edge computing. Part of the computing and data processing is shifting closer to the user — to regional and local points of presence in order to reduce latency for services sensitive to it: video, IoT, financial transactions.
Sustainable development and energy efficiency. Reducing PUE, using fracking, and switching to more efficient cooling schemes are becoming not just an image factor, but a direct cost—saving item for data center operators and, consequently, for their customers.
Stricter security and compliance requirements. The growing number of cyber attacks and the development of data protection regulation are pushing data centers to invest in stricter physical and information security procedures, as well as transparent reporting for customers.
Hybrid and multi-cloud architectures are becoming the norm, not the exception — businesses are less likely to choose a single infrastructure provider, preferring to distribute risks between multiple sites and clouds.
These trends should be taken into account now when planning infrastructure for the next 2-3 years, and not after the fact, when current solutions will no longer cope with the load.
Многие команды включают мониторинг инфраструктуры «для галочки» — ставят дашборд с десятками графиков и на этом успокаиваются. Проблема в том, что обилие метрик само по себе не помогает быстрее находить и решать инциденты, а иногда даже мешает — важный сигнал тонет среди второстепенных.
Вот метрики, которые стоит выносить на первый экран мониторинга в первую очередь.
Доступность сервиса (uptime) — базовый показатель, но важно мерить его не «в среднем по больнице», а по каждому критичному сервису отдельно. Общий аптайм инфраструктуры может быть отличным, пока конкретный платёжный API лежит уже двадцать минут.
Задержка отклика (latency), особенно перцентили 95 и 99, а не только среднее значение. Среднее легко маскирует ситуацию, когда у большинства пользователей всё быстро, а у заметной части — стабильно медленно.
Утилизация ключевых ресурсов — CPU, память, диск, сеть — с акцентом на тренд, а не на моментальное значение. Разовый всплеск на 90% CPU не так опасен, как ровный рост утилизации на протяжении месяцев, который предсказуемо упрётся в потолок.
Скорость и успешность восстановления после сбоя — время до обнаружения инцидента (time to detect) и время до устранения (time to resolve). Эти две метрики в связке показывают зрелость всей системы реагирования, а не только качество железа.
Насыщенность очередей и таймауты между сервисами — для распределённых систем это часто более ранний индикатор проблемы, чем нагрузка на отдельный сервер: узкое место обычно не там, где кажется на первый взгляд.
Практический совет: если дашборд не помещается на одном экране без прокрутки — скорее всего, на него вынесено слишком много второстепенного. Стоит оставить только те метрики, по которым команда реально принимает решения, а остальное убрать в отдельные детализированные панели для расследования инцидентов, а не для повседневного взгляда.