Heartbeat отвечает на первый вопрос
Если агент перестал передавать состояние, сначала нужно отделить недоступность сервера от сбоя самого агента или сети.
Разберитесь, какие серверные метрики собирать, как читать их вместе и где проходит граница между ранним сигналом и доказанной причиной.
Если агент перестал передавать состояние, сначала нужно отделить недоступность сервера от сбоя самого агента или сети.
Одна высокая метрика редко объясняет инцидент. Важны длительность, изменение относительно обычного уровня и совпадение по времени с ошибками сайта.
Полезное предупреждение назначено ответственному и содержит сервер, метрику, время, текущее значение и следующий диагностический шаг.
Практическая инструкция по настройке мониторинга VPS: какие метрики отслеживать, зачем нужен heartbeat, как выбрать пороги и уведомления.
Открыть руководство →СерверыСписок ключевых метрик сервера для мониторинга: CPU, RAM, диск, load average, сеть, heartbeat, health score и связь с инцидентами сайта.
Открыть руководство →СерверыКак симптомы высокой нагрузки CPU, нехватки RAM и заполненного диска влияют на сайт, TTFB, HTTP 5xx и стабильность сервера.
Открыть руководство →СерверыЧто означает load average 1/5/15, как учитывать CPU cores, runnable и uninterruptible tasks, проверять CPU, I/O, процессы и контейнеры.
Открыть руководство →СерверыДиагностика iowait: CPU idle, disk latency, queue, throughput, процессы, database, swap, cloud volume limits и связь с TTFB.
Открыть руководство →perfMon сохраняет проверки, метрики и временную шкалу инцидента, чтобы статья была планом действий, а не единственным источником информации.