Минимум: CPU, memory, disk bytes/inodes, IO util, load, systemd failed units, journal error rate, NTP sync, certificate expiry — без этого «проверим по SSH» не масштабируется.
Разбор
- Алерты на predict (disk fill ETA), не только на 100%.
- Golden signals приложений + host signals рядом.
- Карточка хоста: uptime, kernel, pending reboot.
- Синтетика SSH/Node exporter scrape как canary доступа.
Итог
Хорошая host observability заменяет героизм ночных SSH-сессий.