Monitorare tutto produce allarmi che nessuno legge, ed è come non monitorare nulla. Cinque segnali coprono quasi ogni disservizio, e ognuno ha una soglia che lascia il tempo di agire invece di annunciarle che è già successo.

I cinque

  • Il disco, all'80%. Non al 95. Un disco che si riempie di notte tiene il sito a terra finché qualcuno non si sveglia; l'80% è un lavoro per la mattina.
  • La memoria, appena si comincia a usare lo swap. Swap in uso vuol dire che la macchina arranca e che è già tutto lento.
  • Il carico, rapportato al numero di core. Allarme al doppio dei core mantenuto per cinque minuti: un picco è normale, un altopiano no.
  • La scadenza del certificato, a 21 giorni. Il rinnovo parte a 30; se a 21 non è avvenuto, qualcosa lo sta bloccando.
  • Il sito stesso, dall'esterno. Tutti i servizi possono essere verdi mentre la pagina risponde 500.

Dall'esterno, non dal server

Un controllo che gira sulla macchina che sta controllando non può dirle che quella macchina è irraggiungibile. Il controllo più importante è una richiesta HTTP da un altro posto, che cerca una stringa precisa nella pagina - non soltanto un 200.

curl -fsS --max-time 10 https://yourdomain.com/ | grep -q 'Sign in' || alert

Tenga allarmi che valga la pena leggere

Un allarme che scatta ogni giorno e viene ignorato ogni giorno è peggio di nessun allarme: insegna a tutti a ignorare quel canale, anche il giorno in cui conta. Se qualcosa scatta e lei non fa nulla, o corregge la causa o cancella l'allarme.

Guardi l'andamento, non solo la soglia

Un disco al 60% va bene. Un disco che la settimana scorsa era al 40% no: fra due settimane sarà pieno. Un grafico risponde al "quando", cosa che una soglia non fa mai.

EGPNL mostra CPU, memoria, disco e traffico per ciascun server con lo storico. I piani gestiti aggiungono il controllo dall'esterno e la reperibilità, che è la parte non automatizzabile.