Issue 10092
Quanto è abbastanza? Dare un significato alle soglie
Dalla misura osservata a uno SLO motivato, con un error budget che aiuta a decidere senza diventare un numero magico.
· 5 min
Dalla serie
Obiettivo
Costruire un criterio di accettabilità motivato distinguendo situazione osservata, indicatore di servizio, obiettivo su una popolazione e un periodo, error budget e condizione di intervento; calcolare e interpretare un esempio circoscritto.
Una soglia senza contesto è solo un numero
Quando qualcuno propone «99,9%», la prima domanda non è se il numero sia abbastanza ambizioso. È: 99,9% di che cosa, per chi, su quale popolazione e in quale periodo? Parti dal contratto della misura: definisci l'eventoGlossarioEventoUna dichiarazione durevole che qualcosa di significativo è già accaduto.Apri la voce completa eleggibile, la condizione che lo rende buono, la fonte dei dati, le esclusioni e il trattamento dei casi tardivi o non valutabili. Solo dopo formula lo SLOGlossarioSLOUn intervallo target per uno SLI su un periodo definito.Apri la voce completa come obiettivo su una popolazione e un periodo. Per esempio: almeno il 99,9% degli ordini accettati deve essere persistito e avere una conferma disponibile entro cinque secondi, in una finestra scorrevole di 28 giorni. Qui cinque secondi è il criterio sul singolo evento; 99,9% è l'obiettivo sulla popolazione; 28 giorni è il periodo. Lo SLIGlossarioSLIUn indicatore misurato del comportamento di un servizio che conta per utenti o operatori.Apri la voce completa descrive ciò che osservi, mentre lo SLO dichiara ciò che consideri accettabile. Il valore non nasce dalla precisione decimale: nasce dal fatto che prodotto, architettura e operation sappiano spiegare perché quell'obiettivo protegge un risultato e quale costo comporta sostenerlo. Versiona ogni cambio di definizione: altrimenti il confronto storico può sembrare coerente pur misurando cose diverse.
Il numero giusto non esiste fuori dal rischio che vuoi accettare
Uno SLO più severo può ridurre il degrado percepito, ma richiede capacità, ridondanza, qualità dei dati e disciplina operativa maggiori. Uno più permissivo lascia spazio al cambiamento, ma può accettare un impatto che prodotto o utenti ritengono eccessivo. Anche il periodo conta: una finestra lunga stabilizza il segnale ma reagisce più lentamente; una finestra breve evidenzia rapidamente i problemi ma è più sensibile a volumi ridotti e oscillazioni. L'aggregazione semplifica la governance, però può nascondere un degrado concentrato su un segmento importante. Se servono segmenti separati, dichiara popolazione e volume osservato per ciascuno. Infine, non usare uno SLO di tempestività come prova della correttezza complessiva: unicità dell'ordine, autorizzazione del pagamento e vincoli di integrità richiedono controlli distinti. La soglia è una scelta sul rischio accettabile rispetto a una proprietà precisa, non un bollino generale di qualità.
SLO e allarme rispondono a domande diverse
Uno SLO dice quale comportamento consideriamo accettabile su una popolazione e un periodo. Un allarme dice quando qualcuno deve intervenire. Copiare la percentuale dello SLO dentro una regola di alerting confonde le due cose. Una buona condizione di intervento deve dare tempo per agire, considerare velocità di consumo dell'error budgetGlossarioError BudgetLa quantità di inaffidabilità consentita implicitamente da uno SLO.Apri la voce completa, impatto, volume e qualità del dato. Può quindi scattare prima che lo SLO venga effettivamente mancato, oppure non richiedere una chiamata urgente per ogni oscillazione breve. Lo SLO orienta il giudizio; l'allarme organizza la risposta operativa. Sono collegati, ma non sono la stessa soglia.
Ordini e Pagamenti: il margine serve a decidere
Una piattaforma enterprise registra autorevolmente una richiesta di ordine come accettata. Un evento è buono quando l'ordine viene persistito e la conferma diventa disponibile entro cinque secondi. I retryGlossarioRetryUn nuovo tentativo eseguito dopo un fallimento che potrebbe essere transitorio.Apri la voce completa della stessa operazione non aumentano il denominatore; errori noti e completamenti oltre il limite non sono buoni. In un periodo completamente osservato ci sono 100.000 operazioni eleggibili e già valutabili: 99.920 buone e 80 non buone. Lo SLI è 99.920 diviso 100.000, cioè 99,92%. Con uno SLO didattico del 99,9%, l'error budget della popolazione è di 100 operazioni: 80 sono state consumate e ne restano 20. Questo margine non autorizza a causare altri errori e non equivale a minuti di indisponibilità, perché il budget è basato sugli eventi. In una finestra scorrevole, inoltre, popolazione ed esiti cambiano continuamente. In una riunione architetturale il punto non è dire soltanto «siamo verdi»: è capire se il margine si sta consumando abbastanza velocemente da cambiare una decisione su release, capacità, resilienzaGlossarioResilienzaLa capacità di continuare a produrre risultati utili quando componenti falliscono o le condizioni degradano.Apri la voce completa o stabilizzazione.
La scheda minima da portare al tavolo
Per rendere la soglia discutibile e verificabile, porta una scheda breve che separi misura, obiettivo e risposta. • Scopo, utenti interessati e confine del servizio. • Definizione di evento eleggibile ed evento buono. • Fonte, granularità, copertura e qualità dei dati. • Formula dello SLI, esclusioni e gestione dei dati tardivi. • Periodo, obiettivo e motivazione basata su impatto, aspettative e costo. • Error budget espresso nella stessa unità dell'indicatore. • Decisioni che possono cambiare quando il margine si riduce. • Condizione di intervento distinta dallo SLO. • Responsabili, azioni possibili e criteri di revisione.
Per approfondire
Fonti autorevoli per distinguere SLI, SLO, accordi contrattuali ed error budget e per implementare obiettivi verificabili. • Service Level Objectives — Google, Site Reliability Engineering — https://sre.google/sre-book/service-level-objectives/ • Implementing SLOs — Google, The Site Reliability Workbook — https://sre.google/workbook/implementing-slos/
Una soglia utile deve portare a un'azione
Ora abbiamo una misura affidabile e un criterio esplicito per capire quando il comportamento è accettabile. Resta l'ultimo passaggio: quando il segnale indica che il rischio sta aumentando, chi deve intervenire, con quale urgenza e quale evidenza dimostra che il problema è davvero rientrato?