Dashboard Grafana, avvisi e integrazioni dello stack LGTM per SRE e i team della piattaforma che necessitano di metriche che corrispondano alla realtà delle chiamate.
Grafana come livello di visualizzazione, non un altro silo
Grafana unifica metriche (Prometheus/Mimir), log (Loki), tracce (Tempo) e origini dati di terze parti (CloudWatch, Datadog, PostgreSQL) nelle dashboard che i team operativi effettivamente aprono durante gli incidenti.
Progettiamo in base ai flussi di lavoro di guardia: segnali d'oro per servizio, pannelli SLO e collegamenti di drill-down dall'avviso alla query di registro, non 400 grafici orfani da una galleria di modelli.
Grafana Cloud vs Grafana self-hosted OSS
Grafana Cloud riduce il lavoro operativo: Mimir/Loki/Tempo, SSO gestiti e fatturazione in base all'utilizzo. Il self-hosted si adatta ad ambienti air-gap, plug-in personalizzati o controllo dei costi su larga scala.
Documentiamo i costi in uscita, di conservazione e di cardinalità prima dell'impegno nel cloud, in modo che il reparto finanziario non riceva fatture a sorpresa da etichette ad alta cardinalità.
Standard di progettazione del dashboard e as-code
I dashboard si trovano in Git (Jsonnet, Terraform o Grizzly) con PR di revisione, senza modifiche manuali dell'interfaccia utente perse durante l'aggiornamento. Variabili, unità e legende seguono le convenzioni di denominazione condivise dall'intera organizzazione.
Eliminiamo le vanity metrics durante la migrazione: se nessuno ha agito su un pannello in 90 giorni, non viene spedito alle cartelle di produzione.
Avvisi: percorsi, silenzi e integrazione su chiamata
Le regole di avviso utilizzano velocità di masterizzazione multi-finestra per SLO, ove applicabile; avvisi di soglia semplici per lavori batch. I criteri di notifica vengono indirizzati a PagerDuty, Opsgenie, Slack o e-mail con etichette di gravità.
Ottimizziamo il rumore degli avvisi nella settimana dell'Hypercare: gli avvisi svolazzanti ricevono regole di registrazione o durate `for` modificate prima del trasferimento.
OpenTelemetry e lacune nella strumentazione
Le dashboard sono valide tanto quanto le metriche emesse. Esaminiamo l'implementazione del raccoglitore OTel, il rilevamento dei servizi e gli esempi che collegano le tracce ai parametri quando le app non dispongono di strumentazione.
Kubernetes, Nomad e serverless necessitano ciascuno di configurazioni di scraping diverse, documentate nel runbook, non nella conoscenza tribale di kubectl.
Sicurezza, RBAC e controllo per le aziende Grafana
Le autorizzazioni delle cartelle, gli account di servizio e le chiavi API seguono il privilegio minimo. Le funzionalità aziendali (SSO SAML, registri di controllo) sono configurate per gli acquirenti di conformità.
I progetti partono indicativamente da € 4.200 per dashboard servizi core + percorsi di alert; le migrazioni complete dello stack LGTM vengono citate dopo l'inventario dell'origine dati.