Incidente: l'IA analizza i log, trova la causa root e propone una soluzione
L'agente monitora gli alert (Datadog, Prometheus), raccoglie i log, analizza la causa root (cosa si è rotto e perché), propone i passi della soluzione e coordina il team su Slack. Riduce il tempo di diagnosi da ore a minuti. Da $19/mese.
Ti suona familiare?
Cosa ti sta mangiando il tempo
Gli incidenti si allungano: quando qualcosa cade, la diagnosi richiede un'ora, la soluzione un'altra, e i clienti perdono soldi nel frattempo
I log sono rumorosi: un milione di righe tra cui trovare le due che contano, impossibile a mano
Manca un approccio sistematico: ogni volta qualcuno lotta da solo con i log, senza un piano d'azione consolidato
Le informazioni sono disperse: log in Datadog, metriche in Prometheus, trace in Jaeger, codice su GitHub — bisogna riunire tutto
Cosa può fare il tuo agente AI
Funziona con i tuoi strumenti
Inizia in pochi passaggi
Scatta un alert
Parte un alert da Datadog o Prometheus: «CPU sopra l'80% in produzione». L'alert arriva a PagerDuty e l'ingegnere di guardia lo vede. L'agente riceve l'alert allo stesso tempo.
L'agente raccoglie i dati e analizza
In pochi secondi, l'agente riunisce i log recenti (dell'ultima ora), le metriche di Datadog (CPU, memoria, disco), le trace (se ci sono) e i commit Git dell'ultimo giorno. E analizza cosa è cambiato.
Causa root e raccomandazione
L'agente determina di cosa si tratta: un bug nel codice (un deploy di un'ora fa ha rotto la gestione della memoria), una configurazione errata o un aumento del carico. E propone una soluzione concreta: fare rollback del deploy o aggiungere più risorse.
Messaggio su Slack con il piano d'azione
L'agente pubblica sul canale dell'incidente: «Causa root: memory leak nella funzione X (commit abc123). Soluzione: distribuire il branch con la correzione, oppure come misura temporanea, alzare il limite di memoria. Cosa preferisci? (1) soluzione temporanea rapida, (2) correzione completa».
Follow-up e chiusura
L'ingegnere sceglie e applica la soluzione. L'agente monitora: le metriche tornano alla normalità? Se sì, chiude l'incidente su PagerDuty e lo registra su Slack. Anche il postmortem e i task di follow-up possono essere automatizzati.
Domande frequenti
Sì. Prometheus con Grafana, Elastic, Splunk, CloudWatch: l'agente si collega a qualunque di questi. Serve accesso via API e una configurazione adeguata. Puoi combinarli: metriche da Datadog, log da GitHub, notifiche su Slack.
Vuoi OpenClaw — senza il DevOps?
OpenKlo è l'hosting gestito per l'OpenClaw originale. Stesso agente, attivo in 3 minuti.
Disdici quando vuoi · I migliori modelli inclusi · Passa di piano quando vuoi