Azioni
Segnalazione #364
apertaPRISM WARNING: ed è appena scattato un altro [P3] Triggered: ACS PROD - La maggior parte dei pod di un deploym
Stato:
Nuovo
Priorità:
Normale
Assegnato a:
-
Inizio:
17-07-2026
Scadenza:
% Completato:
0%
Tempo stimato:
Descrizione
Problema ed evidenze operative:
- Teams message. ed è appena scattato un altro [P3] Triggered: ACS PROD - La maggior parte dei pod di un deployment non sono funzionanti Kubernetes on kube_deployment:mongodb-exporter
Soluzione / Procedura Operativa Prioritaria:
Fonte della procedura: diagnosi conservativa costruita sull'evidenza primaria disponibile.
- Sul namespace del servizio eseguire kubectl get pods -o wide, kubectl describe pod e kubectl logs --previous per isolare restart, eventi, readiness/liveness e causa del crash.
- Verificare deployment, replica set e rollout con kubectl rollout status/history deployment/ e correlare CPU/RAM, OOMKilled, ImagePullBackOff o probe failure nel timeframe Datadog.
- Applicare restart/rollback solo dopo aver distinto bug applicativo, saturazione risorse, problema immagine o dipendenza esterna non raggiungibile.
Step di Diagnosi ed Esecuzione:
- Usare la query Datadog riportata sotto per aprire log/APM nello stesso timeframe e verificare se esistono errori sul servizio coinvolto.
- Su Kubernetes verificare kubectl get pods, kubectl describe pod e kubectl logs del deployment collegato al servizio prima di effettuare restart.
Dati Datadog / Telemetry:
- finestra analizzata: ultimi 180 minuti
- chiavi evento usate per la ricerca: mongodb-exporter
- topologia: No Datadog hosts matched target: mongodb-exporter
- logs: 5 campioni pertinenti trovati. Query: "mongodb-exporter"
- 2026-07-17T09:04:24.859Z service=hardened-kubernetes status=info anchor=mongodb-exporter: I0717 09:04:23.108163 1 replica_set.go:679] "Finished syncing" logger="replicaset-controller" kind="ReplicaSet" key="monitoring/mongodb-exporter-6dbccb84db" duration="78.846µs"
- 2026-07-17T09:04:12Z service=agent status=info anchor=mongodb-exporter: 2026-07-17 09:04:12 UTC | CORE | INFO | (pkg/logs/tailers/file/tailer.go:349 in func1) | Closed /var/log/pods/monitoring_mongodb-exporter-6dbccb84db-v2vnd_d1cbfcf5-dae7-44d3-a535-7942651f0925/mongodb-exporter/125.log for tailer key /var/log/pods/monitoring_mon
- 2026-07-17T09:04:09Z service=agent status=info anchor=mongodb-exporter: 2026-07-17 09:04:09 UTC | CORE | INFO | (pkg/logs/tailers/file/tailer_nix.go:29 in setup) | Opening /var/log/pods/monitoring_mongodb-exporter-6dbccb84db-v2vnd_d1cbfcf5-dae7-44d3-a535-7942651f0925/mongodb-exporter/126.log for tailer key /var/log/pods/monitoring
- 2026-07-17T09:04:09Z service=agent status=info anchor=mongodb-exporter: 2026-07-17 09:04:09 UTC | CORE | INFO | (pkg/logs/launchers/file/launcher.go:461 in startNewTailer) | Starting a new tailer for: /var/log/pods/monitoring_mongodb-exporter-6dbccb84db-v2vnd_d1cbfcf5-dae7-44d3-a535-7942651f0925/mongodb-exporter/126.log (offset: 0
Diagnosi corrente / Root cause:
Causa non ancora dimostrata; le ipotesi sotto sono ordinate e richiedono verifica tecnica.
- Degrado runtime Kubernetes da confermare: ed è appena scattato un altro [P3] Triggered: ACS PROD - La maggior parte dei pod di un deployment non sono funzionanti Kubernetes on kube_deployment:mongodb-exporter. Probabile pod non sano, probe failure, OOM, rollout difettoso o dipendenza esterna da discriminare con eventi cluster, log pod e metriche.
Dati necessari per conferma/chiusura:
- Confermare workflow riproducibile, utenti/operazioni impattati, orario di inizio e ultimo esito corretto noto.
- Registrare l'esito dei comandi, la correzione applicata e una prova funzionale positiva prima della chiusura.
Nessun dato disponibile
Azioni