Progetto

Generale

Profilo

Azioni

Segnalazione #364

aperta

PRISM WARNING: ed è appena scattato un altro [P3] Triggered: ACS PROD - La maggior parte dei pod di un deploym

Aggiunto da Marco Menichelli 14 giorni fa.

Stato:
Nuovo
Priorità:
Normale
Assegnato a:
-
Inizio:
17-07-2026
Scadenza:
% Completato:

0%

Tempo stimato:

Descrizione

Problema ed evidenze operative:

  • Teams message. ed è appena scattato un altro [P3] Triggered: ACS PROD - La maggior parte dei pod di un deployment non sono funzionanti Kubernetes on kube_deployment:mongodb-exporter

Soluzione / Procedura Operativa Prioritaria:
Fonte della procedura: diagnosi conservativa costruita sull'evidenza primaria disponibile.

  • Sul namespace del servizio eseguire kubectl get pods -o wide, kubectl describe pod e kubectl logs --previous per isolare restart, eventi, readiness/liveness e causa del crash.
  • Verificare deployment, replica set e rollout con kubectl rollout status/history deployment/ e correlare CPU/RAM, OOMKilled, ImagePullBackOff o probe failure nel timeframe Datadog.
  • Applicare restart/rollback solo dopo aver distinto bug applicativo, saturazione risorse, problema immagine o dipendenza esterna non raggiungibile.

Step di Diagnosi ed Esecuzione:

  • Usare la query Datadog riportata sotto per aprire log/APM nello stesso timeframe e verificare se esistono errori sul servizio coinvolto.
  • Su Kubernetes verificare kubectl get pods, kubectl describe pod e kubectl logs del deployment collegato al servizio prima di effettuare restart.

Dati Datadog / Telemetry:

  • finestra analizzata: ultimi 180 minuti
  • chiavi evento usate per la ricerca: mongodb-exporter
  • topologia: No Datadog hosts matched target: mongodb-exporter
  • logs: 5 campioni pertinenti trovati. Query: "mongodb-exporter"
  • 2026-07-17T09:04:24.859Z service=hardened-kubernetes status=info anchor=mongodb-exporter: I0717 09:04:23.108163 1 replica_set.go:679] "Finished syncing" logger="replicaset-controller" kind="ReplicaSet" key="monitoring/mongodb-exporter-6dbccb84db" duration="78.846µs"
  • 2026-07-17T09:04:12Z service=agent status=info anchor=mongodb-exporter: 2026-07-17 09:04:12 UTC | CORE | INFO | (pkg/logs/tailers/file/tailer.go:349 in func1) | Closed /var/log/pods/monitoring_mongodb-exporter-6dbccb84db-v2vnd_d1cbfcf5-dae7-44d3-a535-7942651f0925/mongodb-exporter/125.log for tailer key /var/log/pods/monitoring_mon
  • 2026-07-17T09:04:09Z service=agent status=info anchor=mongodb-exporter: 2026-07-17 09:04:09 UTC | CORE | INFO | (pkg/logs/tailers/file/tailer_nix.go:29 in setup) | Opening /var/log/pods/monitoring_mongodb-exporter-6dbccb84db-v2vnd_d1cbfcf5-dae7-44d3-a535-7942651f0925/mongodb-exporter/126.log for tailer key /var/log/pods/monitoring
  • 2026-07-17T09:04:09Z service=agent status=info anchor=mongodb-exporter: 2026-07-17 09:04:09 UTC | CORE | INFO | (pkg/logs/launchers/file/launcher.go:461 in startNewTailer) | Starting a new tailer for: /var/log/pods/monitoring_mongodb-exporter-6dbccb84db-v2vnd_d1cbfcf5-dae7-44d3-a535-7942651f0925/mongodb-exporter/126.log (offset: 0

Diagnosi corrente / Root cause:
Causa non ancora dimostrata; le ipotesi sotto sono ordinate e richiedono verifica tecnica.

  • Degrado runtime Kubernetes da confermare: ed è appena scattato un altro [P3] Triggered: ACS PROD - La maggior parte dei pod di un deployment non sono funzionanti Kubernetes on kube_deployment:mongodb-exporter. Probabile pod non sano, probe failure, OOM, rollout difettoso o dipendenza esterna da discriminare con eventi cluster, log pod e metriche.

Dati necessari per conferma/chiusura:

  • Confermare workflow riproducibile, utenti/operazioni impattati, orario di inizio e ultimo esito corretto noto.
  • Registrare l'esito dei comandi, la correzione applicata e una prova funzionale positiva prima della chiusura.

Nessun dato disponibile

Azioni

Esporta su Atom PDF