Progetto

Generale

Profilo

Azioni

Segnalazione #363

aperta

PRISM WARNING: [P3] Triggered: ACS PROD - La maggior parte dei pod di un deployment non sono funzionanti Kuber

Aggiunto da Marco Menichelli 14 giorni fa.

Stato:
Nuovo
Priorità:
Normale
Assegnato a:
-
Inizio:
17-07-2026
Scadenza:
% Completato:

0%

Tempo stimato:

Descrizione

Problema ed evidenze operative:

  • Teams message. [P3] Triggered: ACS PROD - La maggior parte dei pod di un deployment non sono funzionanti Kubernetes on kube_deployment:be-adimic-ingest questo è scattato giovedì lo riporto o fate un check prima ?

Soluzione / Procedura Operativa Prioritaria:
Fonte della procedura: diagnosi conservativa costruita sull'evidenza primaria disponibile.

  • Sul namespace del servizio eseguire kubectl get pods -o wide, kubectl describe pod e kubectl logs --previous per isolare restart, eventi, readiness/liveness e causa del crash.
  • Verificare deployment, replica set e rollout con kubectl rollout status/history deployment/ e correlare CPU/RAM, OOMKilled, ImagePullBackOff o probe failure nel timeframe Datadog.
  • Applicare restart/rollback solo dopo aver distinto bug applicativo, saturazione risorse, problema immagine o dipendenza esterna non raggiungibile.

Step di Diagnosi ed Esecuzione:

  • Usare la query Datadog riportata sotto per aprire log/APM nello stesso timeframe e verificare se esistono errori sul servizio coinvolto.
  • Su Kubernetes verificare kubectl get pods, kubectl describe pod e kubectl logs del deployment collegato al servizio prima di effettuare restart.

Dati Datadog / Telemetry:

  • finestra analizzata: ultimi 180 minuti
  • chiavi evento usate per la ricerca: be-adimic-ingest
  • topologia: No Datadog hosts matched target: be-adimic-ingest
  • logs: 5 campioni pertinenti trovati. Query: "be-adimic-ingest"
  • 2026-07-17T09:02:53.793Z service=hardened-kubernetes status=info anchor=be-adimic-ingest: I0717 09:02:52.504619 1 replica_set.go:679] "Finished syncing" logger="replicaset-controller" kind="ReplicaSet" key="apps/be-adimic-ingest-6cd6fc5445" duration="70.953µs"
  • 2026-07-17T09:02:35.049Z service=be-adimic-ingest status=info anchor=be-adimic-ingest: 2026-07-17 09:02:34 DEBUG o.s.c.a.ClassPathScanningCandidateComponentProvider:476 - [TX_ID=, SESSION_ID=, USER_ID=] Identified candidate component class: URL [jar:nested:/app/boot.jar/!BOOT-INF/classes/!/it/pcd/be/adimic/ingest/model/cache/report/ReportSaveCac

Diagnosi corrente / Root cause:
Causa non ancora dimostrata; le ipotesi sotto sono ordinate e richiedono verifica tecnica.

  • Degrado runtime Kubernetes da confermare: [P3] Triggered: ACS PROD - La maggior parte dei pod di un deployment non sono funzionanti Kubernetes on kube_deployment:be-adimic-ingest questo è scattato giovedì lo riporto o fate un check prima ?. Probabile pod non sano, probe failure, OOM, rollout difettoso o dipendenza esterna da discriminare con eventi cluster, log pod e metriche.

Dati necessari per conferma/chiusura:

  • Confermare workflow riproducibile, utenti/operazioni impattati, orario di inizio e ultimo esito corretto noto.
  • Registrare l'esito dei comandi, la correzione applicata e una prova funzionale positiva prima della chiusura.

Nessun dato disponibile

Azioni

Esporta su Atom PDF