Azioni
Segnalazione #363
apertaPRISM WARNING: [P3] Triggered: ACS PROD - La maggior parte dei pod di un deployment non sono funzionanti Kuber
Stato:
Nuovo
Priorità:
Normale
Assegnato a:
-
Inizio:
17-07-2026
Scadenza:
% Completato:
0%
Tempo stimato:
Descrizione
Problema ed evidenze operative:
- Teams message. [P3] Triggered: ACS PROD - La maggior parte dei pod di un deployment non sono funzionanti Kubernetes on kube_deployment:be-adimic-ingest questo è scattato giovedì lo riporto o fate un check prima ?
Soluzione / Procedura Operativa Prioritaria:
Fonte della procedura: diagnosi conservativa costruita sull'evidenza primaria disponibile.
- Sul namespace del servizio eseguire kubectl get pods -o wide, kubectl describe pod e kubectl logs --previous per isolare restart, eventi, readiness/liveness e causa del crash.
- Verificare deployment, replica set e rollout con kubectl rollout status/history deployment/ e correlare CPU/RAM, OOMKilled, ImagePullBackOff o probe failure nel timeframe Datadog.
- Applicare restart/rollback solo dopo aver distinto bug applicativo, saturazione risorse, problema immagine o dipendenza esterna non raggiungibile.
Step di Diagnosi ed Esecuzione:
- Usare la query Datadog riportata sotto per aprire log/APM nello stesso timeframe e verificare se esistono errori sul servizio coinvolto.
- Su Kubernetes verificare kubectl get pods, kubectl describe pod e kubectl logs del deployment collegato al servizio prima di effettuare restart.
Dati Datadog / Telemetry:
- finestra analizzata: ultimi 180 minuti
- chiavi evento usate per la ricerca: be-adimic-ingest
- topologia: No Datadog hosts matched target: be-adimic-ingest
- logs: 5 campioni pertinenti trovati. Query: "be-adimic-ingest"
- 2026-07-17T09:02:53.793Z service=hardened-kubernetes status=info anchor=be-adimic-ingest: I0717 09:02:52.504619 1 replica_set.go:679] "Finished syncing" logger="replicaset-controller" kind="ReplicaSet" key="apps/be-adimic-ingest-6cd6fc5445" duration="70.953µs"
- 2026-07-17T09:02:35.049Z service=be-adimic-ingest status=info anchor=be-adimic-ingest: 2026-07-17 09:02:34 DEBUG o.s.c.a.ClassPathScanningCandidateComponentProvider:476 - [TX_ID=, SESSION_ID=, USER_ID=] Identified candidate component class: URL [jar:nested:/app/boot.jar/!BOOT-INF/classes/!/it/pcd/be/adimic/ingest/model/cache/report/ReportSaveCac
Diagnosi corrente / Root cause:
Causa non ancora dimostrata; le ipotesi sotto sono ordinate e richiedono verifica tecnica.
- Degrado runtime Kubernetes da confermare: [P3] Triggered: ACS PROD - La maggior parte dei pod di un deployment non sono funzionanti Kubernetes on kube_deployment:be-adimic-ingest questo è scattato giovedì lo riporto o fate un check prima ?. Probabile pod non sano, probe failure, OOM, rollout difettoso o dipendenza esterna da discriminare con eventi cluster, log pod e metriche.
Dati necessari per conferma/chiusura:
- Confermare workflow riproducibile, utenti/operazioni impattati, orario di inizio e ultimo esito corretto noto.
- Registrare l'esito dei comandi, la correzione applicata e una prova funzionale positiva prima della chiusura.
Nessun dato disponibile
Azioni