Azioni
Segnalazione #353
apertaPRISM WARNING: [P3] [Recovered on {container_name:mongodb-exporter}] ACS PROD - CPU occupata Pod Kubernetes qu
Stato:
Nuovo
Priorità:
Normale
Assegnato a:
-
Inizio:
15-07-2026
Scadenza:
% Completato:
0%
Tempo stimato:
Descrizione
Problema ed evidenze operative:
- Teams message. [P3] [Recovered on {container_name:mongodb-exporter}] ACS PROD - CPU occupata Pod Kubernetes questo qui è
Soluzione / Procedura Operativa Prioritaria:
Fonte della procedura: precedente storico RAG pertinente all'evidenza primaria.
- Verificare immediatamente lo stato dei pod, le risorse del cluster e la configurazione del deployment.; avg(last_5m):avg:kubernetes_state.deployment.replicas_available{kube_cluster_name:acs-prd} by {kube_deployment} / avg:kubernetes_state.deployment.replicas_desired{kube_cluster_name:acs-prd} by {kube_deployment} < 0.5 The monitor was last triggered at Mon Dec 22 2025 10:16:49 UTC.
- Sul namespace del servizio eseguire kubectl get pods -o wide, kubectl describe pod e kubectl logs --previous; verificare eventi, probe, restart, OOMKilled e rollout prima di restart o rollback.
Step di Diagnosi ed Esecuzione:
- Usare la query Datadog riportata sotto per aprire log/APM nello stesso timeframe e verificare se esistono errori sul servizio coinvolto.
- Su Kubernetes verificare kubectl get pods, kubectl describe pod e kubectl logs del deployment collegato al servizio prima di effettuare restart.
Dati Datadog / Telemetry:
- finestra analizzata: ultimi 180 minuti
- chiavi evento usate per la ricerca: Recovered, container_name, mongodb-exporter, occupata, Kubernetes, questo
- topologia: No Datadog hosts matched target: Recovered,container_name,mongodb-exporter,occupata
- logs: 5 campioni pertinenti trovati. Query: "Recovered" OR "container_name" OR "mongodb-exporter" OR "occupata" OR "Kubernetes" OR "questo"
- 2026-07-15T10:06:16.918Z service=adarte-ticketing-accounting-notification status=info: 10:06:16.446 [org.springframework.kafka.KafkaListenerEndpointContainer#4-0-C-1] INFO o.s.k.l.KafkaMessageListenerContainer - Record in retry and not yet recovered
- Filtri tecnici derivati dall'evento: container, kubernetes, mongodb-exporter, name
Diagnosi corrente / Root cause:
Causa osservata in uno storico pertinente; deve essere confermata sul caso corrente con log e telemetry.
- Verifica immediatamente eventuali processi intensivi o comportamenti anomali.; avg(last_5m):100 * max:container.cpu.usage{cluster_name:acs-prd} by {container_name} / max:container.cpu.limit{cluster_name:acs-prd} by {container_name} > 90 The monitor was last triggered at Mon Dec 22 2025 10:15:00 UTC.
Dati necessari per conferma/chiusura:
- Confermare workflow riproducibile, utenti/operazioni impattati, orario di inizio e ultimo esito corretto noto.
- Registrare l'esito dei comandi, la correzione applicata e una prova funzionale positiva prima della chiusura.
Nessun dato disponibile
Azioni