Progetto

Generale

Profilo

Azioni

Segnalazione #353

aperta

PRISM WARNING: [P3] [Recovered on {container_name:mongodb-exporter}] ACS PROD - CPU occupata Pod Kubernetes qu

Aggiunto da Marco Menichelli 16 giorni fa.

Stato:
Nuovo
Priorità:
Normale
Assegnato a:
-
Inizio:
15-07-2026
Scadenza:
% Completato:

0%

Tempo stimato:

Descrizione

Problema ed evidenze operative:

  • Teams message. [P3] [Recovered on {container_name:mongodb-exporter}] ACS PROD - CPU occupata Pod Kubernetes questo qui è

Soluzione / Procedura Operativa Prioritaria:
Fonte della procedura: precedente storico RAG pertinente all'evidenza primaria.

  • Verificare immediatamente lo stato dei pod, le risorse del cluster e la configurazione del deployment.; avg(last_5m):avg:kubernetes_state.deployment.replicas_available{kube_cluster_name:acs-prd} by {kube_deployment} / avg:kubernetes_state.deployment.replicas_desired{kube_cluster_name:acs-prd} by {kube_deployment} < 0.5 The monitor was last triggered at Mon Dec 22 2025 10:16:49 UTC.
  • Sul namespace del servizio eseguire kubectl get pods -o wide, kubectl describe pod e kubectl logs --previous; verificare eventi, probe, restart, OOMKilled e rollout prima di restart o rollback.

Step di Diagnosi ed Esecuzione:

  • Usare la query Datadog riportata sotto per aprire log/APM nello stesso timeframe e verificare se esistono errori sul servizio coinvolto.
  • Su Kubernetes verificare kubectl get pods, kubectl describe pod e kubectl logs del deployment collegato al servizio prima di effettuare restart.

Dati Datadog / Telemetry:

  • finestra analizzata: ultimi 180 minuti
  • chiavi evento usate per la ricerca: Recovered, container_name, mongodb-exporter, occupata, Kubernetes, questo
  • topologia: No Datadog hosts matched target: Recovered,container_name,mongodb-exporter,occupata
  • logs: 5 campioni pertinenti trovati. Query: "Recovered" OR "container_name" OR "mongodb-exporter" OR "occupata" OR "Kubernetes" OR "questo"
  • 2026-07-15T10:06:16.918Z service=adarte-ticketing-accounting-notification status=info: 10:06:16.446 [org.springframework.kafka.KafkaListenerEndpointContainer#4-0-C-1] INFO o.s.k.l.KafkaMessageListenerContainer - Record in retry and not yet recovered
  • Filtri tecnici derivati dall'evento: container, kubernetes, mongodb-exporter, name

Diagnosi corrente / Root cause:
Causa osservata in uno storico pertinente; deve essere confermata sul caso corrente con log e telemetry.

  • Verifica immediatamente eventuali processi intensivi o comportamenti anomali.; avg(last_5m):100 * max:container.cpu.usage{cluster_name:acs-prd} by {container_name} / max:container.cpu.limit{cluster_name:acs-prd} by {container_name} > 90 The monitor was last triggered at Mon Dec 22 2025 10:15:00 UTC.

Dati necessari per conferma/chiusura:

  • Confermare workflow riproducibile, utenti/operazioni impattati, orario di inizio e ultimo esito corretto noto.
  • Registrare l'esito dei comandi, la correzione applicata e una prova funzionale positiva prima della chiusura.

Nessun dato disponibile

Azioni

Esporta su Atom PDF