Progetto

Generale

Profilo

Azioni

Segnalazione #352

aperta

PRISM WARNING: corregetemi se sbaglio ma vedo solamente quelli che scattando di datadog che sono : [P3] [Recov

Aggiunto da Marco Menichelli 16 giorni fa.

Stato:
Nuovo
Priorità:
Normale
Assegnato a:
-
Inizio:
15-07-2026
Scadenza:
% Completato:

0%

Tempo stimato:

Descrizione

Problema ed evidenze operative:

  • Teams message. corregetemi se sbaglio ma vedo solamente quelli che scattando di datadog che sono : [P3] [Recovered on {container_name:mongodb-exporter}] ACS PROD - CPU occupata Pod Kubernetes [Recovered on {host:pcd-pd-k8ns-m02-acs-prd,service:hardened-etcd}] Test Logs ACS

Soluzione / Procedura Operativa Prioritaria:
Fonte della procedura: precedente storico RAG pertinente all'evidenza primaria.

  • Verificare immediatamente lo stato dei pod, le risorse del cluster e la configurazione del deployment.; avg(last_5m):avg:kubernetes_state.deployment.replicas_available{kube_cluster_name:acs-prd} by {kube_deployment} / avg:kubernetes_state.deployment.replicas_desired{kube_cluster_name:acs-prd} by {kube_deployment} < 0.5 The monitor was last triggered at Mon Dec 22 2025 10:16:49 UTC.
  • Sul namespace del servizio eseguire kubectl get pods -o wide, kubectl describe pod e kubectl logs --previous; verificare eventi, probe, restart, OOMKilled e rollout prima di restart o rollback.
  • Best Practices e Trick: - Replica e Ridondanza: Configurare etcd con un numero dispari di membri per evitare split-brain e garantire la disponibilità.

Step di Diagnosi ed Esecuzione:

  • Usare la query Datadog riportata sotto per aprire log/APM nello stesso timeframe e verificare se esistono errori sul servizio coinvolto.
  • Su Kubernetes verificare kubectl get pods, kubectl describe pod e kubectl logs del deployment collegato al servizio prima di effettuare restart.

Dati Datadog / Telemetry:

  • finestra analizzata: ultimi 180 minuti
  • chiavi evento usate per la ricerca: corregetemi, sbaglio, solamente, quelli, scattando, datadog, Recovered, container_name
  • topologia: No Datadog hosts matched target: corregetemi,sbaglio,solamente,quelli
  • logs: 5 campioni pertinenti trovati. Query: "corregetemi" OR "sbaglio" OR "solamente" OR "quelli" OR "scattando" OR "datadog" OR "Recovered" OR "container_name"
  • 2026-07-15T09:52:24.367Z service=adarte-ticketing-accounting-notification status=info: 09:52:24.328 [org.springframework.kafka.KafkaListenerEndpointContainer#3-0-C-1] INFO o.s.k.l.KafkaMessageListenerContainer - Record in retry and not yet recovered
  • 2026-07-15T09:52:24.367Z service=adarte-ticketing-accounting-notification status=info: 09:52:23.971 [org.springframework.kafka.KafkaListenerEndpointContainer#5-0-C-1] INFO o.s.k.l.KafkaMessageListenerContainer - Record in retry and not yet recovered
  • 2026-07-15T09:52:24.367Z service=adarte-ticketing-accounting-notification status=info: 09:52:23.410 [org.springframework.kafka.KafkaListenerEndpointContainer#4-0-C-1] INFO o.s.k.l.KafkaMessageListenerContainer - Record in retry and not yet recovered
  • 2026-07-15T09:52:23.682Z service=core status=info: L'obiettivo è ottenere in output un testo concentrato solamente sui concetti fondamentali dell'input e non troppo ricco di informazioni.

Diagnosi corrente / Root cause:
Causa osservata in uno storico pertinente; deve essere confermata sul caso corrente con log e telemetry.

  • Verifica immediatamente eventuali processi intensivi o comportamenti anomali.; avg(last_5m):100 * max:container.cpu.usage{cluster_name:acs-prd} by {container_name} / max:container.cpu.limit{cluster_name:acs-prd} by {container_name} > 90 The monitor was last triggered at Mon Dec 22 2025 10:15:00 UTC.

Dati necessari per conferma/chiusura:

  • Confermare workflow riproducibile, utenti/operazioni impattati, orario di inizio e ultimo esito corretto noto.
  • Registrare l'esito dei comandi, la correzione applicata e una prova funzionale positiva prima della chiusura.

Nessun dato disponibile

Azioni

Esporta su Atom PDF