Azioni
Segnalazione #352
apertaPRISM WARNING: corregetemi se sbaglio ma vedo solamente quelli che scattando di datadog che sono : [P3] [Recov
Stato:
Nuovo
Priorità:
Normale
Assegnato a:
-
Inizio:
15-07-2026
Scadenza:
% Completato:
0%
Tempo stimato:
Descrizione
Problema ed evidenze operative:
- Teams message. corregetemi se sbaglio ma vedo solamente quelli che scattando di datadog che sono : [P3] [Recovered on {container_name:mongodb-exporter}] ACS PROD - CPU occupata Pod Kubernetes [Recovered on {host:pcd-pd-k8ns-m02-acs-prd,service:hardened-etcd}] Test Logs ACS
Soluzione / Procedura Operativa Prioritaria:
Fonte della procedura: precedente storico RAG pertinente all'evidenza primaria.
- Verificare immediatamente lo stato dei pod, le risorse del cluster e la configurazione del deployment.; avg(last_5m):avg:kubernetes_state.deployment.replicas_available{kube_cluster_name:acs-prd} by {kube_deployment} / avg:kubernetes_state.deployment.replicas_desired{kube_cluster_name:acs-prd} by {kube_deployment} < 0.5 The monitor was last triggered at Mon Dec 22 2025 10:16:49 UTC.
- Sul namespace del servizio eseguire kubectl get pods -o wide, kubectl describe pod e kubectl logs --previous; verificare eventi, probe, restart, OOMKilled e rollout prima di restart o rollback.
- Best Practices e Trick: - Replica e Ridondanza: Configurare etcd con un numero dispari di membri per evitare split-brain e garantire la disponibilità.
Step di Diagnosi ed Esecuzione:
- Usare la query Datadog riportata sotto per aprire log/APM nello stesso timeframe e verificare se esistono errori sul servizio coinvolto.
- Su Kubernetes verificare kubectl get pods, kubectl describe pod e kubectl logs del deployment collegato al servizio prima di effettuare restart.
Dati Datadog / Telemetry:
- finestra analizzata: ultimi 180 minuti
- chiavi evento usate per la ricerca: corregetemi, sbaglio, solamente, quelli, scattando, datadog, Recovered, container_name
- topologia: No Datadog hosts matched target: corregetemi,sbaglio,solamente,quelli
- logs: 5 campioni pertinenti trovati. Query: "corregetemi" OR "sbaglio" OR "solamente" OR "quelli" OR "scattando" OR "datadog" OR "Recovered" OR "container_name"
- 2026-07-15T09:52:24.367Z service=adarte-ticketing-accounting-notification status=info: 09:52:24.328 [org.springframework.kafka.KafkaListenerEndpointContainer#3-0-C-1] INFO o.s.k.l.KafkaMessageListenerContainer - Record in retry and not yet recovered
- 2026-07-15T09:52:24.367Z service=adarte-ticketing-accounting-notification status=info: 09:52:23.971 [org.springframework.kafka.KafkaListenerEndpointContainer#5-0-C-1] INFO o.s.k.l.KafkaMessageListenerContainer - Record in retry and not yet recovered
- 2026-07-15T09:52:24.367Z service=adarte-ticketing-accounting-notification status=info: 09:52:23.410 [org.springframework.kafka.KafkaListenerEndpointContainer#4-0-C-1] INFO o.s.k.l.KafkaMessageListenerContainer - Record in retry and not yet recovered
- 2026-07-15T09:52:23.682Z service=core status=info: L'obiettivo è ottenere in output un testo concentrato solamente sui concetti fondamentali dell'input e non troppo ricco di informazioni.
Diagnosi corrente / Root cause:
Causa osservata in uno storico pertinente; deve essere confermata sul caso corrente con log e telemetry.
- Verifica immediatamente eventuali processi intensivi o comportamenti anomali.; avg(last_5m):100 * max:container.cpu.usage{cluster_name:acs-prd} by {container_name} / max:container.cpu.limit{cluster_name:acs-prd} by {container_name} > 90 The monitor was last triggered at Mon Dec 22 2025 10:15:00 UTC.
Dati necessari per conferma/chiusura:
- Confermare workflow riproducibile, utenti/operazioni impattati, orario di inizio e ultimo esito corretto noto.
- Registrare l'esito dei comandi, la correzione applicata e una prova funzionale positiva prima della chiusura.
Nessun dato disponibile
Azioni