Progetto

Generale

Profilo

Azioni

Segnalazione #365

aperta

PRISM WARNING: Ciao Rossana, Riguardo il BitDefender di ACS, USERSEC mi segnala che le seguenti macchine: pcd-

Aggiunto da Marco Menichelli 14 giorni fa.

Stato:
Nuovo
Priorità:
Normale
Assegnato a:
-
Inizio:
17-07-2026
Scadenza:
% Completato:

0%

Tempo stimato:

Descrizione

Problema ed evidenze operative:

  • Teams message. Ciao Rossana, Riguardo il BitDefender di ACS, USERSEC mi segnala che le seguenti macchine: pcd-it-k8ns-m02 (10.11.0.12) pcd-it-k8ns-m03 (10.11.0.13 ) hanno un agent troppo vecchio, il che è coerente con le analisi contenute nelle Service Review in cui vengono segnalate come outdated d [...contenuto ridotto per evitare inferenza lenta...] ps a gestirle o poterci dire se sono state dismesse? USERSEC segnala inoltre l’avvicinamento al limite di licenze che, come discusso per le vie brevi, potrebbe diventare un problema nel caso il cliente volesse espandere il numero di server coperti. Propongo di utilizzare questo thread per discuterne

Soluzione / Procedura Operativa Prioritaria:
Fonte della procedura: diagnosi conservativa costruita sull'evidenza primaria disponibile.

  • Sul namespace del servizio eseguire kubectl get pods -o wide, kubectl describe pod e kubectl logs --previous; verificare eventi, probe, restart, OOMKilled e rollout prima di restart o rollback.
  • Sul namespace del servizio eseguire kubectl get pods -o wide, kubectl describe pod e kubectl logs --previous per isolare restart, eventi, readiness/liveness e causa del crash.
  • Verificare deployment, replica set e rollout con kubectl rollout status/history deployment/ e correlare CPU/RAM, OOMKilled, ImagePullBackOff o probe failure nel timeframe Datadog.
  • Applicare restart/rollback solo dopo aver distinto bug applicativo, saturazione risorse, problema immagine o dipendenza esterna non raggiungibile.

Step di Diagnosi ed Esecuzione:

  • Usare la query Datadog riportata sotto per aprire log/APM nello stesso timeframe e verificare se esistono errori sul servizio coinvolto.
  • Su Kubernetes verificare kubectl get pods, kubectl describe pod e kubectl logs del deployment collegato al servizio prima di effettuare restart.

Dati Datadog / Telemetry:

  • finestra analizzata: ultimi 180 minuti
  • chiavi evento usate per la ricerca: pcd-it-k8ns-m02, pcd-it-k8ns-m03
  • topologia: No Datadog hosts matched target: pcd-it-k8ns-m02,pcd-it-k8ns-m03
  • logs: nessun evento trovato. Query: "pcd-it-k8ns-m02" OR "pcd-it-k8ns-m03"

Diagnosi corrente / Root cause:
Causa non ancora dimostrata; le ipotesi sotto sono ordinate e richiedono verifica tecnica.

  • Spiegami l'architettura, i trucchi del mestiere e fammi un esempio pratico di troubleshooting.
  • Best Practices e Trick: - Configurazione delle risorse: Assicurati che etcd abbia risorse sufficienti (CPU, memoria e spazio su disco) per gestire il carico del tuo cluster.

Dati necessari per conferma/chiusura:

  • Confermare workflow riproducibile, utenti/operazioni impattati, orario di inizio e ultimo esito corretto noto.
  • Acquisire log/APM e metriche del servizio nel timeframe esatto, includendo trace_id, correlation_id o request_id quando disponibili.
  • Registrare l'esito dei comandi, la correzione applicata e una prova funzionale positiva prima della chiusura.

Nessun dato disponibile

Azioni

Esporta su Atom PDF