Progetto

Generale

Profilo

Azioni

Segnalazione #373

aperta

PRISM WARNING: Backup Commvault Filesystem fallito su ada-col-postgres-c03 (Job 10903665, errore [19:599])

Aggiunto da Marco Menichelli 6 giorni fa.

Stato:
Nuovo
Priorità:
Normale
Assegnato a:
-
Inizio:
24-07-2026
Scadenza:
% Completato:

0%

Tempo stimato:

Descrizione

Problema ed evidenze operative:

  • ADARTE Backup Job Failed Alert: Backup job failed Type: Job Management - Data Protection: Job ID: 10903665; stato: Failed; client: ada-col-postgres-c03; agent: Linux File System; livello: Incremental; CommCell: psnbckcmsdcrz; errore: [19:599]; failure reason: Loss of control process ifind.exe. Possible causes: 1. The control process has unexpectedly died. Check system resource utilizatio [...contenuto ridotto per evitare inferenza lenta...] gres-c03 may have rebooted. 5. Antivirus/Malware software may be blocking the process. Please ensure that all exclusions are in pl
  • ADARTE Backup Job Failed Alert: Backup job failed Type: Job Management - Data Protection: Job ID: 10903663; stato: Failed; client: ada-col-postgres-c01; agent: Linux File System; livello: Incremental; CommCell: psnbckcmsdcrz; errore: [19:599]; failure reason: Loss of control process ifind.exe. Possible causes: 1. The control process has unexpectedly died. Check system resource utilizatio [...contenuto ridotto per evitare inferenza lenta...] gres-c01 may have rebooted. 5. Antivirus/Malware software may be blocking the process. Please ensure that all exclusions are in pl

Soluzione / Procedura Operativa Prioritaria:
Fonte della procedura: diagnosi conservativa costruita sull'evidenza primaria disponibile.

  • Aprire il dettaglio del 10903665 in Commvault e verificare log, Event Viewer e fase esatta del fallimento.
  • Verificare sul client ada-col-postgres-c03 se il processo di controllo e morto per crash, reboot/failover, saturazione risorse o blocco antivirus.
  • Controllare connettivita client-CommCell-MediaAgent nel timeframe dell'errore e rilanciare l'incrementale solo dopo stabilizzazione.

Step di Diagnosi ed Esecuzione:

  • Aprire in Commvault il dettaglio del 10903665 e verificare fase, stream, subclient, MediaAgent e log dell'agent sul client ada-col-postgres-c03.
  • Sul client ada-col-postgres-c03 verificare servizi dell'agent, raggiungibilita verso CommCell/MediaAgent, risorse e eventuale failover/reboot nel timeframe dell'alert.
  • Validare lato PostgreSQL il ruolo del nodo con pg_is_in_recovery(), stato replica e porta 5432 prima di rilanciare il backup.
  • Usare la query Datadog riportata sotto per aprire log/APM nello stesso timeframe e verificare se esistono errori sul servizio coinvolto.

Dati Datadog / Telemetry:

  • finestra analizzata: ultimi 180 minuti
  • chiavi evento usate per la ricerca: 10903665, 10903664, 10903663, ada-col-postgres-c03, ada-col-postgres-c02, ada-col-postgres-c01, psnbckcmsdcrz, 19:599
  • topologia: No Datadog hosts matched target: 10903665,10903664,10903663,ada-col-postgres-c03
  • logs: nessun evento trovato. Query: "10903665" OR "10903664" OR "10903663" OR "ada-col-postgres-c03" OR "ada-col-postgres-c02" OR "ada-col-postgres-c01" OR "psnbckcmsdcrz" OR "19:599"

Diagnosi corrente / Root cause:
Causa non ancora dimostrata; le ipotesi sotto sono ordinate e richiedono verifica tecnica.

  • Backup Commvault fallito con evidenza operativa dall'alert (failure reason: Loss of control process ifind.exe. Possible causes: 1. The control process has unexpectedly died. Check system resource utilization, crash dump or core file. 2. The communication to the control process machine ada-col-postgres-c03 might have gone down due to network errors. 3. If the machine ada-col-postgres-c03 is a cluster, it may have failed over. 4. The machine ada-col-postgres-c03 may have rebooted. 5. Antivirus/Malware software may be blocking the process. Please ensure that all exclusions are in pl; codice errore: [19:599]; client: ada-col-postgres-c03). La causa va confermata su log job, client e MediaAgent.

Dati necessari per conferma/chiusura:

  • Confermare workflow riproducibile, utenti/operazioni impattati, orario di inizio e ultimo esito corretto noto.
  • Acquisire log/APM e metriche del servizio nel timeframe esatto, includendo trace_id, correlation_id o request_id quando disponibili.
  • Registrare l'esito dei comandi, la correzione applicata e una prova funzionale positiva prima della chiusura.

Nessun dato disponibile

Azioni

Esporta su Atom PDF