Azioni
Segnalazione #373
apertaPRISM WARNING: Backup Commvault Filesystem fallito su ada-col-postgres-c03 (Job 10903665, errore [19:599])
Stato:
Nuovo
Priorità:
Normale
Assegnato a:
-
Inizio:
24-07-2026
Scadenza:
% Completato:
0%
Tempo stimato:
Descrizione
Problema ed evidenze operative:
- ADARTE Backup Job Failed Alert: Backup job failed Type: Job Management - Data Protection: Job ID: 10903665; stato: Failed; client: ada-col-postgres-c03; agent: Linux File System; livello: Incremental; CommCell: psnbckcmsdcrz; errore: [19:599]; failure reason: Loss of control process ifind.exe. Possible causes: 1. The control process has unexpectedly died. Check system resource utilizatio [...contenuto ridotto per evitare inferenza lenta...] gres-c03 may have rebooted. 5. Antivirus/Malware software may be blocking the process. Please ensure that all exclusions are in pl
- ADARTE Backup Job Failed Alert: Backup job failed Type: Job Management - Data Protection: Job ID: 10903663; stato: Failed; client: ada-col-postgres-c01; agent: Linux File System; livello: Incremental; CommCell: psnbckcmsdcrz; errore: [19:599]; failure reason: Loss of control process ifind.exe. Possible causes: 1. The control process has unexpectedly died. Check system resource utilizatio [...contenuto ridotto per evitare inferenza lenta...] gres-c01 may have rebooted. 5. Antivirus/Malware software may be blocking the process. Please ensure that all exclusions are in pl
Soluzione / Procedura Operativa Prioritaria:
Fonte della procedura: diagnosi conservativa costruita sull'evidenza primaria disponibile.
- Aprire il dettaglio del 10903665 in Commvault e verificare log, Event Viewer e fase esatta del fallimento.
- Verificare sul client ada-col-postgres-c03 se il processo di controllo e morto per crash, reboot/failover, saturazione risorse o blocco antivirus.
- Controllare connettivita client-CommCell-MediaAgent nel timeframe dell'errore e rilanciare l'incrementale solo dopo stabilizzazione.
Step di Diagnosi ed Esecuzione:
- Aprire in Commvault il dettaglio del 10903665 e verificare fase, stream, subclient, MediaAgent e log dell'agent sul client ada-col-postgres-c03.
- Sul client ada-col-postgres-c03 verificare servizi dell'agent, raggiungibilita verso CommCell/MediaAgent, risorse e eventuale failover/reboot nel timeframe dell'alert.
- Validare lato PostgreSQL il ruolo del nodo con pg_is_in_recovery(), stato replica e porta 5432 prima di rilanciare il backup.
- Usare la query Datadog riportata sotto per aprire log/APM nello stesso timeframe e verificare se esistono errori sul servizio coinvolto.
Dati Datadog / Telemetry:
- finestra analizzata: ultimi 180 minuti
- chiavi evento usate per la ricerca: 10903665, 10903664, 10903663, ada-col-postgres-c03, ada-col-postgres-c02, ada-col-postgres-c01, psnbckcmsdcrz, 19:599
- topologia: No Datadog hosts matched target: 10903665,10903664,10903663,ada-col-postgres-c03
- logs: nessun evento trovato. Query: "10903665" OR "10903664" OR "10903663" OR "ada-col-postgres-c03" OR "ada-col-postgres-c02" OR "ada-col-postgres-c01" OR "psnbckcmsdcrz" OR "19:599"
Diagnosi corrente / Root cause:
Causa non ancora dimostrata; le ipotesi sotto sono ordinate e richiedono verifica tecnica.
- Backup Commvault fallito con evidenza operativa dall'alert (failure reason: Loss of control process ifind.exe. Possible causes: 1. The control process has unexpectedly died. Check system resource utilization, crash dump or core file. 2. The communication to the control process machine ada-col-postgres-c03 might have gone down due to network errors. 3. If the machine ada-col-postgres-c03 is a cluster, it may have failed over. 4. The machine ada-col-postgres-c03 may have rebooted. 5. Antivirus/Malware software may be blocking the process. Please ensure that all exclusions are in pl; codice errore: [19:599]; client: ada-col-postgres-c03). La causa va confermata su log job, client e MediaAgent.
Dati necessari per conferma/chiusura:
- Confermare workflow riproducibile, utenti/operazioni impattati, orario di inizio e ultimo esito corretto noto.
- Acquisire log/APM e metriche del servizio nel timeframe esatto, includendo trace_id, correlation_id o request_id quando disponibili.
- Registrare l'esito dei comandi, la correzione applicata e una prova funzionale positiva prima della chiusura.
Nessun dato disponibile
Azioni