Ripristino di emergenza con NAKIVO: pianificazione, implementazione e test

Il backup e il ripristino di emergenza sono alla base delle strategie di protezione dei dati in tutte le organizzazioni e in tutti i settori. Ripristino di emergenza è il processo di ripristino delle VM e dei servizi in esecuzione su di esse presso un sito secondario (noto come sito di ripristino di emergenza) quando il sito di produzione risulta indisponibile. Questi siti, che ospitano server, computer e apparecchiature di rete ridondanti dotati del software necessario, I siti di DR secondari possono essere di diversi tipi a seconda del livello di ridondanza.

NAKIVO Backup & Replication include la funzionalità di ripristino dell’ambiente che consente di creare sequenze di ripristino avanzate (con failover completo del sito) che possono essere avviate con un solo clic quando il sito primario smette di funzionare. Leggi questo post sul blog per scoprire i componenti chiave della strategia di ripristino di emergenza, come la pianificazione del ripristino di emergenza IT, i test e l’esecuzione del ripristino di emergenza con la soluzione integrata di NAKIVO.

Garantisci la disponibilità con NAKIVO

Garantisci la disponibilità con NAKIVO

Soddisfare i rigorosi requisiti di disponibilità dei servizi nelle infrastrutture virtuali. Raggiungere gli obiettivi di uptime grazie a solide funzioni di orchestrazione e automazione del DR.

Fase 1. Pianificazione del ripristino di emergenza

Come fase essenziale per un efficace ripristino di emergenza, la pianificazione dovrebbe includere una valutazione delle esigenze di ripristino dell’organizzazione e lo sviluppo di una comprensione completa di quali componenti, fasi e procedure debbano essere incluse in un flusso di lavoro di ripristino di emergenza.

Pianificazione del ripristino di emergenza: procedure consigliate

1. Condurre un’analisi dell’impatto sul business

Un’analisi dell’impatto sul business ( analisi dell’impatto sulle attività aziendali (o BIA) ) viene utilizzata per determinare il potenziale impatto negativo di incidenti gravi o disastri naturali sulle operazioni aziendali. Questa analisi comporta l’assegnazione di un ordine di priorità alle diverse VM, la sequenza di ripristino e il tempo a disposizione prima che un’interruzione abbia un impatto significativo sulle operazioni aziendali. Ad esempio, il guasto di una VM potrebbe causare ritardi e disagi, mentre il guasto di un’altra VM può portare alla completa interruzione delle operazioni critiche per l’azienda.

2. Valutare i rischi coinvolti

Prima di pianificare il ripristino di emergenza (DR), raccogliere i dati rilevanti sui rischi per le operazioni e la continuità operativa della propria organizzazione. In alcune aree, un’interruzione di corrente prolungata o un attacco virale sono più probabili di un tornado, mentre in altre i disastri naturali sono un evento comune. Una valutazione dei rischi aiuta a determinare il livello appropriato di protezione contro determinate minacce e a definire misure per ridurre al minimo i rischi e mitigarne le conseguenze. Sebbene i rischi non possano essere eliminati completamente, sarete meglio preparati ad affrontare gli scenari di disastro che potreste dover affrontare.

3. Sviluppare la documentazione relativa al ripristino di emergenza

Una volta identificati i rischi e il loro potenziale impatto sulla vostra attività, avrete una comprensione più chiara di dove concentrare i vostri sforzi per pianificare i processi di ripristino di emergenza. Procedure di ripristino dei documenti, descrivendo in dettagliati tutti i passaggi fondamentali e le misure di ripristino di emergenza, e aggiornate regolarmente i documenti per riflettere i cambiamenti apportati nell’ambiente. La documentazione dovrebbe includere:

  • Disaster recovery scope. Valutate l’importanza di ciascun componente hardware e software della vostra infrastruttura e includete nel piano di ripristino di emergenza quelli relativi alle operazioni mission-critical. Le VM che ospitano informazioni critiche, sistemi IT e applicazioni il cui funzionamento è essenziale per garantire la continuità dei servizi dovrebbero rappresentare la vostra massima priorità in termini di ripristino.
  • VM recovery order. Alcune VM potrebbero dipendere dal software o dalle informazioni ospitate in un’altra VM, il che significa che non possono funzionare separatamente né essere avviate in modo casuale. È necessario specificare l’ordine di ripristino per ottimizzare il processo ed eliminare il rischio di conflitti tra i software nel sito di DR. Ad esempio, la VM che esegue il controller di dominio Active Directory deve essere attiva e funzionante prima di poter avviare una VM con un file server che utilizza l’autenticazione Active Directory.

Un altro esempio è rappresentato dai servizi web, che spesso si basano su software installato su diverse VM. Potrebbe essere necessario implementare la seguente sequenza:

  1. La VM con il server di database deve essere avviata per prima.
  2. Successivamente è possibile avviare la VM con il server delle applicazioni.
  3. Solo a quel punto è possibile avviare la VM con il server web.
  • RTO and RPO in disaster recovery. Impostare il come obiettivo di tempo di ripristino (RTO) e il come obiettivo di punto di ripristino (RPO) per le VM con priorità diverse nel piano di ripristino di emergenza. Ad esempio, le VM con sistemi finanziari potrebbero avere obiettivi di ripristino più brevi rispetto a quelle utilizzate per l’archiviazione dei documenti.
  • Dependencies. Nel determinare la catena di dipendenza tra il personale e i componenti IT, collaborate con il vostro personale e tenetene conto per evitare anelli deboli che possano portare al fallimento del ripristino. Ad esempio, una VM utilizzata dal reparto contabilità potrebbe dover essere ripristinata per prima se i lavoratori di altri reparti dipendono da quelle operazioni finanziarie per svolgere il proprio lavoro.
  • Staff. Assegnate ruoli e responsabilità ai membri del team che fanno parte dei processi di DR. Se dovranno lavorare presso il sito di DR, assicuratevi che vi siano workstations allestite con tutte le attrezzature, gli arredi da ufficio e l’hardware necessari, in modo che possano continuare il loro lavoro con interruzioni minime. Se i dipendenti possono lavorare da remoto durante un disastro, configurate l’accesso VPN e fornite in anticipo gli account VPN.
  • Hardware requirements. Il successo di un piano di ripristino di emergenza dipende in larga misura dalle prestazioni e dalle capacità dell’hardware situato presso il sito di DR. È necessario tenere conto di diversi fattori:
  • I server devono disporre di CPU, memoria e capacità su disco sufficienti a sostenere i carichi di lavoro trasferiti. Prestazioni ridotte della CPU e memoria insufficiente possono influire sulla velocità delle VM, mentre una velocità del disco insufficiente comporta prestazioni scadenti delle VM.
  • Le reti devono fornire una larghezza di banda sufficiente affinché le VM ripristinate possano interagire tra loro, con shared storage, e con gli utenti, se necessario.

Fase 2.

Preparazione al ripristino di emergenza Failover della VM
Una volta ottenuta la documentazione, è possibile procedere alla preparazione al ripristino di emergenza predisponendo il sito di ripristino e configurando la replica dei carichi di lavoro critici su tale sito. La replica è obbligatoria affinché

le VM replica entrino in funzione quando l’infrastruttura primaria smette di funzionare.

Che cos’è la replica delle VM?
La replica delle VM è il processo di creazione di una copia identica di una VM di origine (denominata “replica della VM”) su un host diverso (l’host di destinazione). La replica della macchina virtuale è una normale macchina virtuale che rimane spenta fino a quando non è necessaria (a quel punto può essere avviata e resa operativa sul proprio host quasi istantaneamente).

Scopri come creare e configurare un lavoro di replica VMware in NAKIVO Backup & Replication per maggiori dettagli.

Il processo di trasferimento dei carichi di lavoro da una macchina virtuale di origine (di produzione) a una replica della macchina virtuale presso il sito di DR, allo scopo di garantire la continuità operativa e l’alta disponibilità, è noto come failover.

Procedure consigliate per la replica delle VM una serie di procedure consigliate in materia di replica
Esistono

    per garantire una maggiore affidabilità ed efficacia del processo. Qui ci concentreremo su due punti chiave:

  • Perform VM replication at the {10}
  • . Il livello di virtualizzazione è lo strato intermedio tra l’hardware fisico e il sistema operativo guest in esecuzione su una VM. La replica eseguita a livello di virtualizzazione è denominata «a livello di host» ed è più efficiente rispetto alla replica a livello di guest.

  • Use application-aware replication to avoid data loss.
  • Se uno snapshot della VM necessario per la replica viene acquisito mentre queste applicazioni sono in esecuzione senza alcuna azione aggiuntiva, l’effetto sarebbe simile a un’interruzione di corrente e a uno spegnimento imprevisti e i dati potrebbero andare persi.

Con i metodi coerenti con le applicazioni, le applicazioni vengono congelate (messe in stato di quiescenza) e la memoria viene svuotata; i dati non possono essere scritti sul disco prima che venga acquisita una snapshot. Una volta acquisita la snapshot coerente, è possibile creare una replica della VM. Tali repliche di VM possono essere ripristinate con successo con le applicazioni al loro interno funzionanti correttamente.
Fase 3. Creazione di un flusso di lavoro di ripristino di emergenza

Per creare un flusso di lavoro di ripristino di emergenza, è necessaria una soluzione specializzata di ripristino di emergenza come NAKIVO Backup & Replication, che fornisce una funzionalità integrata di Site Recovery per orchestrare e automatizzare le sequenze di ripristino di emergenza.

  1. Azioni
  2. Reti
  3. Ridefinisci IP
  4. Pianificazione dei test
  5. di ripristino

Che cos’è un flusso di lavoro di ripristino di emergenza?

Un flusso di lavoro di ripristino di emergenza è una sequenza di azioni eseguite nell’ambito del processo di ripristino di emergenza per il failover sicuro e rapido dei carichi di lavoro verso le repliche. Il flusso di lavoro organizza il processo di failover con azioni relative alle VM di origine, alle VM di destinazione, alle condizioni da soddisfare, ecc. È necessario definire l’ordine in cui le azioni devono essere eseguite, poiché alcune procedure di ripristino di emergenza potrebbero dipendere dal risultato dell’esecuzione di altre.

Azioni disponibili di Site Recovery

La funzionalità di ripristino dell’ambiente consente di creare sequenze complesse di DR combinando azioni e condizioni in un unico flusso di lavoro. In NAKIVO Backup & Replication, ogni azione può essere eseguita solo in modalità di test, solo in modalità di produzione o in entrambe le modalità (impostazione predefinita).

È possibile includere una o tutte le seguenti azioni in una sequenza:

  • Failover – avvia il failover verso repliche di VM VMware, Hyper-V o istanze di EC2.
  • Failback – restituisce i carichi di lavoro dalla replica della VM alla VM di origine. Le modifiche apportate nella replica della VM a partire dal momento del failover vengono scritte nella VM di origine quando viene eseguita l’operazione di failback. Le VM vengono sincronizzate e la VM di origine torna allo stato di produzione effettivo.
  • Start – avvia VM VMware, VM Hyper-V o istanze di EC2.
  • Stop – arresta VM VMware, VM Hyper-V e istanze di EC2 in esecuzione.
  • Run job – esegue un processo di backup, di replica, di ripristino del sito, di copia di backup o di avvio flash delle VM.
  • Stop jobs – arresta un processo (uno qualsiasi tra quelli elencati nel punto precedente).
  • Run script – esegue uno script su una delle seguenti destinazioni: il server con Director, un Server Windows remoto, un Server Linux remoto, una VM VMware, una VM Hyper-V o un’istanza di EC2.
  • Attach repository – associa un repository di backup utilizzato da NAKIVO Backup & Replication per archiviare i backup.
  • Detach repository – scollega un repository di backup.
  • Send email – invia un’e-mail con il messaggio da voi composto a uno o più destinatari definiti.
  • Wait – attende il periodo di tempo specificato prima di procedere all’azione successiva.
  • Check condition – in base a quanto inserito (il nome completo o parziale di una risorsa), verifica una delle seguenti condizioni:
  • La risorsa esiste
  • La risorsa è
  • L’IP/nome host è raggiungibile

Come creare un flusso di lavoro di ripristino dell’ambiente

Vediamo un esempio di come creare un lavoro di ripristino dell’ambiente in NAKIVO Backup & Replication.

La nostra configurazione

Ecco la configurazione che prenderemo in esame: un sito primario (di produzione) con macchine virtuali VMware vSphere e un sito di ripristino in una ubicazione remota:

  • DC-VM È una macchina virtuale basata su Windows che esegue un controller di dominio Active Directory.
  • FS-VM è una macchina virtuale basata su Windows con un file server in esecuzione (per la condivisione dei file viene utilizzato il protocollo SMB). Per l’autenticazione degli utenti viene utilizzato Active Directory. I dump del database Oracle sono archiviati sul file server.
  • Ora-DB è la macchina virtuale su cui è in esecuzione il database Oracle.

VMs at this production site are running, while the VMs and ESXi host at the DR site remain powered off

Il sito di ripristino di emergenza contiene le seguenti VM:

  • DC-VM-replica e FS-VM-replica sono repliche delle VM di produzione. Possono essere utilizzate come destinazioni per il failover.
  • DB-VM è una VM basata su Linux con Software Oracle Database installato ma non contiene database.

Il database viene sottoposto a backup con NAKIVO Backup & Replication a livello di database su FS-VM nel sito di produzione (questo Backup del database Oracle Database è coerente a livello di applicazione). FS-VM e DC-VM vengono replicati a livello di host verso il sito di DR con la soluzione NAKIVO.

Ordine di ripristino delle VM

Durante un incidente che causa il blocco del sito di produzione, i componenti devono essere ripristinati nel sito di DR come segue:

  1. Failover di DC-VM verso DC-VM-replica.

Disaster recovery failover to the first VM replica is performed at the DR site

  1. Una volta che la replica della VM DC è attiva, eseguire il failover della VM FS verso la replica della VM FS . È necessario operare in questo ordine perché la VM FS si affida alla VM DC per l’autenticazione degli utenti sul file server.
  2. Una volta che queste due VM sono in esecuzione, la VM DB può accedere alla directory condivisa sul file server in cui è memorizzato il dump. Ora è possibile avviare la VM DB .

Disaster recovery failover to the second VM replica, which is dependent on the first VM replica, is performed after the first VM replica has started

  1. Una volta che DB-VM è in esecuzione, eseguire uno script in grado di ripristinare il database dal dump presente sul file server. Le frecce blu nei diagrammi sopra riportati indicano le dipendenze.

Si noti che potrebbe essere necessario un po’ di tempo affinché i servizi si avviino su una replica VM accesa dopo l’azione di failover e prima di eseguire il failover sulla replica successiva o di ripristinare un’applicazione o un database. Questo tempo di attesa dovrebbe far parte della sequenza di DR.

Per questo ordine di failover delle VM, è necessario creare un lavoro di ripristino dell’ambiente in NAKIVO Backup & Replication con la seguente logica:

  • Action 1: Failover della VM del DC . Attendi il completamento di questa azione prima di procedere al passaggio successivo. Interrompere il processo se questa azione fallisce.
  • Action 2. Attendere per 3 minuti.
  • Action 3. Verificare la condizione della replica della VM del DC . Verificare se la risorsa è in esecuzione. Se la risorsa è in esecuzione, procedere all’azione successiva nel processo di Site Recovery. In caso contrario, interrompere e dichiarare fallito il processo.
  • Action 4. Eseguire il failover della VM del file system . Attendere il completamento di questa azione prima di procedere all’azione successiva. Interrompere il processo se questa azione fallisce.
  • Action 5. Attendere per 3 minuti.
  • Action 6. Verificare lo stato di FS-VM-replica . Se la risorsa è in esecuzione, procedere all’azione successiva del processo di Site Recovery. In caso contrario, interrompere e contrassegnare come fallito il processo.
  • Action 7. Avviare DB-VM . Attendere il completamento di questa azione prima di procedere all’azione successiva. Interrompere il processo se questa azione fallisce.
  • Action 8. Attendere per 5 minuti.
  • Action 9. Esegui lo script . Tipo di destinazione: VM VMware. VM di destinazione: DB-VM. Percorso dello script: /home/oracle/restore_db.sh (quando si aggiunge questo passaggio, è necessario inserire il nome utente e la password di un account con autorizzazioni sufficienti per eseguire lo script).

Guida passo passo al ripristino dell’ambiente di NAKIVO

Creiamo un nuovo lavoro di ripristino dell’ambiente basato sul piano descritto sopra. Nella pagina Jobs della vostra istanza NAKIVO Backup & Replication, fate clic su Create > Site recovery job.

Backup and disaster recovery - creating a new Site Recovery job

1. Azioni

Viene avviata la Procedura guidata Nuovo lavoro di ripristino dell’ambiente . Nel pannello di sinistra sono elencate le azioni che è possibile aggiungere al lavoro. È sufficiente fare clic su un’azione per aggiungerla alla sequenza. Si noti che non è possibile combinare azioni per piattaforme diverse in un’unica sequenza (stiamo creando un lavoro per macchine virtuali VMware).

Azione 1. Failover della VM DC

  1. Nel riquadro di sinistra, fare clic su Failover VMware VMs.

Adding Failover VMware VMs action

  1. Nel riquadro di sinistra, selezionare la replica della VM da un’attività di replica esistente. Nel nostro flusso di lavoro, il failover verso DC-VM-replica è la prima azione. Nel riquadro di destra è possibile selezionare un punto di ripristino. Per impostazione predefinita viene utilizzato il punto di ripristino più recente.

Fare clic su Next per continuare. Choosing the VM for a disaster recovery failover action in the framework of site recovery

  1. Power off source VMs
  • XML-PH-0005@deepl.internal – Esegui questa azione in: Comportamento dell’attesa: Gestione degli errori: Fare clic su per salvare l’azione creata. Azione 2. Attendere 3 minuti Un’azione di attesa è utile in questo caso perché la successiva azione di failover nel flusso di lavoro (failover a FS-VM-replica ) richiederebbe che la DC-VM-replica fosse attiva e già in esecuzione con i servizi di dominio di Active Directory. Nel riquadro sinistro della schermata Azioni , fare clic su . Selezionare il Tempo di attesa (in questo caso utilizziamo 3 minuti ). Selezionare le opzioni di azione come fatto per la prima azione e fare clic su . La nuova azione viene aggiunta dopo quella precedente, in fondo all’elenco. È possibile riordinare, modificare o rimuovere le azioni. È sufficiente passare il mouse su un’azione per visualizzare le opzioni. Azione 3. Verifica dello stato di DC-VM-replica Nel riquadro sinistro della schermata Azioni , fare clic su per verificare se la VM sottoposta a failover nella prima azione è in esecuzione. Configurare questa azione come segue: Selezionare il tipo di condizione: . Le altre opzioni sono la risorsa esiste oppure l’IP/nome host è raggiungibile. Selezionare il tipo di risorsa: . Selezionare il metodo di identificazione: (l’altra opzione è ID ) per identificare la VM in questione. È possibile utilizzare qualsiasi parte della stringa della VM. In questo caso, conosciamo il nome esatto, quindi utilizziamo la funzione . Definire la stringa di ricerca: . Ora disponiamo di un’azione che verifica se la VM VMware denominata DC-VM-replica è in esecuzione. Fare clic su per procedere. Azione 4. Failover di FS-VM Come per Azione 1 , fare clic su . In questo caso selezioniamo FS-VM-replica . Fare clic su , quindi selezionare per l’azione di failover le stesse opzioni utilizzate in Azione 1 e fare clic su . Azione 5. Run this action in both testing and production mode
  • Wait for this action to complete
  • Stop and fail the job if this action fails

Save
Options for the VM disaster recovery failover action

  1. Wait

Adding a “Wait” action

Save
Configuring the “Wait” action

  1. Check condition

Adding the “Check condition” action to the disaster recovery process

  • Resource is running
  • VMware VM
  • Name Equals
  • DC-VM-replica

Save
Configuring the “Check condition” action for a disaster recovery process

  1. Failover VMware VMs

Adding another “Failover VMware VMs” action for a disaster recovery process

  1. Next Save

Adding the VM replica for the disaster recovery failover action

Attendere 3 minuti

Fare clic su Wait e configurare questa azione come fatto per azione 2 . Il tempo specificato è nuovamente 3 minuti nel nostro caso.

Azione 6. Verificare lo stato di FS-VM-replica

Fare clic su Check condition per verificare se la macchina virtuale VMware FS-VM-replica è in esecuzione. Fare riferimento all’azione 2 e selezionare le stesse opzioni – tranne, ovviamente, il nome della macchina virtuale.

Azione 7. Avvia DB-VM

  1. Fare clic su Start VMware VMs nel riquadro sinistro della schermata Azioni .

The current list of actions (disaster recovery procedures) for a Site Recovery job

  1. Selezionare DB-VM . Questa VM può essere avviata una volta che si è certi che la FS-VM-replica sia in esecuzione. Nella parte inferiore della pagina, selezionare le stesse opzioni di azione mostrate nelle azioni precedenti. Quindi fare clic su Save.

Selecting the VM for a Start VM action

Azione 8. Attendere 5 minuti

Attendere 5 minuti. Fare clic su Wait e configurare questa azione in modo simile a quanto fatto per l’azione 2 su . Questo dovrebbe essere un tempo sufficiente per avviare il servizio Oracle sulla DB-VM .

Azione 9. Eseguire lo script

  1. Nella schermata Azioni fare clic su Run script. Si ricordi che questo script ha lo scopo di ripristinare il database Oracle a livello di database da un dump memorizzato su FS-VM-replica .

Adding the Run script action

  1. Definire le opzioni dello script. Nel nostro caso:
  • Tipo di destinazione: VM VMware
  • VM di destinazione: DB-VM
  • Percorso dello script: /home/oracle/restore.db.sh
  • Nome utente: oracle
  • Password: (password)

Il percorso dello script, il nome utente e la password saranno diversi. Non dimenticare di assicurarti che il file dello script sia eseguibile e che l’utente disponga dei permessi sufficienti per eseguire lo script. In questo esempio, le opzioni di azione sono configurate come di consueto.

Fai clic su Save quando sei pronto a continuare.

Configuring the Run script action

  1. Ora puoi visualizzare tutte le azioni configurate. Fare clic sul pulsante Next per continuare la configurazione del processo di Site Recovery in base al proprio piano di ripristino di emergenza.

Finalizing configuration of the actions (disaster recovery procedures) for a Site Recovery job workflow

2. Reti

Se le macchine virtuali nel sito di produzione e nel sito di ripristino di emergenza sono collegati a reti diverse, selezionare Enable network mapping. Fare clic su Create new mapping, nelle finestre a comparsa selezionare una rete di origine, una rete di destinazione e una rete da utilizzare per il test del processo di Site Recovery.
Fare clic su Save per salvare la regola di mappatura di rete, quindi fare clic su Next.

Nota : È inoltre possibile utilizzare le regole di mappatura esistenti se sono state configurate in altri processi di replica, failover o Site Recovery.

Configuring network mapping for a site recovery job

3. Ridefinizione IP

Se le reti utilizzate per la connessione delle macchine virtuali nel sito di origine e nel sito di destinazione hanno indirizzi diversi, è necessario abilitare la ridefinizione IP selezionando Enable Re-IP.

  1. Creare una nuova regola di ridefinizione IP facendo clic su Create new rule. Definire le impostazioni di origine e di destinazione, quindi fare clic su Save.

Creating a new Re-IP rule

  1. Fare clic su Select VMs e selezionare le VM per le quali si desidera utilizzare Re-IP. È necessario fornire le credenziali di un utente con autorizzazioni sufficienti per modificare le impostazioni di rete nel sistema operativo guest della macchina virtuale.

Setting credentials for a Re-IP rule

4. Pianificazione dei test

È possibile creare una pianificazione specificamente destinata all’esecuzione di processi di Site Recovery in modalità di test e all’esecuzione di test di ripristino di emergenza. Ciò consente di verificare se il processo può essere eseguito con successo entro i tempi richiesti. Al termine, fare clic su Avanti.
Parleremo più dettagliatamente dei test dei processi di Site Recovery nel passaggio 6.

Configuring schedule options for disaster recovery testing with Site Recovery

5. Opzioni

Digitare il nome del lavoro e l’obiettivo di tempo di ripristino (RTO). Fare clic su Finish una volta completata la configurazione.

Configuring job options for site recovery and finalizing job configuration

Passaggio 4. Riprotezione dell’ambiente

Una volta che le VM sono state sottoposte a failover e i carichi di lavoro sono stati migrati al sito di DR, le VM di produzione originali sono ora offline e le repliche nel sito di DR sono ora le uniche copie funzionanti. Se una replica di macchina virtuale accesa dovesse ora subire un guasto, non si avrebbe la possibilità di ripristinare rapidamente i dati e i carichi di lavoro.

Per proteggere le VM in esecuzione nel sito di DR, è necessario replicare queste VM in un altro luogo sicuro. In questo modo, se la VM in esecuzione nel sito di DR subisce un guasto, è possibile eseguire rapidamente il failover sulla nuova replica della VM.

La funzionalità di ripristino dell’ambiente consente di configurare la replica automatizzata non appena il failover della VM è completato. Ecco un esempio dettagliato di come ripristinare la protezione delle macchine virtuali con un lavoro di ripristino dell’ambiente dopo un failover.

  1. Nella pagina Jobs , fare clic con il pulsante destro del mouse sul nome del lavoro di ripristino dell’ambiente appena creato. Fare clic su Edit nel menu contestuale.

Editing an existing site recovery job

  1. È possibile vedere le azioni di failover aggiunte in precedenza al lavoro di ripristino dell’ambiente. Individuare e fare clic su Run jobs nell’elenco delle azioni situato nel pannello di sinistra della schermata di ripristino dell’ambiente Actions .

Adding a “Run jobs” action to add a VM disaster recovery replication job

  1. Selezionare il lavoro di replica dall’elenco dei lavori. Selezionare le opzioni di azione come di consueto e fare clic su Save.

Selecting an existing replication job for a “Run job” action

  1. Aggiungere un’azione Attesa tra l’azione di failover e il processo di replica. Ciò concede alla replica della VM il tempo necessario per avviarsi e caricare il sistema operativo (non è possibile replicare una VM spenta). Nell’elenco Azioni nel riquadro di sinistra, fare clic su Wait.

Adding a “Wait” action to a site recovery job

  1. Selezionare un tempo di attesa: 5 minuti dovrebbero essere sufficienti. Selezionare le opzioni dell’azione e fare clic su Save.

Configuring time to wait and action options

  1. Quando si aggiunge l’azione, questa viene inserita alla fine dell’elenco delle azioni. Fare clic su Move up e spostare l’azione Wait dalla quarta alla terza posizione: deve avvenire prima della replica.

Moving up the “Wait” action
Ora le azioni sono disposte nell’ordine richiesto.
A list of actions included to the site recovery job

  1. Infine, il processo di Site Recovery è pronto per essere utilizzato per eseguire il failover della macchina virtuale e la riprotezione automatica delle repliche della macchina virtuale utilizzate per il failover. Fare clic con il tasto destro del mouse sul nome del proprio processo di Site Recovery nella pagina iniziale e selezionare ” Run job ” dal menu contestuale.

Running a site recovery job for re-protection using disaster recovery replication

Passaggio 5. Failback

Il failback è il processo di ripristino delle macchine virtuali nel loro stato più recente dal sito di DR al sito di produzione originale o a uno nuovo. Per comprendere perché è necessario il failback, ricapitoliamo come funziona il failover:

  1. Quando si verifica un disastro (o se ne prevede l’occorrenza), viene eseguito il failover su una replica della VM.

Disaster recovery failover to replica is performed after disaster

  1. Qualsiasi modifica alla macchina virtuale (ad esempio, le transazioni aggiunte a un database quando i clienti effettuano acquisti online) viene scritta su un disco virtuale della replica della macchina virtuale. Alcuni blocchi vengono scritti, mentre altri vengono cancellati. Il disco virtuale della macchina virtuale di origine non contiene tali transazioni.

All changes are written to a VM replica after disaster recovery and failover

  1. Una volta risolto l’incidente e ripristinata la funzionalità del sito di produzione, i carichi di lavoro devono essere riportati al sito di produzione. I dati aggiornati della replica della macchina virtuale devono essere trasferiti nuovamente alla macchina virtuale di origine. Le VM devono essere risincronizzate con la replica inversa utilizzando il failback.

Replication from a VM replica to the original source VM is performed during failback

Configurazione del failback in NAKIVO Backup & Replication

Il failback può essere eseguito sia in modalità di produzione che in modalità di test (quando tutte le modifiche apportate all’ambiente virtuale dall’azione di failback vengono riportate allo stato precedente al failback al termine del test).

Vediamo in dettaglio come funziona ciascun caso.

  Production failback Test failback
1 Spegnimento della VM di origine (se presente e accesa).
2

Creazione di uno istantanea di protezione della VM di origine (se la VM di origine è funzionante).

La creazione di questo snapshot consente di ripristinare lo stato della VM di origine precedente al failover nel caso in cui il failback non possa essere eseguito correttamente.

3 Esecuzione di replica incrementale (se la VM di origine originale è online nel sito di produzione) o di una replica completa (se la VM viene ripristinata in un nuovo sito di produzione).
4 Spegnimento della replica della VM (facoltativo). La replica della VM viene utilizzata per ospitare i carichi di lavoro e non viene spenta.
5 La replica incrementale viene eseguita ancora una volta dalla replica della VM alla VM di origine. Il delta (i dati modificati dalla prima esecuzione della replica) dovrebbe essere molto più piccolo questa volta. La replica dalla replica della VM alla VM di origine originale (o a una nuova VM di produzione) viene eseguita una sola volta poiché è sufficiente ai fini del test.
6 Connessione della VM di origine originale alla sua nuova rete tramite mapping di rete (facoltativo). Collegamento della VM sorgente a una rete isolata in modo che non vi sia alcuna interruzione dell’ambiente di produzione (opzionale).
7 Modifica dell’indirizzo IP statico della VM sorgente originale tramite ridefinizione IP (opzionale).
8 Accensione della VM sorgente originale.
9 Cleanup after a successful failback. Dopo un’operazione di failback riuscita, sia la VM di origine che la replica della VM si trovano nei loro stati normali.

  • Lo snapshot di protezione viene rimosso dalla VM di origine originale.
  • Il processo di replica viene riconfigurato per utilizzare la VM primaria (di origine) appena creata anziché quella precedente (facoltativo; si applica se è stato eseguito il failover su una nuova VM).
  • Passaggio della replica della VM dallo stato di failover (operativo) allo stato normale.

Cleanup after a failed failback:

  • Ripristino della macchina virtuale di origine allo snapshot di protezione creato.
  • Rimozione dello snapshot di protezione dalla macchina virtuale di origine.
  • Riavvio della replica della macchina virtuale.
Cleanup if the source VM didn't exist before the test failback was run:

  • Rimozione della macchina virtuale di origine.

Cleanup if the source VM already existed before the test failback was run:

  • Ripristino della macchina virtuale di origine allo stato in cui si trovava al momento della creazione dello snapshot di protezione.
  • Accensione della macchina virtuale di origine (se era spenta).
  • Rimozione dello snapshot di protezione dalla macchina virtuale di origine.

Preparazione per il failback

Innanzitutto, è necessario creare un lavoro di ripristino dell’ambiente che includa azioni di failover. Questo processo è stato descritto in dettaglio in precedenza.

  • Per eseguire un’azione di failover sono necessari un lavoro di replica e una replica della macchina virtuale.
  • Un lavoro di ripristino dell’ambiente deve includere un’azione di failover per poter eseguire il failback.
  • Le repliche delle macchine virtuali devono trovarsi in stato di failover; pertanto, è possibile eseguire il failback solo dopo aver eseguito il failover.

Esecuzione del failback

Vediamo con un esempio come eseguire un failback con NAKIVO Backup & Replication.

  1. Assicurarsi che il failover sia stato eseguito come parte di un lavoro di ripristino dell’ambiente (che dovrebbe essere già stato creato).

Running failover first

  1. Creare un nuovo lavoro di ripristino dell’ambiente: le azioni di failback possono essere incorporate in questo lavoro. Nella pagina Jobs , fare clic su Create > Site recovery job.

Creating a new site recovery job for failback

Viene avviata la Procedura guidata per un nuovo processo di Site Recovery .

1. Actions.

  1. Nel riquadro di sinistra, fare clic su Failback VMware VMs (per altri ambienti, utilizzare Failback Hyper-V VMs o Failback EC2 Instances).

Adding a failback action to the Site Recovery job

  1. Selezionare le repliche delle macchine virtuali a cui deve essere applicata l’operazione di failover. Fare clic su Next.

Selecting the virtual machines for failback

  1. Selezionare una posizione di failback: potrebbe trattarsi del sito di produzione originale o di una nuova posizione. Fare clic su Next.

Selecting location for failback

  1. Selezionare le opzioni del processo. Selezionare Power off replica VMs se necessario. Fare clic su Save quando si è pronti a procedere.

Configuring the failback action options

  1. Dopo aver aggiunto l’azione di failback, il processo di Site Recovery apparirà come nella schermata riportata di seguito. Fare clic su Next.

A failback action is added to this Site Recovery job

2. Networks. Selezionare questa opzione se è necessario abilitare la mappatura di rete per questo processo. Fare clic su Next.

The network mapping configuration screen for a Site Recovery job

3. Re-IP. Selezionare questa opzione se è necessario abilitare Re-IP per questo processo. Fare clic su Next.

A Re-IP configuration screen for a site recovery job

4. Test Schedule. Configurare le opzioni di pianificazione, quindi fare clic su Next.

Configuring scheduling options for site recovery job testing

5. Options. Definire le opzioni del processo di Site Recovery e immettere il nome del processo. È possibile impostare l’RTO richiesto per la macchina virtuale e specificare l’indirizzo e-mail per il rapporto di failback. Fare clic su Finish per completare la creazione di questo nuovo processo di Site Recovery con failback.

Configuring Site Recovery job options for failback

Ora è possibile eseguire questo processo di Site Recovery per eseguire il failback della macchina virtuale: è sufficiente fare clic con il pulsante destro del mouse sul nome del processo di Site Recovery, selezionare Run jobe scegliere Test site recovery job o Run site recovery job.

Running a Site Recovery job with failover

Passaggio 6. Esecuzione dei test di ripristino di emergenza

I test di ripristino di emergenza consentono di assicurarsi di essere pronti per il ripristino in caso di emergenza e che tutti i componenti selezionati possano essere ripristinati con successo entro i tempi previsti.

Esistono due motivi principali Perché è necessario eseguire test di ripristino di emergenza in caso di disastri:

  • To make sure that everything can be recovered successfully. Quando si testa il piano di ripristino di emergenza e si rilevano dei problemi, è possibile risolvere i problemi prima che causino gravi conseguenze in uno scenario di crisi reale.
  • To make sure that RTO values can be met. I test di ripristino di emergenza consentono di verificare se le cargas de trabajo possono essere ripristinate entro i tempi di ripristino (RTO) previsti. Un test di ripristino dell’ambiente può essere eseguito manualmente on demand o automaticamente in base a una pianificazione, il che semplifica il processo e consente di risparmiare tempo.

Le differenze tra il failover in modalità di test e quello in produzione

Il meccanismo di esecuzione di un failover varia a seconda che il lavoro di ripristino dell’ambiente venga eseguito in modalità di test o in produzione. Una panoramica dei passaggi per ciascuna modalità è riportata nella tabella sottostante.

Production (emergency) failover Test failover
1 Disabilitare la replica dalla VM sorgente alla replica
2 Ripristinare la replica della VM a un determinato punto di ripristino (RP) (opzionale; per impostazione predefinita viene utilizzato l’ultimo RP) Eseguire una volta la replica incrementale dalla VM sorgente alla replica
3 Collegare la replica della VM a una new rete tramite mapping di rete (facoltativo) Collegare la replica della VM a una isolated rete con mappatura di rete (facoltativo)
4 Modificare l’indirizzo IP statico della replica con Re-IP (facoltativo)
4A Spegnere la VM di origine (facoltativo) —
5 Accendere la replica
6 Portare la replica allo stato “Failover”

Come si può notare, il secondo e il terzo punto differiscono tra il flusso di lavoro di produzione e quello di test. È possibile eseguire la replica da una VM di origine in modalità di prova mentre la VM di origine è in esecuzione. Nella maggior parte dei casi, quando si verifica un disastro, la VM di origine smette di funzionare e quindi non è possibile eseguire la replica. Le reti per la connessione delle VM possono essere definite separatamente nelle opzioni di mapping di rete per la modalità di produzione e la modalità di prova durante la configurazione di un processo Site Recovery.

La pulizia dopo il test di failover viene eseguita al termine dell’esecuzione di un processo Site Recovery in modalità di prova. La replica della macchina virtuale viene spenta e riportata allo stato precedente al failover tramite snapshot (viene acquisito uno snapshot della replica della macchina virtuale prima di eseguire un’azione di failover). La replica viene quindi riportata dallo stato di failover al suo stato normale e la replica dall’oggetto di origine alla replica viene riattivata.

Funzionalità di test del ripristino di emergenza in Site Recovery di NAKIVO

Esaminiamo rapidamente i punti principali delle funzionalità di test in Site Recovery di NAKIVO
1. Checking the actions included in testing
Esamina la logica delle azioni nel lavoro di ripristino dell’ambiente. Verifica che le azioni siano disposte nell’ordine corretto e assicurati che non formino un ciclo infinito. È possibile modificare le opzioni del lavoro di Site Recovery quando questo non è in esecuzione: cambiare l’ordine delle azioni, aggiungere o rimuovere azioni oppure modificare le opzioni di azione secondo necessità.
2. Checking networking
Verificare che la rete funzioni correttamente. È possibile utilizzare una connessione VPN tra un sito di produzione e un sito di ripristino di emergenza (DR), ma tale connessione non deve essere periodicamente interrotta in condizioni di funzionamento normale. Anche la rete presso il sito di ripristino di emergenza (DR) deve funzionare senza interruzioni. Verificate le impostazioni di mappatura di rete e di re-IP utilizzate per configurare il failover e il failback. Se una VM è configurata per una rete errata, la connessione di rete potrebbe non essere stabilita. Lo stesso vale per le impostazioni IP.
3. Setting the test schedule
È possibile pianificare i test dei processi di Site Recovery nelle opzioni di pianificazione dei processi di Site Recovery. Aprite l’interfaccia web della vostra istanza di NAKIVO Backup & Replication. Nel riquadro di sinistra, fate clic con il tasto destro del mouse sul nome del vostro lavoro e selezionate “ Edit ” dal menu contestuale.
Editing scheduling options for testing a site recovery job

I vantaggi del ripristino dell’ambiente di NAKIVO

  • Comprehensive DR orchestration and automation. Il ripristino dell’ambiente consente di implementare piani di ripristino di emergenza con elevati livelli di automazione. È possibile definire l’ordine di ripristino delle VM tenendo conto delle dipendenze tra le stesse, in modo che, in caso di disastro, il ripristino sia il più efficiente possibile.
  • Flexibility to accommodate the needs of various businesses. È possibile creare più lavori di ripristino dell’ambiente in base alle proprie esigenze. L’insieme delle azioni disponibili per l’integrazione nei lavori di ripristino dell’ambiente consente di creare diversi flussi di lavoro di ripristino personalizzati in base alle diverse situazioni.
  • Built into the data protection solution. Site Recovery è una funzione di inclusa in NAKIVO Backup & Replication e disponibile insieme al resto dell’ampia suite di funzionalità del prodotto; non è necessario acquistare una licenza separata per Site Recovery. Con questa soluzione, tutte le attività di protezione dei dati e di ripristino di emergenza vengono gestite da un unico pannello di controllo.
  • Significant savings compared to other DR solutions. NAKIVO Backup & Replication, con lo strumento di ripristino dell’ambiente integrato, rappresenta una soluzione economicamente vantaggiosa. Il prodotto continua a soddisfare gli utenti con nuove e utili funzioni, mantenendo gli stessi prezzi accessibili – soprattutto se confrontato con i concorrenti sul mercato del ripristino di emergenza.
Prova NAKIVO Backup & Replication

Prova NAKIVO Backup & Replication

Richiedi una prova gratuita per scoprire tutte le funzionalità di protezione dei dati offerte dalla soluzione. 15 giorni gratuiti. Nessuna limitazione in termini di funzionalità o capacità. Non è obbligatoria alcuna carta di credito.

Le persone leggono anche