Recuperación ante desastres con NAKIVO: planificación, implementación y pruebas

Las copias de seguridad y la recuperación ante desastres son los pilares de las estrategias de protección de datos en todas las organizaciones y sectores. Recuperación ante desastres es el proceso de recuperar máquinas virtuales y los servicios que se ejecutan en ellas en un sitio secundario (conocido como «sitio de recuperación ante desastres») cuando el sitio de producción queda indisponible. Estos Los centros de recuperación de desastres secundarios pueden ser de diferentes tipos albergan servidores, ordenadores y equipos de red redundantes con el software necesario, dependiendo del nivel de redundancia.

NAKIVO Backup & Replication incluye la función de restauración del entorno, que permite crear secuencias de recuperación avanzadas (con conmutación por recuperación completa del sitio) que se pueden iniciar con un solo clic cuando el sitio principal deja de estar disponible. Lee esta entrada del blog para conocer los componentes clave de la estrategia de recuperación ante desastres, como la planificación de la recuperación ante desastres de TI, las pruebas y la ejecución de la recuperación ante desastres con la solución integrada de NAKIVO.

Garantiza la disponibilidad con NAKIVO

Garantiza la disponibilidad con NAKIVO

Cumple con los estrictos requisitos de disponibilidad de los servicios en infraestructuras virtuales. Alcanza los objetivos de tiempo de actividad gracias a unas sólidas funciones de orquestación y automatización de la recuperación ante desastres.

Paso 1. Planificación de la recuperación ante desastres

Como paso esencial para una recuperación ante desastres eficaz, la planificación debe incluir una evaluación de las necesidades de recuperación de la organización y la adquisición de una comprensión exhaustiva de qué componentes, pasos y procedimientos deben incluirse en un flujo de trabajo de recuperación ante desastres.

Planificación de la recuperación ante desastres: prácticas recomendadas

1. Realizar un análisis de impacto en el negocio

Un análisis del impacto en el negocio (o BIA) se utiliza para determinar el posible impacto negativo de incidentes graves o desastres naturales en las operaciones empresariales. Este análisis implica asignar un orden de prioridad a las diferentes máquinas virtuales (VM), la secuencia de recuperación y el tiempo disponible antes de que una interrupción afecte significativamente a las operaciones empresariales. Por ejemplo, el fallo de una máquina virtual podría causar retrasos e inconvenientes, mientras que el fallo de otra máquina virtual puede provocar la interrupción total de operaciones críticas para el negocio.

2. Evaluar los riesgos implicados

Antes de planificar la recuperación ante desastres (DR), recopila los datos pertinentes sobre los riesgos para las operaciones de tu organización y la continuidad del negocio. En algunas zonas, es más probable que se produzca un corte de electricidad prolongado o un ataque de virus que un tornado, pero en otras los desastres naturales son frecuentes. Una evaluación de riesgos te ayuda a determinar el nivel adecuado de protección frente a determinadas amenazas y a idear medidas para minimizar los riesgos y mitigar las consecuencias. Aunque los riesgos no puedan eliminarse por completo, estará mejor preparado para las situaciones de desastre a las que probablemente se enfrente.

3. Elabore la documentación de recuperación ante desastres

Una vez identificados los riesgos y su posible impacto en su negocio, comprenderá mejor en qué debe centrar sus esfuerzos a la hora de planificar los procesos de recuperación ante desastres. Procedimientos de recuperación de documentos, describiendo en detalle todos los pasos esenciales y las medidas de recuperación ante desastres, y actualice los documentos periódicamente para reflejar los cambios introducidos en el entorno. La documentación debe incluir:

  • Disaster recovery scope. Evalúa la importancia de cada componente de hardware y software de tu infraestructura e incluye en tu plan de recuperación ante desastres aquellos que sean fundamentales para las operaciones críticas. Las máquinas virtuales (VM) que albergan información crítica, los sistemas informáticos y las aplicaciones cuyo funcionamiento sea esencial para garantizar la prestación continua de servicios deben ser tu máxima prioridad a la hora de la recuperación.
  • VM recovery order. Es posible que determinadas máquinas virtuales dependan del software o de la información alojada en otra máquina virtual, lo que significa que no pueden funcionar por separado ni iniciarse de forma aleatoria. Debes especificar el orden de recuperación para agilizar el proceso y eliminar el riesgo de conflictos de software en el centro de recuperación ante desastres. Por ejemplo, la máquina virtual que ejecuta el controlador de dominio de Active Directory debe estar en funcionamiento antes de que puedas iniciar una máquina virtual con un servidor de archivos que utilice la autenticación de Active Directory.

Otro ejemplo son los servicios web, que a menudo dependen de software instalado en varias máquinas virtuales diferentes. Es posible que sea necesario implementar la siguiente secuencia:

  1. La máquina virtual con el servidor de base de datos debe iniciarse primero.
  2. A continuación, se puede iniciar la máquina virtual con el servidor de aplicaciones.
  3. Solo entonces se puede iniciar la máquina virtual con el servidor web.
  • RTO and RPO in disaster recovery. Establezca el de objetivo de tiempo de recuperación (RTO) y el de objetivo de punto de recuperación (RPO) para las máquinas virtuales de diferente prioridad en el plan de recuperación ante desastres. Por ejemplo, las máquinas virtuales con sistemas financieros podrían tener objetivos de recuperación más cortos que las utilizadas para almacenar documentos archivados.
  • Dependencies. A la hora de determinar la cadena de dependencias entre el personal y los componentes de TI, colabora con tu personal y tenlo en cuenta para evitar eslabones débiles que puedan provocar un fallo en la recuperación. Por ejemplo, puede que sea necesario recuperar primero una máquina virtual utilizada por el departamento de contabilidad si los trabajadores de otros departamentos dependen de esas operaciones financieras para realizar su trabajo.
  • Staff. Asigna roles y responsabilidades a los miembros del equipo que forman parte de los procesos de recuperación ante desastres. Si van a trabajar en el centro de recuperación ante desastres, asegúrese de que haya estaciones de trabajo instaladas allí con todo el equipamiento, mobiliario de oficina y hardware necesarios, de modo que puedan continuar su trabajo con interrupciones mínimas. Si los empleados pueden trabajar a distancia durante un desastre, configure el acceso a la VPN y proporcione las cuentas de VPN con antelación.
  • Hardware requirements. El éxito de un plan de recuperación ante desastres depende en gran medida del rendimiento y las capacidades del hardware ubicado en el centro de recuperación ante desastres. Se deben tener en cuenta varios factores:
  • Los servidores deben disponer de suficiente CPU, memoria y capacidad de disco para soportar las cargas de trabajo transferidas. Un bajo rendimiento de la CPU y una memoria insuficiente pueden afectar a la velocidad de sus máquinas virtuales, mientras que una velocidad de disco insuficiente da lugar a un rendimiento deficiente de las máquinas virtuales.
  • Las redes deben proporcionar suficiente ancho de banda para que las máquinas virtuales recuperadas puedan interactuar entre sí, con almacenamiento compartido, y con los usuarios según sea necesario.

Paso 2. Preparación para la recuperación ante desastres

Una vez que disponga de la documentación, puede continuar con la preparación para la recuperación ante desastres, preparando el sitio de recuperación ante desastres y configurando la replicación de las cargas de trabajo críticas en dicho sitio. La replicación es necesaria para que Conmutación por recuperación de una máquina virtual pueda replicar máquinas virtuales cuando la infraestructura principal deje de funcionar.

¿Qué es la replicación de máquinas virtuales?

La replicación de máquinas virtuales es el proceso de crear una copia idéntica de una máquina virtual de origen (denominada «réplica de máquina virtual») en un host diferente (el host de destino). La réplica de máquina virtual es una máquina virtual normal que permanece apagada hasta que se necesita (momento en el que puede ejecutarse en su host casi al instante).

Consulta cómo crear y configurar un job de replicación de VMware en NAKIVO Backup & Replication para obtener más detalles.

El proceso de cambiar las cargas de trabajo de una máquina virtual de origen (producción) a una réplica de máquina virtual en el sitio de recuperación ante desastres con el fin de mantener la continuidad del negocio y la alta disponibilidad se conoce como conmutación por recuperación.

Prácticas recomendadas para la replicación de máquinas virtuales

Existen una serie de prácticas recomendadas en materia de replicación para garantizar una mayor fiabilidad y eficacia del proceso. Aquí nos centraremos en dos puntos clave:

  • Perform VM replication at the {10}. La capa de virtualización es la capa intermedia entre el hardware físico y el sistema operativo invitado que se ejecuta en una máquina virtual. La replicación realizada a nivel de virtualización se denomina «a nivel de host» y es más eficiente que la replicación a nivel de invitado.
  • Use application-aware replication to avoid data loss. Si se toma una instantánea de la máquina virtual necesaria para la replicación mientras estas aplicaciones se están ejecutando sin realizar ninguna acción adicional, el efecto sería similar al de un corte de corriente inesperado y un apagado, y los datos podrían perderse.

Con los métodos coherentes con las aplicaciones, estas se congelan (se ponen en estado de reposo) y se vacía la memoria, de modo que no se pueden escribir datos en el disco antes de tomar la instantánea. Una vez tomada la instantánea coherente, se puede crear una réplica de la máquina virtual. Dichas réplicas de máquinas virtuales se pueden restaurar con éxito con las aplicaciones que contienen funcionando correctamente.
NAKIVO Backup & Replication admite la replicación a nivel de host «coherente con las aplicaciones» para máquinas virtuales VMware, Microsoft Hyper-V e Instancias de EC2, con funciones especiales para Microsoft SQL Server, Exchange Server y el controlador de dominio de Active Directory.

Paso 3. Creación de un flujo de trabajo de recuperación ante desastres

Para crear un flujo de trabajo de recuperación ante desastres, se necesita una solución especializada como NAKIVO Backup & Replication, que proporciona una funcionalidad integrada de restauración del entorno (Site Recovery) para orquestar y automatizar las secuencias de recuperación ante desastres.

  1. Acciones
  2. redes
  3. Reasignación de IP
  4. calendario de pruebas
  5. de recuperación

¿Qué es un flujo de trabajo de recuperación ante desastres?

Un flujo de trabajo de recuperación ante desastres (DR) es una secuencia de acciones que se ejecutan como parte del proceso de recuperación ante desastres para garantizar una conmutación por recuperación segura y rápida de las cargas de trabajo a las réplicas. El flujo de trabajo organiza el proceso de conmutación por recuperación con acciones relacionadas con las máquinas virtuales (VM) de origen, las VM de destino, las condiciones que deben cumplirse, etc. Debe definir en qué orden deben ejecutarse las acciones, ya que algunos procedimientos de recuperación ante desastres pueden depender del resultado de la ejecución de otros.

Acciones disponibles de Restauración del entorno

La funcionalidad de Restauración del entorno le permite crear secuencias complejas de recuperación ante desastres combinando acciones y condiciones en un único flujo de trabajo. Cada acción puede ejecutarse solo en modo de prueba, solo en modo de producción o en ambos modos (esta es la opción predeterminada) en NAKIVO Backup & Replication.

Puede incluir cualquiera o todas las siguientes acciones en una secuencia:

  • Failover – inicia la conmutación por recuperación a réplicas de máquinas virtuales VMware, máquinas virtuales Hyper-V o Instancias de EC2.
  • Failback
  • Start – inicia máquinas virtuales de VMware, máquinas virtuales de Hyper-V o Instancias de EC2.
  • Stop – detiene máquinas virtuales de VMware, máquinas virtuales de Hyper-V y Instancias de EC2 que se estén ejecutando.
  • Run job – ejecuta una tarea de copia de seguridad, de replicación, de restauración del entorno, de copia de seguridad o de inicio rápido de máquinas virtuales.
  • Stop jobs – detiene una tarea (cualquiera de las tareas enumeradas en el punto anterior).
  • Run script – ejecuta un script en uno de los siguientes destinos: el servidor con Director, un servidor Windows remoto, un servidor Linux remoto, una máquina virtual de VMware, una máquina virtual de Hyper-V o una instancia de EC2.
  • Attach repository – vincula un repositorio de backups utilizado por NAKIVO Backup & Replication para almacenar backups.
  • Detach repository – desconecta un repositorio de backups.
  • Send email – envía un correo electrónico con el mensaje que redacte a uno o varios destinatarios definidos.
  • Wait – espera el periodo de tiempo designado antes de pasar a la siguiente acción.
  • Check condition – en función de lo que introduzca (todo o parte del nombre de un recurso), comprueba una de las siguientes condiciones:
  • El recurso existe
  • El recurso es

Esta es la configuración que vamos a considerar: un sitio primario (de producción) con máquinas virtuales de VMware vSphere y un sitio de recuperación ante desastres (DR) en una ubicación remota: DC-VM es una máquina virtual basada en Windows que ejecuta un controlador de dominio de Active Directory. FS-VM es una máquina virtual basada en Windows con un servidor de archivos en ejecución (se utiliza el protocolo SMB para compartir archivos). Se utiliza Active Directory para la autenticación de usuarios. Las copias de seguridad de la base de datos Oracle Database se almacenan en el servidor de archivos. Ora-DB es la máquina virtual en la que se ejecuta la base de datos Oracle Database. El sitio de recuperación ante desastres contiene las siguientes máquinas virtuales: DC-VM-replica y FS-VM-replica son réplicas de las máquinas virtuales de producción. Pueden utilizarse como destinos para la conmutación por recuperación. DB-VM es una máquina virtual basada en Linux con pero no contiene bases de datos. Se hace un backup de la base de datos con NAKIVO Backup & Replication a nivel de base de datos en FS-VM en el sitio de producción (esta es coherente con la aplicación). FS-VM y DC-VM se replican a nivel de host al sitio de recuperación ante desastres (DR) con la solución NAKIVO. Orden de recuperación de las máquinas virtuales Durante un incidente que provoque la caída del sitio de producción, los componentes deben recuperarse en el sitio de recuperación ante desastres (DR) de la siguiente manera: Conmutación por error de DC-VM a DC-VM-replica. Una vez que DC-VM-replica esté en funcionamiento, realice la conmutación por error de FS-VM a FS-VM-replica . Debe seguir este orden porque FS-VM depende de DC-VM para la autenticación de usuarios en el servidor de archivos. Una vez que estas dos máquinas virtuales estén en funcionamiento, DB-VM podrá acceder al directorio compartido del servidor de archivos donde se almacena el volcado. Ahora se puede iniciar DB-VM . Una vez que DB-VM esté en ejecución, ejecute un script que permita restaurar la base de datos a partir del volcado ubicado en el servidor de archivos. Las flechas azules de los diagramas anteriores muestran las dependencias. Tenga en cuenta que puede ser necesario algo de tiempo para que los servicios se inicien en una réplica de máquina virtual encendida después de la acción de conmutación por recuperación y antes de conmutar por recuperación a la siguiente réplica o de recuperar una aplicación o una base de datos.

VMs at this production site are running, while the VMs and ESXi host at the DR site remain powered off

Backup de la base de datos Oracle Database

Disaster recovery failover to the first VM replica is performed at the DR site

Disaster recovery failover to the second VM replica, which is dependent on the first VM replica, is performed after the first VM replica has started

Este tiempo de espera debe formar parte de la secuencia de restauración del entorno (DR).

Para este orden de conmutación por recuperación de máquinas virtuales, es necesario crear una job de restauración del entorno en NAKIVO Backup & Replication con la siguiente lógica:

  • Action 1: Conmutación por recuperación de la máquina virtual del controlador de dominio . Esperar hasta que finalice la acción antes de pasar al siguiente paso. Detenga la tarea si esta acción falla.
  • Action 2. Espere durante 3 minutos.
  • Action 3. Comprobar la condición de DC-VM-replica . Comprobar si el recurso está en ejecución. Si el recurso está en ejecución, continúe con la siguiente acción del job de restauración del entorno. Si no es así, detenga la tarea y aborte incorrectamente el job de restauración del entorno.
  • Action 4. Conmutación por error de FS-VM . Esperar a que finalice la acción antes de continuar con la siguiente acción. Detenga la tarea si esta acción falla.
  • Action 5. Espere durante 3 minutos.
  • Action 6. Compruebe el estado de FS-VM-replica . Si el recurso está en ejecución, continúe con la siguiente acción de la tarea de Site Recovery. De lo contrario, detenga la tarea y marque como fallida.
  • Action 7. Inicie DB-VM . Espere a que esta acción finalice antes de continuar con la siguiente. Detenga la tarea si esta acción falla.
  • Action 8. Espere durante 5 minutos.
  • Action 9. Ejecute el script . Tipo de destino: máquina virtual de VMware. Máquina virtual de destino: DB-VM. Ruta del script: /home/oracle/restore_db.sh (al añadir este paso, debe introducir el nombre de usuario y la contraseña de una cuenta con permisos suficientes para ejecutar el script).

Guía paso a paso de la restauración del entorno de NAKIVO

Creemos un nuevo job de restauración del entorno basado en el plan descrito anteriormente. En la página Jobs de su instancia de NAKIVO Backup & Replication, haga clic en Create > Site recovery job.

Backup and disaster recovery - creating a new Site Recovery job

1. Acciones

Se inicia el Asistente para nuevo job de restauración del entorno . En el panel izquierdo, encontrará las acciones que se pueden añadir a la tarea. Basta con hacer clic en una acción para añadirla a la secuencia. Tenga en cuenta que no se pueden mezclar acciones de diferentes plataformas en una misma secuencia (estamos creando un job para máquinas virtuales de VMware).

Acción 1. Conmutación por error de la máquina virtual DC-VM

  1. En el panel izquierdo, haz clic en Failover VMware VMs.

Adding Failover VMware VMs action

  1. En el panel izquierdo, selecciona la réplica de la máquina virtual de una tarea de replicación existente. En nuestro flujo de trabajo, la conmutación por error a DC-VM-replica es la primera acción. En el panel derecho, puedes seleccionar un punto de recuperación. De forma predeterminada, se utiliza el punto de recuperación más reciente.

Haz clic en Next para continuar. Choosing the VM for a disaster recovery failover action in the framework of site recovery

  1. En cuanto a las opciones de recuperación ante desastres y conmutación por recuperación , puede desmarcar Power off source VMs —esta opción se puede utilizar para evitar un conflicto de direcciones IP si las máquinas virtuales de origen y las réplicas utilizan las mismas redes—.

Siguiendo la lógica descrita anteriormente, seleccionamos las siguientes opciones:

  • Ejecutar esta acción en: Run this action in both testing and production mode
  • Comportamiento de espera: Wait for this action to complete
  • Tratamiento de errores: Stop and fail the job if this action fails

Haga clic en Save para guardar la acción creada.
Options for the VM disaster recovery failover action

Acción 2. Esperar 3 minutos

Una acción de espera resulta útil en este caso porque la siguiente acción de conmutación por recuperación del flujo de trabajo (conmutación por recuperación a FS-VM-replica ) requeriría que la DC-VM-replica estuviera activa y ya en funcionamiento con los Servicios de dominio de Active Directory.

  1. En el panel izquierdo de la pantalla Acciones , haz clic en Wait.

Adding a “Wait” action

  1. Selecciona el tiempo de espera (en este caso, 3 minutos ).

Selecciona las opciones de la acción tal y como has hecho con la primera acción y haz clic en Save.
Configuring the “Wait” action

La nueva acción se añade después de la acción anterior, al final de la lista. Puedes reordenar, editar o eliminar acciones. Basta con pasar el ratón por encima de una acción para ver las opciones.

Acción 3. Comprobar el estado de DC-VM-replica

  1. En el panel izquierdo de la pantalla Acciones , haz clic en Check condition para comprobar si la máquina virtual que se sometió a conmutación por error en la primera acción está en ejecución.

Adding the “Check condition” action to the disaster recovery process

  1. Configura esta acción de la siguiente manera:
  • Selecciona el tipo de condición: Resource is running. Las otras opciones son el recurso existe o se puede acceder a la IP/nombre de host .
  • Selecciona el tipo de recurso: VMware VM.
  • Selecciona el método de identificación: Name (la otra opción es ID ) para identificar la máquina virtual en cuestión. Puedes utilizar cualquier parte de la cadena de la máquina virtual. En este caso, conocemos el nombre exacto, por lo que utilizamos la función Equals .
  • Define la cadena de búsqueda: DC-VM-replica.

Ahora tenemos una acción que comprueba si la máquina virtual de VMware denominada DC-VM-replica está en ejecución. Puedes utilizar cualquier parte de la cadena de la máquina virtual. En este caso, conocemos el nombre exacto, por lo que utilizamos la función . Define la cadena de búsqueda: . Ahora tenemos una acción que comprueba si la máquina virtual de VMware denominada DC-VM-replica está en ejecución. Puedes utilizar cualquier parte de la cadena de la máquina virtual. En este caso, conocemos el nombre exacto, por lo que utilizamos la función . Define la cadena de búsqueda: . Ahora tenemos una acción que comprueba si la máquina virtual de VMware denominada DC-VM-replica está en ejecución. Puedes utilizar cualquier parte de la cadena de la máquina virtual. En este caso, conocemos el nombre exacto, por lo que utilizamos la función . Define la cadena de búsqueda: . Ahora tenemos una acción que comprueba si la máquina virtual de VMware denominada DC-VM-replica está en ejecución. Puedes utilizar cualquier parte de la cadena de la máquina virtual. En este caso, conocemos el nombre exacto, por lo que utilizamos la función . Define la cadena de búsqueda: . Ahora tenemos una Haga clic en Save para continuar.
Configuring the “Check condition” action for a disaster recovery process

Acción 4. Conmutación por recuperación de máquina virtual

  1. Al igual que en Acción 1 , haga clic en Failover VMware VMs.

Adding another “Failover VMware VMs” action for a disaster recovery process

  1. En este caso, seleccionamos máquina virtual-replica . Haga clic en Next, seleccione las mismas opciones para la acción de conmutación por recuperación que ha utilizado en Acción 1 y haga clic en Save.

Adding the VM replica for the disaster recovery failover action

Acción 5.

Wait



Espera 3 minutos

. Haz clic en y configura esta acción tal y como hiciste con la acción 2

. El tiempo especificado es, de nuevo, Check condition 3 minutos en nuestro caso.
Acción 6. Comprueba el estado de FS-VM-replica

. Haz clic en para comprobar si la máquina virtual de VMware FS-VM-replica

está en ejecución. Consulta la

    acción 2

  1. y selecciona las mismas opciones, salvo, por supuesto, el nombre de la máquina virtual.
    Start VMware VMs Acción 7. Iniciar la máquina virtual de base de datos

The current list of actions (disaster recovery procedures) for a Site Recovery job Haga clic en

    en el panel izquierdo de la pantalla

  1. Acciones .


    Save
  2. Seleccione

la máquina virtual de base de datos Selecting the VM for a Start VM action. Esta máquina virtual se puede iniciar una vez que esté seguro de que la

réplica de la máquina virtual del sistema de archivos

está en ejecución. En la parte inferior de la página, seleccione las mismas opciones de acción que se muestran en las acciones anteriores. A continuación, haga clic en Wait.


Acción 8. Espere 5 minutos

Espere 5 minutos. Haga clic en

y configure esta acción de forma similar a la acción 2 de

  1. . Este tiempo debería ser suficiente para iniciar el servicio Oracle en DB-VM .
    Run script Acción 9. Ejecute el script
  2. En la pantalla

Acciones Adding the Run script action , haga clic en

    . Recuerde que este script está destinado a recuperar la base de datos Oracle a nivel de base de datos a partir de un volcado almacenado en

  1. FS-VM-replica
  2. .


  • Defina las opciones del script. En nuestro caso:

  • Tipo de destino:
  • Máquina virtual de VMware


  • Máquina virtual de destino:
  • Máquina virtual de la base de datos


  • Ruta del script:
  • /home/oracle/restore.db.sh

Nombre de usuario: Save oracle Configuring the Run script action

  1. Contraseña: (contraseña)Next
  2. La ruta del script, el nombre de usuario y la contraseña serán diferentes en su caso. No olvides asegurarte de que el archivo de script sea ejecutable y de que el usuario tenga los permisos suficientes para ejecutarlo. En este ejemplo, las opciones de la acción se configuran como de costumbre.

    Haz clic en

cuando estés listo para continuar.

Finalizing configuration of the actions (disaster recovery procedures) for a Site Recovery job workflow

Ahora puedes ver todas las acciones configuradas. conectadas a diferentes redesSi las máquinas virtuales del sitio de producción y del sitio de recuperación ante desastres están Enable network mapping, seleccione . Haga clic en Create new mapping; en las ventanas emergentes, seleccione una red de origen, una red de destino y una red que se utilizará para las pruebas de la tarea de restauración del entorno.
Haga clic en Save para guardar el mapeo de la red y, a continuación, haga clic en Next.

Nota : También puede utilizar reglas de asignación existentes si las ha configurado en otras tareas de replicación, conmutación por recuperación o restauración del entorno.

Configuring network mapping for a site recovery job

3. Reasignación de IP

Si las redes utilizadas para la conexión de las máquinas virtuales en el sitio de origen y en el sitio de destino tienen direcciones diferentes, debe habilitar la reasignación de IP seleccionando Enable Re-IP.

  1. Cree una nueva regla de reasignación de IP haciendo clic en Create new rule. Defina los ajustes del origen y los del destino y, a continuación, haga clic en Save.

Creating a new Re-IP rule

  1. Haga clic en Select VMs y seleccione las máquinas virtuales en las que se debe aplicar la Reasignación de IP. Debe proporcionar las credenciales de un usuario con permisos suficientes para cambiar la configuración de red en el sistema operativo invitado de la máquina virtual.

Setting credentials for a Re-IP rule

4. Calendario de pruebas

Puede crear un calendario específico para ejecutar trabajos de Restauración del entorno en modo de prueba y realizar pruebas de recuperación ante desastres. Esto le permite comprobar si el trabajo se puede ejecutar correctamente dentro de los plazos requeridos. Cuando haya terminado, haga clic en Siguiente.
Hablaremos con más detalle sobre las pruebas de tareas de restauración del entorno en el paso 6.

Configuring schedule options for disaster recovery testing with Site Recovery

5. Opciones

Escriba el nombre del job y el objetivo de tiempo de recuperación. Haga clic en Finish cuando haya completado la configuración.

Configuring job options for site recovery and finalizing job configuration

Paso 4. Volver a proteger el entorno

Una vez que se ha realizado la conmutación por error de las máquinas virtuales y se han migrado las cargas de trabajo al sitio de recuperación ante desastres, las máquinas virtuales de producción originales quedan fuera de línea, y las réplicas del sitio de recuperación ante desastres son ahora las únicas copias funcionales. Si una réplica de máquina virtual encendida fallara ahora, no tendrías la posibilidad de restaurar rápidamente los datos y las cargas de trabajo.

Para proteger las máquinas virtuales que se ejecutan en el sitio de recuperación ante desastres, debes replicar estas máquinas virtuales a otro lugar seguro. De ese modo, si la máquina virtual que se ejecuta en el sitio de recuperación ante desastres falla, podrás realizar una conmutación por error a la nueva réplica de máquina virtual rápidamente.

La función de restauración del entorno te permite configurar la replicación automatizada tan pronto como se complete la conmutación por recuperación de la máquina virtual. A continuación se muestra un ejemplo paso a paso de cómo volver a proteger máquinas virtuales con una tarea de restauración del entorno después de una conmutación por recuperación.

  1. En la página Jobs , haga clic con el botón derecho del ratón sobre el nombre de la tarea de restauración del entorno que ha creado recientemente. Haga clic en Edit en el menú contextual.

Editing an existing site recovery job

  1. Podrá ver las acciones de conmutación por recuperación añadidas anteriormente a la tarea de restauración del entorno. Busque y haga clic en Run jobs en la lista de acciones situada en el panel izquierdo de la pantalla de restauración del entorno Actions .

Adding a “Run jobs” action to add a VM disaster recovery replication job

  1. Seleccione la tarea de replicación de la lista de tareas. Selecciona las opciones de acción como de costumbre y haz clic en Save.

Selecting an existing replication job for a “Run job” action

  1. Añade una acción Esperar entre la acción de conmutación por recuperación y la tarea de replicación. Esto le da a la réplica de la máquina virtual algo de tiempo para iniciarse y cargar el sistema operativo (no se puede replicar una máquina virtual apagada). En la lista Acciones del panel izquierdo, haz clic en Wait.

Adding a “Wait” action to a site recovery job

  1. Selecciona el tiempo de espera; 5 minutos deberían ser suficientes. Seleccione las opciones de la acción y haga clic en Save.

Configuring time to wait and action options

  1. Al añadir la acción, esta se añade al final de la lista de acciones. Haga clic en Move up y mueva la acción Wait de la cuarta posición a la tercera; debe ejecutarse antes de la replicación.

Moving up the “Wait” action
Ahora las acciones están ordenadas según lo necesario.
A list of actions included to the site recovery job

  1. Por último, la tarea de restauración del entorno está lista para utilizarse en la conmutación por recuperación de la máquina virtual y la reprotección automática de las réplicas de la máquina virtual utilizadas para la conmutación por recuperación. Haga clic con el botón derecho del ratón sobre el nombre de su tarea de restauración del entorno en la página de inicio y seleccione « Run job » en el menú contextual.

Running a site recovery job for re-protection using disaster recovery replication

Paso 5. Conmutación por error

La conmutación por error es el proceso de restaurar las máquinas virtuales en su estado más reciente desde el sitio de recuperación ante desastres (DR) de vuelta al sitio de producción original o a uno nuevo. Para comprender por qué se necesita la conmutación por error, recapitulemos cómo funciona la conmutación por recuperación:

  1. Cuando se produce un desastre (o se prevé que vaya a ocurrir), se lleva a cabo la conmutación por recuperación a una réplica de la máquina virtual.

Disaster recovery failover to replica is performed after disaster

  1. Cualquier cambio en la máquina virtual (por ejemplo, transacciones añadidas a una base de datos cuando los clientes realizan compras en línea) se escribe en un disco virtual de la réplica de la máquina virtual. Algunos bloques se escriben y otros se borran. El disco virtual de la máquina virtual de origen no contiene esas transacciones.

All changes are written to a VM replica after disaster recovery and failover

  1. Una vez que se ha resuelto el incidente y el sitio de producción vuelve a estar operativo, las cargas de trabajo deben recuperarse en el sitio de producción. Los datos actualizados de la réplica de la máquina virtual deben transferirse de nuevo a la máquina virtual de origen. Las máquinas virtuales deben resincronizarse mediante replicación inversa utilizando la conmutación por error (failback).

Replication from a VM replica to the original source VM is performed during failback

Configuración de la conmutación por error (failback) en NAKIVO Backup & Replication

La conmutación por error (failback) puede realizarse tanto en modo de producción como en modo de prueba (cuando todos los cambios en el entorno virtual provocados por la acción de conmutación por error se revierten al estado anterior a la misma después de la prueba).

Veamos cómo funciona cada caso en detalle.

  Production failback Test failback
1 Apagar la máquina virtual (VM) de origen (si existe y está encendida).
2

Crear una instantánea de protección de la VM de origen (si la VM de origen está operativa).

La creación de esta instantánea te permite restaurar un estado anterior a la conmutación por recuperación de la VM de origen en caso de que la conmutación por recuperación no se pueda realizar correctamente.

3 Ejecución de replicación incremental (si la máquina virtual de origen original está en línea en el sitio de producción) o de una replicación completa (si la máquina virtual se está recuperando en un nuevo sitio de producción).
4 Apagado de la réplica de la máquina virtual (opcional). La réplica de la máquina virtual se utiliza para alojar las cargas de trabajo y no se apaga.
5 Se ejecuta una vez más la replicación incremental desde la réplica de la máquina virtual a la máquina virtual de origen. El delta (los datos que han cambiado desde la primera ejecución de la replicación) debería ser mucho menor esta vez. La replicación desde una réplica de máquina virtual a la máquina virtual de origen original (o a una nueva máquina virtual de producción) se realiza una sola vez, ya que es suficiente a efectos de prueba.
6 Conexión de la máquina virtual de origen original a su nueva red mediante el mapeo de la red (opcional). Conexión de la máquina virtual de origen a una red aislada para que no se produzca ninguna interrupción en el entorno de producción (opcional).
7 Modificación de la dirección IP estática de la máquina virtual de origen mediante Reasignación de IP (opcional).
8 Encendido de la máquina virtual de origen.
9 Cleanup after a successful failback. Después de una operación de conmutación por error satisfactoria, tanto la máquina virtual de origen como la réplica de la máquina virtual se encuentran en sus estados habituales.

  • La instantánea de protección se elimina de la máquina virtual de origen original.
  • La tarea de replicación se reconfigura para utilizar la máquina virtual primaria (de origen) recién creada en lugar de la anterior (opcional; se aplica si se ha realizado una conmutación por recuperación a una nueva máquina virtual).
  • Cambio del estado de la réplica de la máquina virtual de conmutación por recuperación (operativo) a estado normal.

Cleanup after a failed failback:

Cleanup if the source VM didn't exist before the test failback was run:

Cleanup if the source VM already existed before the test failback was run:

Preparación para la conmutación por error En primer lugar, debe crear una tarea de restauración del entorno que incluya acciones de conmutación por error. Este proceso se ha descrito detalladamente anteriormente. Para realizar una acción de conmutación por error, se requieren una tarea de replicación y una réplica de máquina virtual. Una tarea de restauración del entorno debe incluir una acción de conmutación por error para poder realizar la conmutación por error. Las réplicas de máquina virtual deben estar en estado de conmutación por recuperación; por lo tanto, solo se puede realizar la conmutación por error después de haber realizado la conmutación por recuperación. Ejecución de la conmutación por error Veamos un ejemplo de cómo ejecutar la conmutación por error con NAKIVO Backup & Replication. Asegúrese de que la conmutación por recuperación se haya ejecutado como parte de un job de restauración del entorno (esta ya debería haberse creado). Cree un nuevo job de restauración del entorno; las acciones de conmutación por error se pueden incorporar a este job. En la página , haz clic en . Se iniciará el Asistente para nueva tarea de Site Recovery . . En el panel izquierdo, haz clic en (para otros entornos, utiliza o ). Selecciona las réplicas de máquina virtual a las que se debe aplicar la operación de conmutación por error. Haz clic en . Selecciona una ubicación de conmutación de vuelta: puede ser el sitio de producción original o una nueva ubicación. Haz clic en . Selecciona las opciones de la tarea. Selecciona si es necesario. Haga clic en cuando esté listo para continuar. Una vez añadida la acción de conmutación por error, la tarea de restauración del entorno tendrá el aspecto que se muestra en la siguiente captura de pantalla. Haga clic en . . Seleccione esta opción si necesita activar el mapeo de la red para esta tarea. Haga clic en . . Seleccione esta opción si necesita activar la reasignación de IP para esta tarea. Haga clic en . . Configure las opciones de programación y, a continuación, haga clic en . . Defina las opciones de la tarea de restauración del entorno e introduzca el nombre de la tarea.

Running failover first

  1. Jobs Create > Site recovery job

Creating a new site recovery job for failback

1. Actions

  1. Failback VMware VMs Failback Hyper-V VMs Failback EC2 Instances

Adding a failback action to the Site Recovery job

  1. Next

Selecting the virtual machines for failback

  1. Next

Selecting location for failback

  1. Power off replica VMs Save

Configuring the failback action options

  1. Next

A failback action is added to this Site Recovery job

2. Networks Next

The network mapping configuration screen for a Site Recovery job

3. Re-IP Next

A Re-IP configuration screen for a site recovery job

4. Test Schedule Next

Configuring scheduling options for site recovery job testing

5. Options Puede establecer el RTO necesario para la máquina virtual y especificar la dirección de correo electrónico para el informe de conmutación por error. Haga clic en Finish para finalizar la creación de esta nueva tarea de restauración del entorno con conmutación por error.

Configuring Site Recovery job options for failback

Ahora puede ejecutar esta tarea de restauración del entorno para llevar a cabo la conmutación por error de la máquina virtual: simplemente haga clic con el botón derecho del ratón sobre el nombre del job, seleccione Run joby, a continuación, seleccione Test site recovery job o Run site recovery job.

Running a Site Recovery job with failover

Paso 6. Realización de pruebas de recuperación ante desastres

Las pruebas de recuperación ante desastres le ayudan a garantizar que estará preparado para la recuperación cuando se produzca un desastre y que todos los componentes seleccionados se puedan recuperar con éxito dentro de los plazos establecidos.

Hay dos motivos principales Por qué es necesario realizar pruebas de recuperación ante desastres:

  • To make sure that everything can be recovered successfully. Cuando prueba su plan de recuperación ante desastres y descubre que algo no funciona correctamente, puede solucionar los problemas antes de que causen graves dificultades en una situación de crisis real.
  • To make sure that RTO values can be met. Las pruebas de recuperación ante desastres le permiten comprobar si sus cargas de trabajo se pueden recuperar dentro de los RTO pertinentes. Una prueba de restauración del entorno se puede ejecutar manualmente bajo demanda o de forma automática según una programación, lo que facilita el proceso y te ahorra tiempo.

Diferencias entre la conmutación por recuperación en modo de prueba y en modo de producción

El mecanismo de ejecución de la conmutación por recuperación varía en función de si la tarea de Restauración del entorno se ejecuta en modo de prueba o en modo de producción. En la tabla siguiente se muestra un desglose de los pasos para cada modo.

Production (emergency) failover Test failover
1 Desactivar la replicación desde la máquina virtual de origen a la réplica
2 Restaurar la réplica de la máquina virtual a un punto de recuperación (RP) determinado (opcional; por defecto se utiliza el último RP) Ejecutar una vez la replicación incremental desde la máquina virtual de origen a la réplica
3 Conectar la réplica de la máquina virtual a una new red mediante el mapeo de la red (opcional) Conectar la réplica de la máquina virtual a una isolated red mediante mapeo de red (opcional)
4 Modificar la dirección IP estática de la réplica con Re-IP (opcional)
4A Apagar la máquina virtual de origen (opcional) —
5 Encender la réplica
6 Cambiar la réplica al estado «Failover»

Como se puede observar, los puntos segundo y tercero difieren entre los flujos de trabajo de producción y de prueba. Puedes ejecutar la replicación desde una máquina virtual de origen en modo de prueba mientras esta se encuentra en funcionamiento. En la mayoría de los casos, cuando se produce un desastre, la máquina virtual de origen deja de funcionar y, por lo tanto, no es posible realizar la replicación. Las redes para la conexión de las máquinas virtuales se pueden definir por separado en las opciones de «Asignación de redes» para el modo de producción y el modo de prueba al configurar una tarea de Restauración del entorno.

La limpieza tras la prueba de conmutación por recuperación se lleva a cabo después de la ejecución de una tarea de Restauración del entorno en modo de prueba. La réplica de la máquina virtual se apaga y se restaura a su estado anterior a la conmutación por recuperación mediante una instantánea (se toma una instantánea de la réplica de la máquina virtual antes de realizar una acción de conmutación por recuperación). A continuación, la réplica pasa del estado de conmutación por recuperación a su estado normal, y se vuelve a habilitar la replicación desde el objeto de origen a la réplica.

Funcionalidades de pruebas de recuperación ante desastres en Site Recovery de NAKIVO

Repasemos rápidamente los puntos principales de las funcionalidades de pruebas en Site Recovery de NAKIVO.
1. Checking the actions included in testing
Revisa la lógica de las acciones en la tarea de restauración del entorno. Comprueba si las acciones están ordenadas correctamente y asegúrate de que no formen un bucle infinito. Puede editar las opciones del job de restauración del entorno cuando este no se esté ejecutando: cambie el orden de las acciones, añada acciones, elimine acciones o edite las opciones de la acción según sea necesario.
2. Checking networking
Compruebe que su red funcione correctamente. Se puede utilizar una conexión VPN entre un sitio de producción y un sitio de recuperación ante desastres (DR), pero esta conexión no puede desconectarse periódicamente en condiciones normales. La red del sitio de recuperación ante desastres también debe funcionar sin interrupciones. Compruebe la configuración de «Network Mapping» y «Reasignación de IP» que haya utilizado para configurar la conmutación por error y la conmutación por error. Si una máquina virtual está configurada para una red incorrecta, es posible que no se establezca la conexión de red. Lo mismo ocurre con la configuración de IP.
3. Setting the test schedule
Las pruebas de las tareas de restauración del entorno se pueden programar en las opciones de programación de tareas de restauración del entorno. Abra la interfaz web de su instancia de NAKIVO Backup & Replication. En el panel izquierdo, haga clic con el botón derecho del ratón sobre el nombre de su tarea y seleccione « Edit » en el menú contextual.
Editing scheduling options for testing a site recovery job

Las ventajas de la restauración del entorno de NAKIVO

  • Comprehensive DR orchestration and automation. La restauración del entorno le permite implementar planes de recuperación ante desastres con altos niveles de automatización. Puede definir el orden de recuperación de las máquinas virtuales teniendo en cuenta sus dependencias, de modo que, cuando se produzca un desastre, la recuperación sea lo más eficiente posible.
  • Flexibility to accommodate the needs of various businesses. Puede crear varios jobs de restauración del entorno según sus necesidades. El conjunto de acciones disponibles para incorporarlas a los jobs de restauración del entorno permite crear diferentes flujos de trabajo de recuperación adaptados a cada situación.
  • Built into the data protection solution. Site Recovery es una función incluida en NAKIVO Backup & Replication y disponible junto con el resto del completo conjunto de funcionalidades del producto; no es necesario adquirir una licencia independiente para Site Recovery. Con esta solución, todas las actividades de protección de datos y recuperación ante desastres se gestionan desde un único panel de control.
  • Significant savings compared to other DR solutions. NAKIVO Backup & Replication, con la herramienta de restauración del entorno integrada, es una solución rentable. El producto sigue satisfaciendo a los usuarios con nuevas y útiles funciones, al tiempo que mantiene los mismos precios asequibles, especialmente si se compara con la competencia en el mercado de la recuperación ante desastres.
Prueba NAKIVO Backup & Replication

Prueba NAKIVO Backup & Replication

Solicita una versión de prueba gratuita para descubrir todas las funciones de protección de datos de la solución. 15 días gratis. Sin limitaciones de funciones ni de capacidad. No es necesario facilitar un número de tarjeta de crédito.

Artículos recomendados