Datastrophe

Recuperación de datos RAID, NAS y cabina de almacenamiento

Un RAID degradado debe apagarse y documentarse antes de sustituir discos: orden, paridad, tamaño de banda y eventos determinan cómo reconstruir el volumen.

Matriz RAID detenida tras la caída de un segundo disco

Un segundo disco caído convierte el rebuild en una operación de riesgo

RAID 5 tolera normalmente un fallo; RAID 6, dos, pero solo si los demás miembros son coherentes y legibles.

Cuando el sistema marca otra unidad durante la reconstrucción, detenga el proceso. Forzar «repair», «initialize» o «add disk» obliga a leer intensamente todos los miembros y puede escribir paridad calculada con sectores erróneos. Incluso un disco declarado fallido antes puede contener bloques más recientes que el repuesto. Se preservan miembros activos, expulsados y sustituidos, junto con sus posiciones y marcas temporales, para determinar qué combinación representa el último estado consistente.

  • Apague de forma controlada si el volumen ya no está disponible.
  • No reinserte discos en posiciones al azar.
  • Conserve también los miembros sustituidos anteriormente.

Miembro marcado como failed pero todavía legible

Puede aportar zonas que otro disco perdió después. Se clona con parámetros adaptados y se compara su event counter o generación antes de excluirlo.

Disco nuevo parcialmente reconstruido

Contiene un estado híbrido hasta el punto donde se detuvo el rebuild. No se trata como miembro completo; su progreso puede ayudar a localizar qué franjas son válidas.

La tolerancia RAID mantiene servicio ante ciertos fallos; no sustituye una copia y no garantiza una reconstrucción cuando varios discos tienen sectores inestables.
Bahías, cables y unidades etiquetados para conservar la geometría

Etiquetar bahías y cables conserva la geometría de la matriz

El orden físico no siempre coincide con la numeración de software, pero es una evidencia esencial para reconstruirla.

Antes de retirar nada, fotografíe frontal, trasera, seriales, bandejas y pantalla. Marque cada disco con su bahía sin tapar ventilación ni etiquetas. Guarde configuración del controlador, modelo del NAS, firmware, nivel RAID, capacidad y mensajes. No dependa solo de colores de leds: una controladora puede enumerar puertos de otra forma. Las imágenes de los miembros permiten probar orden, offset, stripe y rotación de paridad sin mover piezas originales.

  • Una etiqueta única por bahía y número de serie.
  • Fotografías de conexiones antes de desmontar.
  • Exportación de configuración si no escribe en la matriz.

Controladora ausente

Se documentan caché, batería, sector lógico, metadatos y posibles claves. Una placa de reemplazo debe reproducir parámetros antes de presentar los discos.

Expansiones y discos de tamaños distintos

Las ampliaciones pueden cambiar geometría o dejar regiones sin usar. La fecha de cada operación ayuda a interpretar zonas y no asumir una matriz uniforme.

Mover discos a otro chasis idéntico puede activar una importación o inicialización; no se hace sin copia de la configuración y de los miembros.
Bandas, offset y paridad contrastados con estructuras conocidas

Stripe, offset y paridad se validan con estructuras conocidas

Una combinación puede montar una partición y seguir mezclando bloques de archivos por un parámetro incorrecto.

El laboratorio compara firmas de sistemas de archivos, superbloques, tablas y patrones de paridad. Se prueba tamaño de banda, orden de discos, rotación, offset y sector lógico sobre copias. Un resultado válido debe mantener coherencia más allá de la cabecera: directorios, archivos grandes y bases tienen que cruzar stripes sin corrupción periódica. RAID 0 carece de paridad; RAID 10 exige identificar pares y orden; RAID 5 y 6 requieren esquemas específicos de distribución.

  • Geometría probada sobre imágenes, no sobre discos.
  • Coherencia verificada en varios puntos del volumen.
  • Archivos que cruzan bandas utilizados como control.

RAID 0 y ausencia de redundancia

Cada miembro aporta franjas únicas. Un disco destruido crea huecos repetidos en todos los archivos que lo atraviesan; se cuantifica el impacto sin prometer recomponer bits inexistentes.

RAID 6 y doble paridad

Permite reconstruir dos ausencias solo con geometría y miembros coherentes. Errores silenciosos adicionales pueden superar esa tolerancia y deben localizarse por zona.

Que aparezcan nombres correctos en la raíz no valida la matriz; un stripe erróneo suele corromper el contenido a intervalos regulares.
Coherencia de metadatos SHR, ZFS y Btrfs validada más allá del volumen montado

SHR, ZFS y Btrfs añaden metadatos más allá del RAID clásico

Un NAS puede combinar capas de agrupación, checksums, snapshots y sistemas de archivos propios.

Synology SHR distribuye grupos según tamaños; ZFS usa vdevs, uberblocks y checksums; Btrfs mantiene árboles copy-on-write y perfiles de datos y metadatos. Reordenar discos basándose solo en un RAID equivalente puede ignorar estas relaciones. Se conserva configuración, versión y topología, y se analizan generaciones para elegir un estado consistente. Los snapshots pueden aportar versiones, pero no se destruyen ni promueven desde el NAS original.

Las cabinas también pueden incorporar hot spare, tiering, deduplicación o caché de escritura. Un repuesto que empezó a reconstruirse no se clasifica como vacío, y una caché SSD no se descarta sin saber si contenía bloques confirmados pero pendientes. Se documentan todas las capas y se mantienen sus identificadores, porque una topología incompleta puede montar un volumen antiguo y silenciosamente incoherente.

  • Anote marca, DSM/QTS/TrueNAS y versión.
  • Conserve cachés SSD y dispositivos de log.
  • No ejecute scrub sobre una matriz inestable.

ZFS y estructura de vdevs

La redundancia se aplica dentro de cada vdev, no entre todos los discos del pool. Perder el vdev equivocado puede afectar el conjunto aunque otros grupos estén sanos.

Btrfs con snapshots

Se comparan roots y generaciones para evitar elegir un árbol reciente pero incompleto. Los checksums ayudan a detectar corrupción, no a recrear por sí solos datos sin copia válida.

Un scrub verifica y a veces repara usando redundancia; cuando hay varios fallos puede aumentar lecturas y consolidar datos incorrectos.
Diagnóstico individual de cada disco antes de ensamblar la matriz

Cada disco se diagnostica antes de reconstruir el conjunto

Una matriz virtualmente correcta seguirá siendo frágil si sus imágenes contienen huecos no documentados.

Se inspeccionan SMART, respuesta, sectores, electrónica y síntomas de cada miembro. Los discos estables se adquieren completos; los inestables, por zonas y prioridades. Un HDD con cabezales dañados puede necesitar recuperación mecánica y sala limpia antes de aportar su imagen. Se registran rangos ausentes para que el algoritmo use paridad o miembros alternativos cuando sea posible. La matriz se ensambla únicamente después de comprender la calidad de todas las fuentes.

  • Imagen independiente por número de serie.
  • Mapa de errores conservado por rango.
  • Originales desconectados durante la reconstrucción.

Sectores defectuosos en miembros aparentemente sanos

Durante un rebuild salen a la luz porque se leen zonas antiguas. Adquirir antes permite decidir qué bloques reconstruir con paridad y cuáles recuperar directamente.

SSD de caché y journal

Pueden contener escrituras recientes o metadatos pendientes. No se descartan como aceleradores reemplazables hasta conocer el modo de caché y si el vaciado terminó.

Clonar todos los discos con la misma configuración ignora que uno puede tolerar lectura secuencial y otro necesitar pausas, dirección inversa o bloques menores.
RAID virtual reconstruido sin escribir en los discos del NAS

El laboratorio ensambla una matriz virtual sin escribir en el NAS

La reconstrucción es una hipótesis reproducible que se valida antes de analizar carpetas y aplicaciones.

Datastrophe carga las imágenes, aplica geometría, sustituye sectores mediante redundancia cuando procede y compara estructuras. Se conservan varias variantes si la cronología deja dudas. Sobre el volumen virtual se analizan LVM, volúmenes cifrados, sistemas de archivos y snapshots. Los datos se copian a almacenamiento sano; jamás se repara el NAS original como paso previo. El laboratorio de recuperación de datos documenta qué miembros y parámetros sustentan cada resultado.

  • Configuración reconstruida de forma repetible.
  • Variantes comparadas con archivos de control.
  • Extracción hacia un medio independiente.

Volúmenes cifrados del NAS

Se preservan cabeceras, claves exportadas y archivos de configuración. Reconstruir RAID no elimina la necesidad de una contraseña o clave válida para el volumen superior.

iSCSI y LUN virtuales

Un LUN puede contener otro sistema de archivos o discos de VM. Se mantiene su tamaño y asignación antes de estudiar la capa invitada.

El proceso de recuperación mantiene originales, imágenes y resultados en capas separadas para poder revisar decisiones.
Carpetas, máquinas virtuales y bases ordenadas por impacto operativo

Carpetas, máquinas virtuales y bases se priorizan por impacto

Un NAS alberga datos heterogéneos; la estrategia cambia según qué servicio deba volver primero.

Prepare nombres de recursos, usuarios, proyectos, bases, copias y máquinas virtuales. Para archivos se comprueban rutas, permisos y muestras; para VMDK o VHDX se conserva la cadena y puede aplicarse la recuperación de discos virtuales; para bases se validan páginas y logs. Las copias almacenadas en el mismo NAS no se consideran protección independiente. Una lista ordenada permite asegurar primero datos críticos en discos con estabilidad limitada.

En sistemas de videovigilancia o archivo continuo, la retención y la sobrescritura añaden una dimensión temporal. Se identifica qué cámaras, periodos o conjuntos contienen valor antes de recorrer todo el volumen. Para un grabador, el servicio de recuperación NVR y DVR valida además códecs, índices y marcas horarias sobre el RAID reconstruido.

  • Ordene recursos por impacto operativo.
  • Indique aplicaciones y versiones.
  • Defina fechas o RPO aceptables.

Recursos con permisos y ACL

Se preservan metadatos cuando sobreviven, pero se acuerda si la entrega requiere mantenerlos o priorizar acceso a contenidos en un entorno nuevo.

Copias históricas dentro del NAS

Se distinguen versiones, deduplicación y snapshots. Una extracción plana puede multiplicar archivos o perder relaciones; el formato de entrega se adapta a la necesidad.

Recuperar la estructura del volumen no basta si los ficheros prioritarios cruzan zonas ausentes; la validación debe llegar a la aplicación.
Inventario completo de una cabina antes de cualquier reconstrucción

Un inventario completo evita decisiones irreversibles sobre la cabina

La solicitud debe incluir tanto discos actuales como piezas retiradas y configuración disponible.

Fotografíe bahías, seriales, controladora, expansiones y mensajes; anote nivel RAID, tamaño de banda si se conoce, firmware, último estado y secuencia exacta de fallos. Conserve repuestos usados, fuentes, caché y claves. No envíe solo los discos que el NAS marca como sanos. Prepare prioridades y capacidad de destino. Puede solicitar un presupuesto con el inventario; no hace falta reiniciar para obtener información adicional.

Solicite al mantenedor el historial de sustituciones y alertas. Fechas SMART, números de serie retirados y porcentaje de rebuild ayudan a distinguir el miembro activo de un repuesto antiguo.

Antes de retirar una cabina de una oficina, estudio o centro de datos en España, detenga las aplicaciones que todavía escriben y registre qué servicios dependían del volumen. Si el sistema ya está congelado o degradado, no lo reinicie para obtener capturas más limpias. Exporte únicamente los registros disponibles sin iniciar un scrub, un rebuild o una actualización. Anote quién administraba el NAS, qué recursos SMB o NFS estaban activos, si había iSCSI, máquinas virtuales o copias externas y cuándo se confirmó por última vez una lectura correcta. Esta información ayuda a escoger la generación coherente y evita interpretar como actual un snapshot antiguo que simplemente monta sin errores visibles.

Para un envío desde la península, Baleares o Canarias, etiquete cada miembro con cabina y bahía antes de extraerlo y mantenga una tabla que relacione esa etiqueta con el número de serie. Embale los discos por separado en fundas antiestáticas, con protección rígida e inmovilización; no los apile metal contra metal ni deje bandejas, tornillos o fuentes sueltos en la misma caja. Incluya, también identificados, la controladora, módulos de caché, expansiones y repuestos retirados cuando formen parte de la topología. Las claves de cifrado y credenciales administrativas se transmiten después por un canal acordado, nunca escritas sobre los discos. Conserve el seguimiento del transporte y una copia de las fotografías.

Se priorizan recursos, periodos, bases, buzones o máquinas virtuales según su impacto y la estabilidad de los miembros. Para una empresa puede ser más útil obtener primero una base reciente y sus logs que recorrer terabytes de copias duplicadas; para videovigilancia, importan cámaras y franjas horarias; para archivo creativo, la jerarquía y los medios vinculados. Cada resultado se valida más allá del nombre: páginas de base, cadenas VMDK, duración de vídeo, checksums disponibles y muestras distribuidas por el árbol. La reconstrucción debe responder a una decisión de negocio concreta, no limitarse a mostrar un volumen montado.

Si deben conservarse permisos, propietarios, ACL, atributos extendidos o nombres con caracteres propios del español, se evita una copia genérica que los descarte. El informe separa sectores leídos, rangos reconstruidos por paridad y bloques ausentes; también indica qué geometría, miembros y generación sustentan el resultado. Un archivo presente puede seguir incompleto si cruza una franja sin datos, y una matriz virtual coherente no convierte en fiables los discos originales. La vuelta a producción exige una infraestructura nueva, verificación por los responsables y copias independientes, no el reensamblaje automático del NAS averiado. Antes de la restitución se acuerdan capacidad, formato y responsables del soporte de destino.

  • Embale cada disco con su identificador de bahía.
  • No mezcle tornillos ni bandejas entre chasis.
  • Adjunte logs existentes sin lanzar nuevos tests.

Qué se informa al finalizar

Parámetros utilizados, miembros faltantes, rangos reconstruidos, archivos validados y limitaciones quedan separados. Un resultado parcial no se presenta como volumen íntegro.

Confidencialidad de datos multiusuario

La validación se centra en recursos prioritarios y limita accesos. Se acuerdan soportes de entrega y responsables cuando el NAS contiene información de varias entidades.

Tras la extracción, la matriz averiada no se devuelve a producción; los datos validados se migran a una arquitectura sana con copias externas.

Preguntas frecuentes

Preguntas frecuentes

¿Debo cambiar el disco que el NAS marca como averiado?

No si el volumen ya está inestable o hay otro miembro con errores. Apague, etiquete bahías y conserve todos los discos. Un rebuild puede sobrescribir paridad con una fuente equivocada.

¿Se recupera un RAID 5 con dos discos fallidos?

Depende de cuánto pueda adquirirse de cada miembro, de errores adicionales y de la geometría. Se combinan imágenes y paridad por zonas; no puede garantizarse contenido de bloques físicamente ausentes.

¿Importa el orden de los discos?

Sí, aunque puede reconstruirse mediante metadatos y patrones. Fotografiar bahías y seriales reduce hipótesis y evita que el chasis importe una secuencia errónea.

¿Puedo mover los discos a otro NAS igual?

No sin diagnóstico. El nuevo equipo puede inicializar, migrar firmware o importar con parámetros distintos. Se adquieren miembros y configuración antes de probar cualquier chasis.

¿Un scrub de ZFS o Btrfs ayuda?

Solo con redundancia coherente. En una matriz con varios fallos aumenta lecturas y puede consolidar reparaciones equivocadas. Debe preservarse el estado antes de ejecutarlo.

¿Qué datos hay que enviar para evaluar un RAID?

Modelo, nivel, número y capacidad de discos, orden de bahías, controladora, secuencia de fallos, rebuilds intentados, firmware, cifrado y prioridades. Incluya también miembros retirados y cachés.

Diagnóstico

¿Duda sobre un soporte o una avería?

Datastrophe evalúa el riesgo antes de cualquier intervención y le indica el camino más prudente.

Solicitar un diagnóstico