Récupération de données
Récupération de données dans la Loire
Dans la Loire, arrêtez les écritures GlusterFS, la réparation forcée et le rééquilibrage. Conservez les briques, les fichiers de volume, les attributs étendus, les journaux, l’état des pairs et l’ordre des réplications. Le laboratoire acquiert chaque nœud sur une copie, puis reconstruit et valide un corpus cohérent.
Diagnostic et devis
Diagnostiquer les briques sans déclencher de heal
Le diagnostic distingue une panne physique, un ensemble RAID dégradé, une brique absente, une divergence de réplication, un attribut étendu incohérent, un fichier de volume perdu, un pair déconnecté, un quorum insuffisant, une réparation interrompue et une copie cliente obsolète. Une même erreur de montage peut recouvrir plusieurs causes.
Les duplications sont examinées pour relever les GFID, les chemins, les tailles, les dates, les attributs, les journaux, les versions de configuration et les états des pairs. La chronologie rapproche l’incident, la dernière écriture fiable, les opérations de maintenance et les essais déjà tentés.
- Disques durs de nœuds GlusterFS contenant briques, xattrs, journaux et fichiers utilisateurs
- SSD hébergeant système, métadonnées, briques rapides ou machines virtuelles clientes
- Disques externes portant exports de briques, sauvegardes isolées ou copies de configuration
- NAS et ensembles RAID placés sous les briques ou utilisés comme destination secondaire
Attention
Éviter heal, rebalance et écriture propagée
- Ne remontez pas les clients en lecture-écriture
- Ne lancez pas de heal forcé sur les briques concernées
- Ne lancez ni rebalance ni modification de topologie
- N'ajoutez, ne retirez et ne remplacez aucune brique
Toute opération susceptible de propager une version, modifier les xattrs ou réorganiser les briques reste différée jusqu'à la création de copies protégées. La priorité est de conserver chaque état avant le rapprochement.
Comment ça marche
Des briques figées aux versions contrôlées
- Suspendez les écritures des clients, les montages automatiques, la réparation forcée, le rééquilibrage, l’ajout ou le retrait d’une brique et le remplacement d’un nœud. Notez l'heure de l'incident, le dernier accès cohérent, les erreurs et les commandes déjà exécutées.
- Inventoriez, sans les renommer, les briques, les volumes, les fichiers de volume, les attributs étendus, les journaux, les pairs, les règles de quorum, l’arbitre, les certificats, les scripts et les copies répliquées. Étiquetez chaque support avec son nœud, son chemin, sa provenance et sa période supposée.
- Le laboratoire qualifie séparément les HDD, les SSD, les disques externes, les NAS, les ensembles RAID, les serveurs et la mémoire flash. Une panne physique, une divergence de réplication, un attribut étendu manquant et un quorum perdu n'imposent pas le même protocole. La salle blanche ne concerne qu'un HDD mécanique dont l'ouverture est justifiée.
- Chaque stockage accessible est dupliqué avec contrôle d’intégrité avant l’analyse distribuée. Le relevé conserve l’emplacement du nœud, le chemin de la brique, sa place dans l’ensemble RAID et son rôle de réplication. Les originaux restent ainsi immobiles pendant la comparaison des états GlusterFS.
Nos expertises
Supports et composants examinés autour de GlusterFS
Préparer le devis
Préparer le volume sans heal ni rééquilibrage
Une préparation stable protège les différences entre briques et réplicas. Toute opération distribuée attend la création de copies contrôlées.
- À suspendre: les clients, la réparation, le rééquilibrage et les changements de briques
- Noter l'heure de l'incident et les opérations tentées
- À identifier: la version de GlusterFS, les volumes et la topologie
- Photographier les baies et étiqueter chaque nœud
- À conserver: les fichiers de volume, les attributs étendus, les journaux et les états des pairs
Notre expertise
Une méthode centrée sur les versions réellement vérifiables
GlusterFS distribue un même espace logique entre plusieurs briques. Les fichiers de volume décrivent la topologie, les attributs étendus relient les objets aux GFID, les journaux de réparation suivent les divergences, tandis que le quorum et l’arbitre influencent les décisions d'écriture. Une brique isolée ne représente donc pas le volume complet.
Le heal et le rebalance sont utiles en exploitation normale, mais deviennent risqués après un incident. Ils peuvent propager une version incomplète, modifier les répartitions ou effacer les indices d'un split-brain. Les clients et services automatiques sont suspendus avant la collecte.
- Clients
- Suspendre les écritures
- Briques
- Étiqueter les composants concernés: nœuds et chemins
- Xattrs
- À conserver: GFID et versions
- Contrôle
- À comparer: sur des copies
Prise en charge
Préparer un volume GlusterFS depuis la Loire
Dans la Loire, Datastrophe ne déclare ni agence ni laboratoire local: le département est une zone desservie. Une demande GlusterFS est préparée en associant chaque support à son nœud et à sa brique avant son acheminement vers le laboratoire Datastrophe, seul chargé du diagnostic et de la récupération.
Laissez les nœuds arrêtés si des erreurs matérielles sont présentes. Photographiez les baies, étiquetez chaque disque, serveur et chemin de brique, puis notez les connexions. Ne reconstruisez pas un RAID et ne remplacez pas plusieurs membres successivement.
Réplicas à comparer
Rapprocher briques, xattrs, heal, quorum et versions
Le périmètre utile comprend les briques, les fichiers de volume, les GFID, les attributs étendus, les journaux de réparation, l’état des pairs, les règles de quorum, l’arbitre, les certificats, les scripts et les copies secondaires. Chaque élément conserve son nœud et sa provenance.
Le nœud le plus récent n'est pas toujours le plus complet. Il peut avoir reçu une écriture partielle ou un heal après l'incident. Dates, tailles, xattrs et journaux servent à comparer plusieurs états avant de sélectionner une version de référence.
- Briques À préserver: les nœuds, les chemins et les supports.
- Xattrs À comparer: les GFID et les états des fichiers.
- Heal À conserver: les journaux sans déclencher de propagation.
Carte
Orientation dans la Loire selon volume et supports
FAQ
Questions fréquentes sur GlusterFS
Faut-il lancer un heal pour voir les fichiers?
Non sur les briques sources. Un heal peut propager une version incomplète. Les états sont d'abord acquis et comparés sur des copies de travail.
Une brique lisible suffit-elle à reconstruire le volume?
Non. Les autres répliques, les attributs étendus, les GFID, les fichiers de volume et les règles de quorum doivent correspondre. La cohérence se valide fichier par fichier et par ensemble.
Peut-on remonter le volume en lecture seule?
Pas avant qualification de la topologie et duplication des supports. Certains montages ou services déclenchent des écritures auxiliaires ou des opérations de heal.
Pourquoi conserver des réplicas divergents?
Chaque copie peut porter une partie plus récente ou plus complète. Les écraser supprimerait les indices utiles à la sélection de version.
Diagnostic et devis
Faire qualifier les briques avant une nouvelle remise en ligne
Pour préparer l’analyse, associez à chaque nœud son volume, ses chemins de briques, son rôle de réplication et l’état de ses attributs étendus. Ajoutez les règles de quorum, la chronologie des erreurs et les commandes déjà exécutées: le laboratoire pourra alors comparer les versions sans faire du nœud le plus récent une référence arbitraire.