RAID en NAS

Waarom een rebuild vaker fataal is dan de eerste storing

Een RAID-set verdraagt de uitval van één schijf. Wat hij vaak niet verdraagt, is de poging daarvan te herstellen. In de praktijk is de rebuild een van de meest voorkomende oorzaken van definitief dataverlies.

Wat redundantie werkelijk betekent

Een RAID met redundantie verdeelt de gegevens zo over meerdere schijven dat uit de overgebleven schijven te reconstrueren valt wat er op een uitgevallen schijf stond. Bij RAID 5 verdraagt de set één ontbrekende schijf, bij RAID 6 twee.

Belangrijk is het woord „verdraagt". Na een uitval draait het systeem door, maar zonder reserve. Het is op dat moment geen set met uitvalzekerheid meer, maar een stapel schijven waarbij de volgende fout doorslaat. Precies in die toestand wordt gewoonlijk een rebuild gestart.

Waarom er juist dan iets misgaat

  • De rebuild is de zwaarste belasting in het leven van een schijf

    Om een ontbrekend lid te reconstrueren moet elke overgebleven schijf volledig worden gelezen — bij de huidige capaciteiten uren- tot dagenlang achter elkaar, zonder pauze. Een schijf die in het dagelijks gebruik niet opviel omdat hij maar af en toe werd aangesproken, laat zich onder deze duurbelasting kennen.

  • De schijven zijn even oud en van dezelfde herkomst

    Een set wordt in de regel in één keer gekocht en gevuld. De schijven komen daarmee uit dezelfde productieserie, hebben dezelfde bedrijfsuren en dezelfde omgevingsomstandigheden achter de rug. Sterft er één van ouderdom, dan zijn de andere niet ver weg.

  • Eén enkele onleesbare sector volstaat

    Bij een rebuild moet werkelijk elke sector worden gelezen — ook de sectoren die jarenlang niemand heeft aangeraakt. Duikt daarbij op een van de overgebleven schijven een onleesbare plek op, dan breekt het proces af. Bij een RAID 5 zonder reserve betekent dat: de set is offline.

  • De rebuild schrijft

    En hij schrijft over de aanwezige redundantie heen. Loopt hij halverwege vast, dan is de toestand daarna slechter dan ervoor — de oude pariteitsinformatie is deels vervangen door nieuwe die op onvolledige gegevens berust.

De kern in één zin

De rebuild belast juist die schijven maximaal waarvan u op dat moment volledig afhankelijk bent.

Wat u in plaats daarvan moet doen

  1. 01

    Afsluiten

    Netjes uitschakelen. Een gedegradeerd systeem dat doordraait, blijft schrijven — en elke schrijfbewerking verkleint de speelruimte.

  2. 02

    Markeren

    Voorzie elke schijf vóór het uitnemen van zijn slotnummer. De volgorde hoort bij de informatie waaruit de set te reconstrueren is.

  3. 03

    Niets bevestigen

    Ga niet in op verzoeken om te initialiseren, te formatteren of een vreemde configuratie over te nemen. Voer geen bestandssysteemcontrole uit.

  4. 04

    Een diagnose laten stellen

    Eerst wordt elk lid afzonderlijk en schrijfbeveiligd veiliggesteld. Daarna wordt de set uit de kopieën nagebouwd — offline, zonder dat de originelen daarbij worden beschreven.

Hoe een reconstructie verloopt

Een set is meer dan een verzameling schijven. Om daaruit weer een samenhangend bestandssysteem te laten ontstaan, moeten vier dingen kloppen: de grootte van de blokken die om beurten zijn beschreven; de volgorde van de schijven; het patroon waarmee de pariteitsinformatie van schijf naar schijf wandert; en de verschuiving vanaf waar dat alles begint.

Bij sommige systemen staan die waarden in beheergegevens op de schijven zelf — bij andere niet, of ze zijn beschadigd. Dan worden ze uit de gegevens afgeleid: men probeert combinaties tegen de kopieën en controleert welke een geldig bestandssysteem oplevert. Dat is rekenwerk, geen gokwerk, en het gebeurt uitsluitend op de kopieën.

En ransomware?

Netwerkopslag is een geliefd doelwit. Wat in zulke gevallen helpt, is de bouwwijze van sommige bestandssystemen: bij een wijziging overschrijven ze niets, maar schrijven ze een nieuwe versie en houden ze de oude zolang er ruimte is. Uit zulke oudere toestanden valt soms een situatie van vóór de besmetting te halen.

Of dat lukt, hangt af van hoeveel er sinds het voorval is geschreven. Ook hier geldt daarom: systeem uitschakelen, niets wissen, niets nieuws aanmaken.

Veelgestelde vragen

Kort beantwoord.

Mijn NAS meldt dat een schijf is uitgevallen en biedt de rebuild aan. Zal ik?

Zijn de gegevens belangrijk en is er geen actuele back-up: nee. Stel eerst veilig wat nog bereikbaar is — of laat de set onderzoeken. De rebuild is de maatregel met het hoogste risico op precies het moment waarop u zich er geen kunt veroorloven.

Ik heb de rebuild al gestart en hij is afgebroken. Is alles verloren?

Niet per se. Ook uit een deels overschreven set valt vaak nog te reconstrueren. Belangrijk is nu niets verder te proberen en het systeem uitgeschakeld te laten.

Telt RAID als back-up?

Nee. Een set beschermt tegen de uitval van één schijf — niet tegen per ongeluk wissen, ransomware, diefstal, brand of een fout in het systeem zelf. Dat alles treft alle schijven tegelijk.

Een concreet geval?

Wij bekijken uw gegevensdrager.

De Economy-diagnose is kosteloos. U hoort wat er mogelijk is voordat er iets kost — en wat het zou kosten, staat vooraf zwart op wit vast.

Wasserweg 8–10 · 60594 Frankfurt am Main