1 open besluit1414 voorstellen

Onderwerp

Foutdomeinen en herstel

Het rek is de eenheid die als geheel mag uitvallen. Iedere kopie staat in een ander rek, en na uitval van een server of een rek is de volledige bescherming binnen 8 uur automatisch terug.

Bevestigd door vdo89 op 28 september 2026. Eigenaar: vdo89. Bron in de atlas

Domein
Volgt uit
Functies
Producten
Verwant

Wat het is

Een foutdomein is de eenheid die als geheel mag uitvallen zonder dat gegevens verloren gaan of onbereikbaar worden. In het opslagcluster is dat het rek. Iedere kopie van de gegevens staat in een ander rek, en de diensten van het opslagcluster zijn zo over de rekken verdeeld dat verlies van één rek het geheel niet stillegt. Na uitval vult het opslagcluster de ontbrekende kopieën zelf aan in de overige rekken.

Waarom zo

Drie kopieën met het rek als foutdomein geven voorspelbare prestaties voor blok- en bestandsopslag en snel, eenvoudig herstel: bij verlies van een heel rek blijven gegevens en beschikbaarheid behouden. Het vierde rek geeft daarbij de ruimte om alle drie kopieën weer terug te zetten. Voor de hersteltijd geldt één norm, 8 uur, en die wordt onder belasting gemeten.

Uitspraken

3 vastgesteld9 voorstellen

Alle 9 voorstellen vaststellen

Het rek als foutdomein

VoorstelOntwerpbesluit#

Productiepools gebruiken een gerepliceerde CRUSH-regel met het rek als foutdomein en een vast toegekende apparaatklasse, in plaats van de standaardregel met de server als foutdomein. De CRUSH-hiërarchie volgt de fysieke opstelling: datacenter, rek, server.

VoorstelRegel#

De datacenterregistratie legt vast welke server in welk rek staat, twee opslagknooppunten per rek. Zij is de bron voor het foutdomeinmodel en wordt vóór de installatie tegen de fysieke opstelling gecontroleerd.

Kopieën

VoorstelOntwerpbesluit#

Pools zijn gerepliceerd met size 3 en min_size 2: drie kopieën, elk in een ander rek. Vanuit een gezonde toestand blijft schrijven mogelijk bij verlies van één rek.

Toelichting

Erasure coding is goedkoper in capaciteit, maar geeft hogere latentie en zwaarder herstel voor blok- en bestandsopslag; het blijft een optie voor de laag ‘bulk’. Met twee kopieën is er na verlies van een rek geen reserve meer, en met de server als foutdomein kan één rek twee kopieën tegelijk raken.

VoorstelRegel#

Een pool met één kopie is niet toegestaan. Twee kopieën, of codering met pariteit voor objectopslag, kunnen alleen als uitzondering: met een ontwerpbesluit, risicoacceptatie en draaiboeken, en met een eigen pool, opslagklasse en einddatum.

Diensten over de rekken

VoorstelRegel#

Er zijn vijf monitors over de vier rekken, ten hoogste twee per rek, zodat na verlies van één rek het quorum van drie van de vijf intact blijft. Van de andere diensten, ook de objectgateways per realm, staan ten minste twee exemplaren in verschillende rekken. De beschikbaarheid van de objectgateways volgt niet uit het quorum en wordt apart beproefd.

Hersteltijd

VoorstelRegel#

Na uitval van een opslagknooppunt of een heel rek is de volledige bescherming binnen 8 uur automatisch hersteld, gemeten onder belasting bij de hoogste toegelaten vulling. Met de schijven van de eerste levering duurt herstel van een knooppunt circa 1,8 uur.

VoorstelRegel#

HDD haalt de norm van 8 uur niet: herstel van een server met HDD duurt volgens de berekening ruim 50 uur. HDD is daarom alleen bruikbaar in de laag ‘bulk’, met een eigen hersteleis.

VoorstelMaatregel#

De uitvalproef van een knooppunt en, na volledig herstel, van een heel rek toont aan dat alle gekoppelde clusters blijven werken, zonder gegevensverlies, voor blok-, bestands- en objectopslag in iedere realm.

VoorstelUitgangspunt#

Een defecte schijf of server wordt vervangen terwijl het opslagcluster doordraait, waarna de kopieën automatisch worden aangevuld. Een uitbreiding wordt eerst zonder gegevens opgenomen en beproefd, en teruggedraaid als zij de hersteltijd niet haalt.

Verwijzen hiernaar

Onderwerpen 2
Clusters 1
Besluiten 1