Iedere kerntaak heeft een eigen cluster, dat in eigen tempo groeit en verandert: werkercapaciteit en besturing schalen los van elkaar. Een wijziging aan het clusterbeheer wordt alleen daar uitgevoerd, maar raakt de gehoste besturingen van de hele cel. Daarom is het aantal varianten beperkt, zijn er vaste werkwijzen voor uitrol, onderhoud en herstel, en gaat iedere bredere uitrol via een proefgroep; bij een wijziging aan clusterbeheer, werkervirtualisatie of basisdienstencluster omvat de proef ook de afhankelijke applicatieclusters.
Onderwerp
Foutdomeinen, rekindeling en uitval
Nog niet bevestigd door een mens. Eigenaar: vdo89. Bron in de atlas
- Domein
- Volgt uit
- Functies
- Producten
- Verwant
Wat het is
Binnen een cel is het rek het foutdomein: de servers van ieder cluster staan zo over de vier rekken verdeeld dat uitval van één rek geen cluster stillegt. Iedere kerntaak heeft een eigen cluster, en uitval heeft per laag een ander gevolg, van het portaal, het vlootbeheer of één clusterbesturing tot een rek, een cel of een heel datacenter.
Waarom zo
Bij een storing telt niet alleen of een toepassing bereikbaar blijft, maar ook of herstarten, verplaatsen en opschalen nog kunnen. Door besturing en opslag over de rekken te spreiden en ieder rek dezelfde mix te geven, verliest ieder cluster bij een rekuitval ten hoogste één knooppunt en houdt het zijn quorum.
De rekindeling, de indeling van cel 2 en het foutdomeinmodel werken die hoofdlijn uit; het zijn voorstellen, afgestemd op de poortplanning van het datacenternetwerk en op de reserve per cluster.
Onderhoud per functie
Uitval per laag
Bij een storing telt niet alleen of een toepassing bereikbaar blijft, maar ook of herstarten, verplaatsen en opschalen nog kunnen, zodat het werk kan doorgaan. Uitval heeft per laag andere gevolgen.
| Uitgevallen laag | Gevolg | Wat blijft werken |
|---|---|---|
| Portaal | De aanvraagroute ligt stil. | Bestaande toepassingen, zolang hun eigen voorzieningen beschikbaar zijn; urgente wijzigingen lopen via de noodroute, met dezelfde beoordeling en vastlegging als via het portaal. |
| Vlootbeheer | Centrale wijzigingen kunnen tijdelijk niet worden uitgerold. | Alle clusters behouden hun besturing en hun laatst toegestane inrichting; een gecompromitteerd vlootbeheer is een apart scenario. |
| Clusterbesturing van een team | Verplaatsen, opschalen en nieuw uitrollen zijn niet mogelijk; een werker herstart alleen zijn eigen, al toegewezen containers. | Bestaande processen blijven draaien zolang hun voorzieningen niet wijzigen; de gehoste besturing wordt los van de andere besturingen hersteld. |
| Eén rek van het opslagcluster | Eén van de drie kopieën van de gegevens ontbreekt. | Alle opslag blijft beschikbaar zolang de overige rekken gezond zijn en ruimte hebben; de volledige bescherming is binnen acht uur terug, gemeten onder belasting. |
| Beheercel of datacenter | Alle diensten in de getroffen cel vallen uit. | Bedrijfskritische diensten gaan gecontroleerd over naar hun tweede exemplaar in de andere cel; de overige diensten worden hersteld volgens hun dienstprofiel. |
Binnen één cel hebben besturing, uitvoering en opslag verschillende uitvalgrenzen. Iedere rij veronderstelt alleen de genoemde storing; andere afhankelijkheden, waaronder identiteit en netwerk, blijven gelden.
| Storing | Besturing op het clusterbeheer | Uitvoering op de werkervirtualisatie | Opslag op het opslagcluster |
|---|---|---|---|
| Eén werkerknooppunt van het clusterbeheer weg | Twee van de drie etcd-stemmers blijven over: het quorum blijft en de onderbreking van de API wordt gemeten. | Gezonde bestaande processen blijven draaien. | Niet geraakt. |
| Het hele clusterbeheer weg | API, nieuw uitrollen, opnieuw plannen en opschalen zijn niet beschikbaar. | Bestaande processen lopen door zolang hun overige afhankelijkheden gezond zijn. | De gegevens zijn niet door deze storing verdwenen. |
| Opslagcluster onbereikbaar | Etcd van de gehoste besturingen gebruikt lokale volumes op het clusterbeheer. | Systeemschijven van virtuele machines en applicatievolumes kunnen hun I/O verliezen; de dienst is niet als beschikbaar te veronderstellen. | De gedeelde opslag is geraakt; lokale database-replica’s lossen dat niet op. |
Het rek als foutdomein
De servers van ieder cluster staan verdeeld over de vier rekken van de cel: de besturing over drie rekken, werkerknooppunten over drie of vier en opslagknooppunten over alle vier. Uitval van één rek legt daardoor geen cluster stil.
Toelichting
Afgewezen: ieder cluster in een eigen rek. Eén rekuitval legt dan een heel cluster stil.
Ieder rek heeft dezelfde mix, gelijk aan de poortplanning van het datacenternetwerk, en van ieder cluster staat ten hoogste één besturingsknooppunt in een rek; dat geldt ook bij groei. Rekuitval kost ieder cluster daardoor ten hoogste één knooppunt.
Toelichting
Na uitval van één rek houdt ieder cluster twee van zijn drie besturingsknooppunten en daarmee zijn quorum. Het clusterbeheer verliest ten hoogste één werkerknooppunt, zijn reserve; de werkervirtualisatie één van vier, haar reserve; het opslagcluster herstelt over de drie andere rekken. Gecontroleerd in de registratie en met de rekuitvalproef.
De rekindeling van cel 1 in AM4 geeft ieder rek drie besturingsknooppunten, twee werkerknooppunten of reserveservers en twee opslagknooppunten.
| Rek | Besturingsknooppunten | Werkerknooppunten | Opslagknooppunten |
|---|---|---|---|
| r01 | vl-01, c1-cb-01, c1-vw-01 | c1-cb-01, c1-vw-01 | 2 van c1-os-01 |
| r02 | vl-01, c1-bd-01, c1-cb-01 | c1-cb-01, c1-vw-01 | 2 van c1-os-01 |
| r03 | c1-bd-01, c1-cb-01, c1-vw-01 | c1-cb-01, c1-vw-01 | 2 van c1-os-01 |
| r04 | vl-01, c1-bd-01, c1-vw-01 | c1-vw-01 en de koude reserveserver | 2 van c1-os-01 |
Toelichting
De namen: vl-01 is het vlootcluster, c1-bd-01 het basisdienstencluster, c1-cb-01 het clusterbeheer, c1-vw-01 de werkervirtualisatie en c1-os-01 het opslagcluster van cel 1.
Cel 2 volgt dezelfde indeling zonder het vlootcluster, met een eigen koude reserveserver: 25 servers. Daar komen de extra werkerknooppunten van de werkervirtualisatie bij, voor het hersteldoel van het vlootbeheer en de capaciteit voor bedrijfskritische diensten; die staan in twee van de rekken waar het vlootcluster in cel 1 staat.
Toelichting
Aangetoond bij de opbouw van cel 2.
Groeit het clusterbeheer, dan komen nieuwe werkerknooppunten in de drie rekken van het clusterbeheer, bij zes twee per rek. Iedere gehoste besturing houdt haar drie exemplaren in drie rekken, en de koude reserveserver blijft in rek r04.
De koude reserveserver staat zonder stroom in het rek zonder ander knooppunt van het clusterbeheer, ook na groei, zodat één rekuitval niet een actief knooppunt én zijn vervanger treft. Na inzet neemt een gewist, hersteld of nieuw knooppunt haar plaats in.
Toelichting
Gecontroleerd in de registratie en bij iedere inzet.
Foutdomeinmodel
Per niveau, van server tot het beheer zelf, liggen de exemplaren, het gedrag bij uitval en het herstel vast.
| Niveau | Exemplaren en plaatsing | Gedrag bij uitval | Herstel |
|---|---|---|---|
| Server, netwerkkaart of leaf | Ieder cluster ten minste drie knooppunten; één bundel over het leaf-paar; één beheer-leaf per rek | Het cluster werkt door; een kaartstoring is een serveruitval; uitval van een poort of leaf onderbreekt geen verbinding blijvend | Vervanging met het serverprofiel; voor het clusterbeheer de koude reserveserver |
| Rek | Volgens de rekindeling | Ieder cluster verliest ten hoogste één besturingsknooppunt; de opslagbescherming is binnen acht uur terug | Knooppunten terug; capaciteitsgrenzen opnieuw beoordeeld |
| Platformcluster | Eén per soort per cel | Volgens de kerntaak van het cluster en de gevolgen van uitval per laag; de andere cel wordt niet geraakt | Volgens het ontwerp van het cluster en de opstart- en herstelvolgorde |
| Cel of datacenter | Eén cel per datacenter | Alle diensten van de cel vallen uit; bedrijfskritische diensten gaan over naar de andere cel | Volgens de opstart- en herstelvolgorde; reguliere productie met herstart en gegevensherstel |
| Vlootbeheer | vl-01, in de eerste levering afhankelijk van cel 1 | Clusters houden hun laatst uitgerolde inrichting; centrale wijzigingen, ondertekening en vlootoverzicht wachten | Uit de eigen back-up na uitsluiting van het oude exemplaar; vanaf groeipadstap 2 in cel 2 |
| Koppeling tussen de cellen | Gerouteerd, met MACsec | Iedere cel werkt zelfstandig door; replicatie wacht | Het vlootbeheer pakt de andere cel daarna automatisch op |
| Gedeelde RWS-voorzieningen | Naam, tijd, PKI met hardwaresleutelmodule, identiteitsbronnen (RWS-HR en directory) en back-upvoorziening | Kunnen beide cellen raken | Volgens de dienstafspraak met de leverende RWS-dienst |
| Beheer zelf | Vlootbrede rollen onder aparte maatregelen | Na compromittering is geen cel meer te vertrouwen | Vanuit de herstelkern, beginnend bij het beheer |
Bij uitval van een rek is geen ingreep nodig zolang ieder cluster zijn quorum heeft. Na terugkeer gaan de knooppunten terug in hun cluster en worden de capaciteit en de capaciteitsgrenzen gecontroleerd.