Noodtoegang, sleutels, installatiebestanden en herstelgegevens staan buiten de cel, zodat beheerders na ernstige uitval zonder de getroffen cel kunnen werken. Het herstel begint bij netwerk, naam- en tijdvoorziening en toegang, die niet van de getroffen cel mogen afhangen; daarna volgen de basisdiensten, waaronder de softwaredistributie met haar registratie en toegang, en pas dan de overige diensten en toepassingen. Het herstel van een volledige dienst wordt beproefd met alle benodigde voorzieningen.
Onderwerp
Opstart, herstel en overname
Nog niet bevestigd door een mens. Eigenaar: vdo89. Bron in de atlas
- Domein
- Volgt uit
- Functies
- Producten
- Verwant
Wat het is
Herstel begint buiten de getroffen cel: bij netwerk, naam, tijd en toegang, dan de basisdiensten en pas daarna de overige diensten. Een cel start en herstelt in negen vaste stappen, bij een koude start en bij herstel uit code en back-up.
Een bedrijfskritische dienst heeft een tweede exemplaar in de andere cel en gaat daar gecontroleerd naartoe: eerst wordt de oude schrijvende kant uitgesloten, dan wordt het tweede exemplaar leidend.
Waarom zo
Wie na ernstige uitval of een aanval moet herstellen, mag niet afhangen van de cel die is getroffen. Daarom liggen noodtoegang, sleutels, installatiebestanden en herstelgegevens buiten de cel en is de volgorde van opstart en herstel expliciet. Omdat per dienst op ieder moment één cel schrijft en overname nooit automatisch gaat, ontstaan bij een verbindingsstoring geen twee leidende omgevingen of tegenstrijdige gegevens.
De negen stappen, het continuïteitsplan en de uitvoering van de overname werken dat uit. Dit voorstel houdt iedere stap afhankelijk van wat buiten de getroffen cel beschikbaar is.
Herstel begint buiten de cel
De herstelkern ligt in de onveranderbare opslag van de back-upvoorziening van RWS en op offline media in de kluis; de koude reserveserver en de reserve van de andere cel leveren de schone rekencapaciteit. Herstel zonder gezonde cel wordt in groeipadstap 2 uitgevoerd en gemeten, in de toets herstel na een aanval.
De herstelomgeving wordt opgebouwd uit de reserve van de andere cel dan de getroffen en na gebruik verwijderd; zonder gezonde cel begint het herstel bij de herstelkern. In de eerste levering, met één cel, herstelt cel 1 in haar eigen reserve.
De naam- en tijdvoorziening, de ontgrendelvoorziening, de noodtoegang en de herstelkern zijn bruikbaar zonder de getroffen cel.
Toelichting
Aangetoond in de proef met een koude start en in de toets herstel na een aanval.
Opstart- en herstelvolgorde
Een koude start van een hele cel en een herstel uit code en back-up volgen dezelfde negen stappen; iedere stap begint pas als de vorige gereed is. Bij een koude start mogen het basisdienstencluster en het opslagcluster naast elkaar starten, en wachten werkervirtualisatie en clusterbeheer niet op het vlootcluster, omdat clusters zonder vlootbeheer doorwerken.
Toelichting
De volgorde volgt uit het uitgangspunt dat herstel buiten de cel begint, en is de basis van het continuïteitsplan.
Een cel start en herstelt in deze volgorde.
| Stap | Onderdeel | Hangt af van | Gereed wanneer |
|---|---|---|---|
| 1 | Stroom, fabric en firewalls | Stroom en koeling | Routeringsdomeinen en zoneregels actief |
| 2 | Naam, tijd en ontgrendeling | Stap 1; koppeling met het RWS-netwerk | Naamvoorziening, twee tijdbronnen en de ontgrendelvoorziening buiten de cel bereikbaar |
| 3 | Beheertoegang | Stap 1 en 2 | Noodwerkplek met noodtoegang uit de kluis; servermanagement via het apparatuurbeheer |
| 4 | Basisdienstencluster, diensten op lokale opslag | Stap 2 en 3; containerbeelden op de knooppunten of uit de herstelkern; niet het opslagcluster | Geheimenbeheer ontgrendeld; bij een koude start werken ook toegangsvoorziening en identiteitsbeheer met hun databases |
| 5 | Opslagcluster | Stap 1 en 2 | Quorum van de monitors, schijven ontgrendeld, HEALTH_OK of een verklaarde verstoorde toestand |
| 6 | Overige basisdiensten, eerst het versiebeheer; bij herstel uit back-up daarna toegangsvoorziening en identiteitsbeheer | Stap 4 en 5 | Alle basisdiensten werken; beheer loopt weer via de beheerwerkplek; de gebruikte noodtoegang is vervangen |
| 7 | Vlootcluster, bij de cel waarvan het afhangt | Stap 5 en 6 | Beheerde clusters verbonden; nalevingsoverzicht actueel |
| 8 | Werkervirtualisatie en clusterbeheer | Stap 5 en 6 | Gehoste besturingen gezond; virtuele werkers gestart |
| 9 | Applicatieclusters en diensten | Stap 8 | Eerst de leidende exemplaren van bedrijfskritische diensten, dan reguliere productie, dan ontwikkelen en beproeven; gecontroleerd langs het gebruikerspad |
Een koude start zet de bestaande inrichting weer aan; dat is iets anders dan terugzetten uit een back-up. Bij herstel komen beelden, installatiebestanden en sleutels uit de herstelkern of de onveranderbare kopie.
Na een compromittering is geen cel meer te vertrouwen. Het herstel begint vanuit de herstelkern, bij het beheer zelf; het basisdienstencluster wacht op een nieuwe tussen-CA van PKI-beheer, en daarna worden alle geheimen en sleutels van de getroffen cel vervangen.
Ieder platformcluster en iedere cel zijn uit code opnieuw op te bouwen; de opbouw van een hele cel wordt in groeipadstap 2 beproefd.
Toelichting
Nodig voor herstel na aantasting. Aangetoond in de opbouwproef en in de toets herstel na een aanval.
Continuïteitsplan
Een cel start en herstelt in de vastgelegde volgorde. Het continuïteitsplan van het platform, aangesloten op de RWS-continuïteitsplanning, bevat die volgorde met de gemeten hersteltijd per stap en is vóór de vrijgave voor reguliere productie vastgesteld.
Toelichting
De volgorde wordt jaarlijks beproefd. De hersteltijd van een hele cel en van herstel zonder gezonde cel wordt in groeipadstap 2 gemeten.
Zolang cel 2 er niet is, vallen met AM4 ook het vlootbeheer, het versiebeheer en de herstelomgeving uit, en de schone capaciteit voor herstel zonder gezonde cel. Het herstel begint dan bij de herstelkern op vervangende servers van dezelfde typen; de hersteltijd omvat de levering van die servers.
Toelichting
Het continuïteitsplan bevat de herkomst van de vervangende servers en de hersteltijd van dit scenario.
Een dienst gaat pas naar het profiel reguliere productie als haar bedrijfsimpactanalyse de hersteltijd uit het continuïteitsplan verdraagt, ook die bij verlies van AM4 vóór groeipadstap 2.
Toelichting
Zo past het profiel bij de samenstelling. Gecontroleerd in het vrijgavedossier.
Overname tussen de cellen
Bij bedrijfskritische productie ligt per gegevensdienst vast welk exemplaar wijzigingen verwerkt, hoe het andere wordt bijgehouden en welk deel bij verbindingsverlies blijft schrijven: op ieder moment schrijft per dienst één cel. Dat voorkomt tegenstrijdige gegevens en twee leidende omgevingen.
Overname is een gecontroleerde handeling van platformbeheer volgens het draaiboek van de dienst, nooit automatisch: eerst wordt de oude schrijvende kant uitgesloten door haar netwerk- en opslagtoegang in te trekken, daarna wordt het tweede exemplaar leidend. Bij twijfel over die uitsluiting wordt niet overgenomen; de terugkeer is een aparte, even gecontroleerde stap. Overname hervat de dienstverlening; de uitgevallen clusterbesturing wordt afzonderlijk hersteld.
Toelichting
Afgewezen: automatische overname of twee schrijvende cellen. Die geven bij een asymmetrische storing twee leidende omgevingen en tegenstrijdige gegevens.
Per bedrijfskritische dienst staan de schrijvende cel, het herstelpunt en de hersteltijd in de dienstbeschrijving. De overname wordt per bedrijfskritische dienst beproefd, ook bij een asymmetrische verbindingsstoring, in de toets herstel na een aanval en in de opbouwproef van groeipadstap 2.
Toelichting
Eigenaar: de diensteigenaar en platformbeheer.
Het tweede exemplaar van een bedrijfskritische dienst is een eigen applicatiecluster in de andere cel, met capaciteit, gegevens, toegang en verbindingen, eigen geheimen en geen gedeeld segment met het eerste. De diensteigenaar en platformbeheer besluiten over de overname, bij een calamiteit binnen de crisisorganisatie van de RWS-continuïteitsplanning.
De automatisering van de ontvangende cel voert de overname uit met de laatst gesynchroniseerde versie van het draaiboek van de dienst: gegevensdienst leidend maken, de dienstnaam naar de ontvangende cel omzetten en verbindingen binnen de zoneregels openen. Uitsluiting gebeurt met de rechten van de getroffen cel, via haar beheerwerkplek of noodtoegang; is die cel onbereikbaar, dan sluiten netwerkbeheer en platformbeheer haar stromen af op de firewalls en de koppeling. De overname hangt niet af van vlootbeheer, versiebeheer of basisdiensten van de getroffen cel, en wat daarbij buiten versiebeheer wijzigt, is binnen 1 werkdag in code vastgelegd.
Toelichting
Gevolg: de draaiboeken zijn in beide cellen gesynchroniseerd. Aangetoond met een overnameproef waarin cel 1 onbereikbaar is.
Een vlootbrede voorziening wordt in de andere cel pas actief na uitsluiting van het oude exemplaar; nooit beheren twee vlootclusters dezelfde clusters.
Toelichting
Zo is er geen dubbel beheer. Aangetoond in de herstelproef van het vlootbeheer.
Verlies van de koppeling tussen de cellen is op zich geen grond voor overname: beide cellen werken zelfstandig door, overname volgt alleen na vastgestelde uitval, en na herstel van de koppeling wordt de replicatie gecontroleerd.