1 open besluit1414 voorstellen

Onderwerp

Opstart, herstel en overname

Hoe een cel opstart en herstelt, beginnend buiten de getroffen cel, en hoe een bedrijfskritische dienst gecontroleerd overgaat naar de andere cel, met op ieder moment één schrijvende cel.

Nog niet bevestigd door een mens. Eigenaar: vdo89. Bron in de atlas

Domein
Volgt uit
Functies
Producten
Verwant

Wat het is

Herstel begint buiten de getroffen cel: bij netwerk, naam, tijd en toegang, dan de basisdiensten en pas daarna de overige diensten. Een cel start en herstelt in negen vaste stappen, bij een koude start en bij herstel uit code en back-up.

Een bedrijfskritische dienst heeft een tweede exemplaar in de andere cel en gaat daar gecontroleerd naartoe: eerst wordt de oude schrijvende kant uitgesloten, dan wordt het tweede exemplaar leidend.

Waarom zo

Wie na ernstige uitval of een aanval moet herstellen, mag niet afhangen van de cel die is getroffen. Daarom liggen noodtoegang, sleutels, installatiebestanden en herstelgegevens buiten de cel en is de volgorde van opstart en herstel expliciet. Omdat per dienst op ieder moment één cel schrijft en overname nooit automatisch gaat, ontstaan bij een verbindingsstoring geen twee leidende omgevingen of tegenstrijdige gegevens.

De negen stappen, het continuïteitsplan en de uitvoering van de overname werken dat uit. Dit voorstel houdt iedere stap afhankelijk van wat buiten de getroffen cel beschikbaar is.

Uitspraken

6 vastgesteld13 voorstellen

Alle 13 voorstellen vaststellen

Herstel begint buiten de cel

VastgesteldUitgangspunt#

Noodtoegang, sleutels, installatiebestanden en herstelgegevens staan buiten de cel, zodat beheerders na ernstige uitval zonder de getroffen cel kunnen werken. Het herstel begint bij netwerk, naam- en tijdvoorziening en toegang, die niet van de getroffen cel mogen afhangen; daarna volgen de basisdiensten, waaronder de softwaredistributie met haar registratie en toegang, en pas dan de overige diensten en toepassingen. Het herstel van een volledige dienst wordt beproefd met alle benodigde voorzieningen.

VoorstelRegel#

De naam- en tijdvoorziening, de ontgrendelvoorziening, de noodtoegang en de herstelkern zijn bruikbaar zonder de getroffen cel.

Toelichting

Aangetoond in de proef met een koude start en in de toets herstel na een aanval.

Opstart- en herstelvolgorde

VoorstelOntwerpbesluit#

Een koude start van een hele cel en een herstel uit code en back-up volgen dezelfde negen stappen; iedere stap begint pas als de vorige gereed is. Bij een koude start mogen het basisdienstencluster en het opslagcluster naast elkaar starten, en wachten werkervirtualisatie en clusterbeheer niet op het vlootcluster, omdat clusters zonder vlootbeheer doorwerken.

Toelichting

De volgorde volgt uit het uitgangspunt dat herstel buiten de cel begint, en is de basis van het continuïteitsplan.

VoorstelWerking#

Een cel start en herstelt in deze volgorde.

StapOnderdeelHangt af vanGereed wanneer
1Stroom, fabric en firewallsStroom en koelingRouteringsdomeinen en zoneregels actief
2Naam, tijd en ontgrendelingStap 1; koppeling met het RWS-netwerkNaamvoorziening, twee tijdbronnen en de ontgrendelvoorziening buiten de cel bereikbaar
3BeheertoegangStap 1 en 2Noodwerkplek met noodtoegang uit de kluis; servermanagement via het apparatuurbeheer
4Basisdienstencluster, diensten op lokale opslagStap 2 en 3; containerbeelden op de knooppunten of uit de herstelkern; niet het opslagclusterGeheimenbeheer ontgrendeld; bij een koude start werken ook toegangsvoorziening en identiteitsbeheer met hun databases
5OpslagclusterStap 1 en 2Quorum van de monitors, schijven ontgrendeld, HEALTH_OK of een verklaarde verstoorde toestand
6Overige basisdiensten, eerst het versiebeheer; bij herstel uit back-up daarna toegangsvoorziening en identiteitsbeheerStap 4 en 5Alle basisdiensten werken; beheer loopt weer via de beheerwerkplek; de gebruikte noodtoegang is vervangen
7Vlootcluster, bij de cel waarvan het afhangtStap 5 en 6Beheerde clusters verbonden; nalevingsoverzicht actueel
8Werkervirtualisatie en clusterbeheerStap 5 en 6Gehoste besturingen gezond; virtuele werkers gestart
9Applicatieclusters en dienstenStap 8Eerst de leidende exemplaren van bedrijfskritische diensten, dan reguliere productie, dan ontwikkelen en beproeven; gecontroleerd langs het gebruikerspad
VoorstelUitgangspunt#

Een koude start zet de bestaande inrichting weer aan; dat is iets anders dan terugzetten uit een back-up. Bij herstel komen beelden, installatiebestanden en sleutels uit de herstelkern of de onveranderbare kopie.

VoorstelRegel#

Na een compromittering is geen cel meer te vertrouwen. Het herstel begint vanuit de herstelkern, bij het beheer zelf; het basisdienstencluster wacht op een nieuwe tussen-CA van PKI-beheer, en daarna worden alle geheimen en sleutels van de getroffen cel vervangen.

VoorstelRegel#

Ieder platformcluster en iedere cel zijn uit code opnieuw op te bouwen; de opbouw van een hele cel wordt in groeipadstap 2 beproefd.

Toelichting

Nodig voor herstel na aantasting. Aangetoond in de opbouwproef en in de toets herstel na een aanval.

Continuïteitsplan

VoorstelRegel#

Een cel start en herstelt in de vastgelegde volgorde. Het continuïteitsplan van het platform, aangesloten op de RWS-continuïteitsplanning, bevat die volgorde met de gemeten hersteltijd per stap en is vóór de vrijgave voor reguliere productie vastgesteld.

Toelichting

De volgorde wordt jaarlijks beproefd. De hersteltijd van een hele cel en van herstel zonder gezonde cel wordt in groeipadstap 2 gemeten.

VoorstelOntwerpbesluit#

Zolang cel 2 er niet is, vallen met AM4 ook het vlootbeheer, het versiebeheer en de herstelomgeving uit, en de schone capaciteit voor herstel zonder gezonde cel. Het herstel begint dan bij de herstelkern op vervangende servers van dezelfde typen; de hersteltijd omvat de levering van die servers.

Toelichting

Het continuïteitsplan bevat de herkomst van de vervangende servers en de hersteltijd van dit scenario.

VoorstelRegel#

Een dienst gaat pas naar het profiel reguliere productie als haar bedrijfsimpactanalyse de hersteltijd uit het continuïteitsplan verdraagt, ook die bij verlies van AM4 vóór groeipadstap 2.

Toelichting

Zo past het profiel bij de samenstelling. Gecontroleerd in het vrijgavedossier.

Overname tussen de cellen

VastgesteldWerking#

Overname is een gecontroleerde handeling van platformbeheer volgens het draaiboek van de dienst, nooit automatisch: eerst wordt de oude schrijvende kant uitgesloten door haar netwerk- en opslagtoegang in te trekken, daarna wordt het tweede exemplaar leidend. Bij twijfel over die uitsluiting wordt niet overgenomen; de terugkeer is een aparte, even gecontroleerde stap. Overname hervat de dienstverlening; de uitgevallen clusterbesturing wordt afzonderlijk hersteld.

Toelichting

Afgewezen: automatische overname of twee schrijvende cellen. Die geven bij een asymmetrische storing twee leidende omgevingen en tegenstrijdige gegevens.

VastgesteldEis#

Per bedrijfskritische dienst staan de schrijvende cel, het herstelpunt en de hersteltijd in de dienstbeschrijving. De overname wordt per bedrijfskritische dienst beproefd, ook bij een asymmetrische verbindingsstoring, in de toets herstel na een aanval en in de opbouwproef van groeipadstap 2.

Toelichting

Eigenaar: de diensteigenaar en platformbeheer.

VoorstelUitgangspunt#

Het tweede exemplaar van een bedrijfskritische dienst is een eigen applicatiecluster in de andere cel, met capaciteit, gegevens, toegang en verbindingen, eigen geheimen en geen gedeeld segment met het eerste. De diensteigenaar en platformbeheer besluiten over de overname, bij een calamiteit binnen de crisisorganisatie van de RWS-continuïteitsplanning.

VoorstelOntwerpbesluit#

De automatisering van de ontvangende cel voert de overname uit met de laatst gesynchroniseerde versie van het draaiboek van de dienst: gegevensdienst leidend maken, de dienstnaam naar de ontvangende cel omzetten en verbindingen binnen de zoneregels openen. Uitsluiting gebeurt met de rechten van de getroffen cel, via haar beheerwerkplek of noodtoegang; is die cel onbereikbaar, dan sluiten netwerkbeheer en platformbeheer haar stromen af op de firewalls en de koppeling. De overname hangt niet af van vlootbeheer, versiebeheer of basisdiensten van de getroffen cel, en wat daarbij buiten versiebeheer wijzigt, is binnen 1 werkdag in code vastgelegd.

Toelichting

Gevolg: de draaiboeken zijn in beide cellen gesynchroniseerd. Aangetoond met een overnameproef waarin cel 1 onbereikbaar is.

VoorstelRegel#

Een vlootbrede voorziening wordt in de andere cel pas actief na uitsluiting van het oude exemplaar; nooit beheren twee vlootclusters dezelfde clusters.

Toelichting

Zo is er geen dubbel beheer. Aangetoond in de herstelproef van het vlootbeheer.

VoorstelRegel#

Verlies van de koppeling tussen de cellen is op zich geen grond voor overname: beide cellen werken zelfstandig door, overname volgt alleen na vastgestelde uitval, en na herstel van de koppeling wordt de replicatie gecontroleerd.

Verwijzen hiernaar

Onderwerpen 5