Ontwerpkeuze
Continuïteit naar het belang van het werk, met beproefd herstel
Rust op Twaalf dragende ontwerpkeuzes. Bevestigd door vdo89 op 26 september 2026. Bron in de atlas
- Vraag
- Waarom krijgt niet iedere toepassing dezelfde uitwijk?
- Leidend
- nee
Principes
Ontwerp voor herstelbaarheid; uitwijk en terugschakelen vooraf ontworpen en getest; replicatie gecontroleerd en herstelbaar.
Waarom niet eenvoudiger
Overal de hoogste beschikbaarheid is duur; overal alleen een back-up laat kritieke processen te lang stilliggen. Daarom maken drie dienstprofielen de afweging per toepassing zichtbaar.
Wat het oplevert
De drie dienstprofielen verbinden het belang van de toepassing aan de benodigde herstelvoorzieningen. De bedrijfsimpactanalyse bepaalt de toegestane onderbreking en het gegevensverlies.
Wat het vraagt
Bedrijfskritische productie vraagt een tweede dienstexemplaar, reserve, toegangsvoorzieningen en beproefde overname én terugkeer. De afspraak geldt ook voor de ketenkoppelingen.
- Lost op
- Uitgewerkt in
Onderwerpen die eruit volgen
Beschermingslagen en de onveranderbare kopie
Kopieën in de cel beschermen tegen fouten en tegen uitval van onderdelen; de onveranderbare kopie op de back-upvoorziening van RWS, buiten de cel en buiten de beheerrechten van het platform, beschermt de productie. De cel heeft geen rechten op haar eigen bescherming, en voor alle back-ups geldt één bewaarregel.
Het basisdienstencluster
Iedere cel heeft een eigen compact cluster van drie servers voor de basisdiensten, ook voor de basisdiensten die als virtuele machine draaien. Twee servers moeten samen alle diensten kunnen dragen.
Het clusterbeheer
Het platformcluster dat per cel de gehoste besturing van alle applicatieclusters draagt: opbouw, lokale configuratiedatabases, softwarestapel, beheer, bewaking en taken.
Het opslagcluster
Iedere cel heeft één eigen Ceph-cluster op eigen servers, dat de clusters van de cel via Data Foundation in externe modus gebruiken. Opslagbeheer beheert het, los van de levenscyclus van de clusters.
Het vlootcluster
Eén compact vlootcluster buiten de cellen draagt het vlootbeheer voor de hele vloot. In de eerste levering hangt het nog van cel 1 af; de clusters werken zonder het vlootbeheer door.
Opbouw van het platform
Eén vlootbeheer boven zelfstandige beheercellen, één per datacenter, met vier eigen platformclusters per cel. Wat de cellen delen, is vlootbreed of staat buiten de cellen, met eigen maatregelen en een eigen herstelpad.
Architectuurprincipes
De architectuurprincipes van RWS en de overheid waaraan het platform is getoetst, per bron en met hoe het platform ieder principe verwerkt, en de afwegingen waar principes met elkaar schuren.
Back-up per laag
Ieder onderdeel heeft een eigen back-up, zodat het consistent terug te zetten is: clusterobjecten en volumes, configuratiedatabases van besturingen, databases, geheimenbeheer, containerregistry en versiebeheer. Schema’s, buckets, meldingen en de softwarestapel liggen daarvoor vast.
Exemplaren, overname en dienstniveaus
Bij ontwikkelen en beproeven heeft een database één exemplaar, in reguliere productie drie op verschillende werkers met automatische overname en uitsluiting van het oude schrijvende exemplaar. Met de dienstniveaus per profiel, de opslag, het gedrag bij uitval en de capaciteit in het quotum van het team.
Foutdomeinen en herstel
Het rek is de eenheid die als geheel mag uitvallen. Iedere kopie staat in een ander rek, en na uitval van een server of een rek is de volledige bescherming binnen 8 uur automatisch terug.
Foutdomeinen, rekindeling en uitval
Wat er gebeurt bij onderhoud en bij uitval per laag, en hoe de servers van ieder cluster over de rekken verdeeld zijn, zodat uitval van één rek geen cluster stillegt.
Het datacenternetwerk van een cel
Iedere cel krijgt een eigen fabric op EVPN en VXLAN, met Cisco Nexus 9000-switches in NX-OS-modus en Nexus Dashboard als fabriccontroller. De fabric is dubbel uitgevoerd, wordt als code beheerd en met een vaste testset beproefd.
Sleutels, ontgrendeling en versleuteling
Welke sleutels er zijn en waar ze liggen, hoe het geheimenbeheer van buiten de cel wordt ontgrendeld, en wat er in rust en tijdens transport versleuteld is.
Back-up en herstel naar tijdstip
Iedere database heeft een dagelijkse volledige back-up en een doorlopend archief van het transactielogboek, in een eigen bucket, met een kopie buiten de cel. Herstel naar een gekozen tijdstip maakt een nieuw databasecluster en laat het origineel ongemoeid tot de eigenaar goedkeurt.
Capaciteit en reserve
Hoeveel besturingen het clusterbeheer draagt, hoe groot een applicatiecluster mag worden, welke reserve niet wordt uitgegeven en wanneer het platform uitbreidt of bevriest.
Capaciteit, overboeking en reserve
Hoeveel de werkervirtualisatie draagt, hoe processor en geheugen worden toegewezen, welke reserve niet wordt uitgegeven en wanneer het platform uitbreidt of bevriest.
De herstelomgeving
Een tijdelijk, afgeschermd gehost cluster uit code, op afroep in de gezonde cel, waarin een kopie eerst wordt gecontroleerd en de dienst wordt beproefd voordat productie terugkomt. Zij staat in een eigen zone zonder route naar productie en wordt na afloop verwijderd.
Opstart, herstel en overname
Hoe een cel opstart en herstelt, beginnend buiten de getroffen cel, en hoe een bedrijfskritische dienst gecontroleerd overgaat naar de andere cel, met op ieder moment één schrijvende cel.
Startketen, opslag en herstel
Hoe de cel start zonder op de gedeelde opslag te wachten, waar de basisdiensten hun gegevens bewaren, hoe het geheimenbeheer op het cluster draait en in welke volgorde de basisdiensten na verlies terugkomen.
Capaciteit, quota en lagen
Hoe vol het opslagcluster mag worden, hoe quota en overboeking werken, en hoe het groeit met prestatielagen die nooit in één pool worden gemengd.
De herstelkern en herstel zonder gezonde cel
De herstelkern is een onafhankelijke set installatiebestanden, beelden, code, toestand, sleutels en noodtoegang, buiten de cellen bewaard. Daarmee begint het herstel als geen cel meer gezond is of het beheer zelf is aangetast.
Dienstverlening
Eén dienstbeschrijving stuurt levering en beheer over de hele levensduur van een dienst; een team combineert uit het aanbod wat het nodig heeft en kiest een dienstprofiel voor gebruik en continuïteit.
Foutdomeinen, uitval en uitsluiting
Hoe het basisdienstencluster de uitval van een exemplaar, een knooppunt of een rek opvangt, en hoe een dienst met één exemplaar pas elders start als het oude knooppunt aantoonbaar is uitgeschakeld.
Live-migratie en onderhoud
Hoe draaiende machines bij onderhoud verhuizen, binnen welke grenzen, en hoe de werkervirtualisatie wordt bijgewerkt zonder uitval van werkers.
Herstel naar verstoring en dienstprofiel
Welke herstelbron en welk herstelpad bij welke verstoring horen, welke hersteldoelen per dienstprofiel gelden, en waarom overname door de andere cel iets anders is dan herstel uit een kopie.
Incidentrespons en meldplicht
Bij een beveiligingsincident leidt het SOC detectie en analyse, coördineert de incidentmanager en voert platformbeheer de maatregelen uit, volgens een draaiboek per incidenttype. Een significant incident wordt langs één route gemeld, binnen de termijnen van de Cyberbeveiligingswet.
Reserve, capaciteit en bewaking
Drie soorten reserve per cel, die niet naar afnemers gaan en in een vaste voorrang worden ingezet, de plaatsen op het clusterbeheer, de dienstniveaus van de samenstelling en de meldingen die uitval en krapte zichtbaar maken.
De externe verkeersverdeling
De paren van NetScaler BLX per cel op het basisdienstencluster: hoe ze zijn opgesteld, beheerd, bijgewerkt en hersteld, welke capaciteit ze hebben en hoe ze worden bewaakt en beproefd.
Noodtoegang, uitval en herstel
Wat werkt als de aanmelding, het identiteitsbeheer of de hele cel uitvalt of is aangetast: de noodroute in twee trappen buiten het platform, en herstel zonder dat ingetrokken toegang terugkeert.
Sleutels, toegang en taken
Hoe herstelkopieën versleuteld zijn en hun sleutels ook zonder de cel bruikbaar blijven, wie welke toegang heeft tot back-ups en herstel, en hoe de taken tussen platformbeheer, back-upbeheer, opslagbeheer, netwerkbeheer en het SOC zijn verdeeld.
Uitval en herstel van het vlootbeheer
Het vlootbeheer wordt na uitval hersteld, niet dubbel uitgevoerd: binnen 24 uur uit de hubback-up, pas na uitsluiting van het oude vlootcluster, en vanaf groeipadstap 2 ook in cel 2.
Uitval, back-up en herstel van virtuele machines
Hoe de werkervirtualisatie zich gedraagt bij uitval van een server, een rek of een afhankelijke voorziening, hoe een uitgevallen server wordt uitgesloten, en hoe de werkervirtualisatie en virtuele servers worden hersteld.
Beheer, meting en herstel van het leverpad
Portaal, toetsing en leverwerkstroom komen uit code en versiebeheer en zijn opnieuw op te bouwen. Uitval stopt nieuwe leveringen maar geen draaiende toepassing, en iedere levering wordt gemeten tegen de nulmeting.
Beheer, uitval en herstel van de keten
Platformbeheer beheert de keten met smalle technische identiteiten. Uitval van een vlootbreed deel stopt alleen nieuwe vrijgaven; de keten komt terug uit code en herstelkern, en wordt bewaakt, beproefd en langs het groeipad opgebouwd.
Beproeving en continuïteitsplan
Een back-up telt pas na een geslaagd herstel. Herstel wordt volgens een vaste kalender beproefd en gemeten tot de afnemer weer kan werken, en het continuïteitsplan legt per onderdeel de herstelbron, de afhankelijkheden en de gemeten hersteltijd vast.
Bewaking, logboeken en beproeving
Wat van iedere database wordt gemeten en gemeld, welke gebeurtenissen naar het SOC gaan, hoe de database in de inventaris staat, en wat vóór productie en vrijgave aantoonbaar moet zijn.
De eigen bewakingsvoorziening
Het eindbeeld is per cel een eigen bewakingsvoorziening buiten het platform en buiten het vlootbeheer, met vergrendelde logopslag, verkeersstromen, metingen van apparatuur en een langere historie. Zij komt in groeipadstap 2, vóór de vrijgave voor reguliere productie; tot dan geldt een uitzondering.
De beveiligingsbaseline
De beveiligingsbaseline van het platform: risicogerichte, gelaagde maatregelen met norm en bewijs, met BIO2 en ISO/IEC 27002:2022 als kader, getoetst aan de referentieset securityeisen, met uitzonderingen, onderhoud en naleving.
Uitrol, beproeving en fasering
Hoe platformwijzigingen cel voor cel worden uitgerold, welke omgevingen er naast productie zijn, wat vóór de ingebruikname van een cel wordt beproefd, welke draaiboeken en taken er zijn, en hoe de samenstelling langs het groeipad groeit.
Uitval, back-up en herstel
Wat er gebeurt als een knooppunt, het clusterbeheer of een cel uitvalt, welke momentopnamen en back-ups er zijn, en hoe een besturing, het clusterbeheer of een heel applicatiecluster wordt teruggezet.
Verkeer tussen de cellen en de overgang
De fabrics van de twee cellen koppelen alleen gerouteerd; afnemersverkeer naar de andere cel loopt via de ingang van die cel, en een bedrijfskritische dienst schakelt nooit automatisch om. Met de overgang van het oude netwerk in AM2 en de routekaart van netwerk en ingang.
Beproeving en oplevering
Hoe de eerste levering wordt geaccepteerd en aan platformbeheer overgedragen, met welke maatstaven de voortgang wordt gevolgd en hoe de aandachtspunten voor de uitbreiding worden beheerst.