1 open besluit1414 voorstellen

Onderwerp

Uitval en herstel van het vlootbeheer

Het vlootbeheer wordt na uitval hersteld, niet dubbel uitgevoerd: binnen 24 uur uit de hubback-up, pas na uitsluiting van het oude vlootcluster, en vanaf groeipadstap 2 ook in cel 2.

Nog niet bevestigd door een mens. Eigenaar: vdo89. Bron in de atlas

Domein
Volgt uit
Functies
Producten
Verwant

Wat het is

Het vlootbeheer wordt na uitval hersteld, niet dubbel uitgevoerd. De hub wordt dagelijks en vóór iedere upgrade geback-upt; herstel begint pas na uitsluiting van het oude vlootcluster en is binnen 24 uur klaar. Vanaf groeipadstap 2 staan een kopie van de hubback-up en een hersteldoel in cel 2. Na een compromittering volgt herbouw vanuit de herstelkern.

Waarom zo

Omdat de clusters zonder vlootbeheer doorwerken, weegt een tweede actieve hub niet op tegen de extra servers en het risico dat twee hubs dezelfde clusters beheren. Herstel uit back-up en code met een vaste hersteltijd volstaat en houdt de oplossing van een actief misbruikte kwetsbaarheid binnen 72 uur haalbaar.

De hersteltijd, het hersteldoel en de draaiboeken zijn een voorstel; de herstelproef toont of de hersteltijd wordt gehaald.

Uitspraken

0 vastgesteld15 voorstellen

Alle 15 voorstellen vaststellen

Herstel in plaats van een tweede hub

VoorstelWerking#

Valt de hub uit of wordt hij hersteld, dan verloopt dat in drie stappen.

WieWatHandeling
Lokale clustersWerklastenBlijven hun laatste geldige toestand uitvoeren zolang de lokale keten gezond is
PlatformbeheerOude hubSluit de oude coördinator aantoonbaar uit
HerstelNieuwe hubZet de gecontroleerde back-up terug en herstelt de beheerverbindingen
Toelichting

Nooit beheren twee hubs dezelfde clusters; na compromittering begint het herstel buiten die vertrouwensgrens.

VoorstelOntwerpbesluit#

Het vlootbeheer wordt na uitval hersteld uit back-up en code; het werkt niet ononderbroken door en er is nooit een tweede actieve hub. Het herstel begint na uitsluiting van het oude exemplaar, en na compromittering vanuit de herstelkern. De hersteltijd telt mee in de spoedroute.

Toelichting

Afgewezen: een tweede hub die passief meeloopt. Dat vraagt extra servers en geeft het risico dat twee hubs dezelfde clusters beheren; het past alsnog als de hersteltijd van 24 uur niet haalbaar blijkt.

VoorstelRegel#

Herstel begint pas na uitsluiting van het oude vlootcluster: de oude actieve kant wordt aantoonbaar uitgesloten (fencing). Twee hubs beheren nooit dezelfde clusters.

Toelichting

Aangetoond in de toets herstel na een aanval.

VoorstelWaarde#

Per gebeurtenis liggen gedrag en herstel van het vlootbeheer vast.

GebeurtenisExemplaren en plaatsingGedragHerstel
Eén knooppunt van het vlootclusterDrie knooppunten in drie rekken; etcd met drie ledenHet quorum blijft; hub en Argo CD werken doorKnooppunt vervangen volgens de procedure van de leverancier
Eén rek van AM4Ten hoogste één knooppunt van het vlootcluster per rekAls bij één knooppunt; het opslagcluster blijft beschikbaarGeen handeling
Opslagcluster of toegangsvoorziening van cel 1Eén per celHet vlootbeheer valt uit; de clusters werken doorDaarna controleren dat alle clusters actueel zijn geëvalueerd
VersiebeheerEén exemplaar in cel 1Geen nieuwe uitrol en geen terugzetten van afwijkingen, behalve via de noodrouteHerstart of herbouw; daarna afwijkingen teruggezet
Geheimenbeheer van cel 1Drie exemplaren op het basisdienstenclusterGeen vernieuwing van leestokens en sleutels tot hun einddatumExternal Secrets vernieuwt na herstel vanzelf
Vlootcluster met verlies van gegevensEén vlootclusterClusters werken door en toegelaten software start; nieuwe ondertekeningen en het centrale overzicht van de beveiligingsbewaking staan stilUitsluiten, herinstalleren, hubback-up terugzetten, clusters aansluiten; binnen 24 uur
AM4 of cel 1, in de eerste leveringVlootcluster in AM4Het vlootbeheer valt met cel 1 uitHerbouw in AM4; zonder gezonde cel vanuit de herstelkern
AM4 of cel 1, vanaf groeipadstap 2Kopie van de hubback-up en hersteldoel in cel 2Clusters van cel 2 werken door; centrale wijzigingen wachtenHerstel op het hersteldoel, na uitsluiting van het vlootcluster
Verbinding tussen de cellenGekoppeld routeringsdomein platformCel 2 onbereikbaar; na 300 seconden uit de plaatsing, zonder verlies van inrichtingDaarna automatisch weer opgepakt
Fout in beleid of inrichtingEén uitrol voor alle clustersBegrensd door melden vóór afdwingen en door de golvenVorige versie terugzetten; golf binnen 15 minuten terug naar ‘melden’
Gecompromitteerd vlootbeheerVlootbrede rolKan alle clusters in beide cellen rakenDraaiboek voor een gecompromitteerd vlootbeheer

Hubback-up en hersteltijd

VoorstelRegel#

De hub wordt dagelijks en vóór iedere hubupgrade geback-upt met de clusterback-upfunctie (OADP) naar de objectopslag van cel 1, met een onveranderbare kopie buiten de cel en vanaf groeipadstap 2 een kopie in cel 2. Een back-up is pas bewezen na een geslaagde herstelproef; bij de eerste mislukte back-up volgt een melding.

Toelichting

Gecontroleerd met het back-upoverzicht en de herstelproef.

VoorstelOntwerpbesluit#

Het vlootbeheer is binnen 24 uur hersteld, gerekend van het besluit tot herstel tot een werkend vlootbeheer met alle bereikbare clusters aangesloten, met een herstelpunt van de hub van ten hoogste één dag; de inrichting zelf staat in versiebeheer. Tot het herstel lopen tijdelijke maatregelen via de noodroute.

Toelichting

Zo blijft de oplossing van een actief misbruikte kwetsbaarheid binnen 72 uur haalbaar. De hersteltijd wordt in de herstelproef gemeten.

VoorstelRegel#

De herstelde hub sluit de clusters zelf weer aan.

Toelichting

Voorwaarde bij de ingebruikname. Lukt dat niet, dan krijgt ieder cluster een nieuw importgeheim, binnen dezelfde hersteltijd.

VoorstelWerking#

Bij opstart en herstel volgt het vlootcluster het continuïteitsplan: netwerk, naam en tijd, toegang, geheimenbeheer, opslag en versiebeheer gaan voor, het clusterbeheer volgt; de installatie vraagt ook de containerregistry van cel 1. De volgorde voor een hele cel staat bij de beheercellen.

Compromittering en herstel in cel 2

VoorstelRegel#

Na een compromittering, of het vermoeden daarvan, volgt herbouw vanuit de herstelkern met nieuwe geheimen, zonder ongecontroleerd terugzetten van de hubback-up. Het vlootcluster wordt geïsoleerd, de hubverbinding en de uitrolidentiteit worden op alle clusters ingetrokken, de inrichting wordt vergeleken met het versiebeheer als dat niet is geraakt, en de clusters worden opnieuw aangesloten. Na een incident worden ook de klusterletgegevens en de vertrouwde sleutels vervangen.

Toelichting

Het draaiboek wordt in de leeromgeving uitgevoerd; groeipadstap 2 herhaalt de proef met twee cellen.

VoorstelOntwerpbesluit#

Vanaf groeipadstap 2 zet een kopieertaak iedere hubback-up ook in de realm platform van de objectopslag van cel 2, met alleen toevoegrechten. Het hersteldoel is een compact cluster zoals het vlootcluster, op de koude reserveserver en twee ontruimde werkerknooppunten van de werkervirtualisatie van cel 2, losgekoppeld van de vloot zoals bij de herstelkern; die capaciteit hoort bij de reserve van cel 2. Het krijgt namen en certificaten onder cel 2, nieuwe geheimen uit cel 2 en de aanmelding van cel 2, die na uitsluiting van cel 1 de vlootbrede rollen toekent.

Toelichting

Herstel in cel 2 vraagt zowel een kopie als capaciteit. Na verlies van cel 1 haalt het vlootbeheer zijn bronnen uit het in cel 2 herstelde versiebeheer. Het werkelijke hersteldoel in cel 2 en de namen van de eindpunten worden in de registratie vastgelegd.

Uitval vaststellen

VoorstelOntwerpbesluit#

Het vlootcluster bewaakt zichzelf met de ingebouwde clusterbewaking en meldt rechtstreeks aan de meldingsroutes; meldingen van clusters hangen niet af van het vlootcluster. Het vlootbeheer meldt een onbereikbaar cluster na 5 minuten. Of het vlootcluster zelf bereikbaar is, stelt een voorziening buiten het vlootcluster vast: de bewaking van het basisdienstencluster van iedere cel, via API en ingangen, en vanaf groeipadstap 2 ook de eigen bewakingsvoorziening.

Toelichting

Een cluster meldt zijn eigen uitval niet. Aangetoond met een gesimuleerde storing bij de acceptatie van de bewaking.

VoorstelWerking#

Is het vlootbeheer onbereikbaar, dan werken de clusters door en lopen urgente wijzigingen via de noodroute; na herstel worden die gecontroleerd verwerkt en wordt nagegaan dat alle clusters actueel zijn geëvalueerd.

Draaiboeken en bewijs

VoorstelWaarde#

Voor het vlootbeheer zijn deze draaiboeken nodig.

DraaiboekHandeling op hoofdlijnenEigenaarBeproefd in
Opbouw van het vlootclusterInstallatie vanuit de containerregistry; aanmelding en noodtoegang; hub, Argo CD en projecten; import van het basisdienstencluster, later werkervirtualisatie en clusterbeheerPlatformbeheer, tot de overdracht het ontwikkelteamBouw van het vlootbeheer; opbouwproef ieder half jaar
Cluster aansluitenImport, kenmerken en clusterset, evaluatie binnen 30 minuten, registratiePlatformbeheerBouw van het vlootbeheer; acceptatieproef
Cluster afmeldenNa de beëindiging: clusterdefinitie via een wijzigingsvoorstel verwijderd, ontkoppeld, importgeheim en identiteiten ingetrokken, inventaris bijgewerktPlatformbeheerAcceptatieproef
Beleid in twee fasenMelden, dan per golf afdwingen, met terugval per golfPlatformbeheer met de beveiligingsbeheerderUpdateproef; toets gefaseerde uitrol met proefgroep
Platformupdate per golfVastgelegde volgorde; stop bij het cluster met de fout; de rest van de golf volgt alleen als de fout aantoonbaar bij dat cluster ligtPlatformbeheerUpdateproef; toets gecontroleerd bijwerken per laag
Upgrade van het vlootbeheerHubback-up; eerst de leeromgeving; onderhoudsvenster van het vlootcluster; agenten en beleidsstatus controleren; terugweg via herstelPlatformbeheerLeeromgeving; bouw van het vlootbeheer
Uitval van een knooppunt of rek van het vlootclusterGedrag controleren; besturingsknooppunt vervangen volgens de procedure van de leverancierPlatformbeheerUitvalproef
Vlootbeheer onbereikbaarClusters werken door; urgente wijzigingen via de noodroute; na herstel gecontroleerde verwerkingPlatformbeheerToets uitval van het vlootbeheer
Herstel van het vlootclusterUitsluiten, herinstalleren, hubback-up terugzetten, clusters aansluiten, evaluatie controlerenPlatformbeheerBouw van het vlootbeheer; daarna als opbouwproef
Herstel in cel 2Vlootcluster in AM4 uitsluiten, hersteldoel opbouwen met namen onder c2, terugzetten uit de kopie in cel 2, clusters aansluitenPlatformbeheer met netwerkbeheerGroeipadstap 2; toets herstel na een aanval
Gecompromitteerd vlootbeheerVlootcluster isoleren; hubverbinding en uitrolidentiteit op alle clusters intrekken; inrichting vergelijken met het versiebeheer, als dat niet is geraakt; herbouw vanuit de herstelkern met nieuwe geheimen; opnieuw aansluitenPlatformbeheer met SOC en CISO-functieToets herstel na een aanval
Sleutels en certificaten vervangenLeestokens, webhookgeheim, certificaten, importgeheimen; na een incident ook de klusterletgegevens en de vertrouwde sleutelsPlatformbeheerAcceptatieproef; ieder half jaar
NoodmaatregelZelfcorrectie voor één object opschorten met einddatum; binnen 1 werkdag in code of teruggedraaidPlatformbeheerOefening van de noodroute
CapaciteitsactieVolgens de capaciteitsgrenzen van het vlootclusterPlatformbeheerReferentiemeting
VoorstelRegel#

De draaiboeken van het vlootbeheer staan in de opslagplaats Draaiboeken en zijn vóór de overdracht door de primaire en plaatsvervangende beheerders zelf uitgevoerd; iedere eigenschap van het vlootbeheer heeft een proef met slaagcriterium.

Toelichting

Gecontroleerd met de controlelijst voor de overdracht en de bewijsset.

VoorstelEis#

Bij de acceptatie van het vlootbeheer en van de eerste levering wordt het volgende aangetoond; het bewijs staat in de opslagplaats Draaiboeken.

ProefWat wordt aangetoond
ImportHet clusterbeheer is met de multicluster engine geïmporteerd; een nieuw gehost cluster verschijnt zonder handeling met de juiste kenmerken, de herstelomgeving niet; basisdienstencluster, werkervirtualisatie en clusterbeheer zijn binnen 30 minuten aangesloten.
UitrolEen wijziging in Beleid is binnen 5 minuten op alle bereikbare clusters geëvalueerd; de twee fasen en de terugval van een golf binnen 15 minuten werken.
Negatieve proevenEen vastlegging zonder vertrouwde handtekening wordt niet uitgerold; een project schrijft niet buiten zijn naamruimten en objectsoorten; een cluster dat uit een plaatsing valt, houdt zijn inrichting; een vijfde toewijzing van ‘vlootbeheer-beheerder’ wordt geweigerd; aanmelden zonder hardwaresleutel lukt niet; de beheeringang is vanuit een afnemerszone en vanaf werkers van gehoste clusters onbereikbaar.
UitvalMet het vlootcluster uitgeschakeld werken de clusters door en start toegelaten software; de uitvalproef van een knooppunt en van een rek van het vlootcluster slaagt.
HerstelNa uitsluiting is de hubback-up teruggezet, zijn de clusters aangesloten en is de hersteltijd gemeten; pas dan geldt de back-up als bewezen.
LoggingHet SOC ontvangt de audit en de gebeurtenissen van Argo CD van het vlootcluster; de detectieregels voor wijzigingen buiten versiebeheer en voor uitval van een beveiligingsvoorziening zijn beproefd.
CompromitteringHet draaiboek is in de leeromgeving uitgevoerd; groeipadstap 2 herhaalt de proef met twee cellen.
VoorwaardenIedere voorwaarde bij de ingebruikname is aangetoond, of haar terugvaloptie is ingericht en beproefd.
ReferentiemetingHet gebruik per beheerd cluster is gemeten.

Verwijzen hiernaar

Onderwerpen 2