1 open besluit1414 voorstellen

Onderwerp

De herstelomgeving

Een tijdelijk, afgeschermd gehost cluster uit code, op afroep in de gezonde cel, waarin een kopie eerst wordt gecontroleerd en de dienst wordt beproefd voordat productie terugkomt. Zij staat in een eigen zone zonder route naar productie en wordt na afloop verwijderd.

Nog niet bevestigd door een mens. Eigenaar: vdo89. Bron in de atlas

Domein
Volgt uit
Functies
Producten
Verwant

Wat het is

De herstelomgeving is de plek waar een kopie van buiten de cel wordt teruggezet, gecontroleerd en langs het pad van de gebruiker beproefd. Zij wordt op afroep uit code opgebouwd als gehost cluster, met werkers uit de reserve van de werkervirtualisatie van de gezonde cel, in een eigen zone met eigen aanmelding, geheimen en netwerk. Na afloop verdwijnt zij weer met al haar onderdelen.

Waarom zo

Een kopie van buiten de cel kan besmet zijn. Door haar eerst in een afgeschermde omgeving te controleren, zet het herstel een aanval niet terug in productie, en omdat de herstelzone geen route naar productie en geen pad naar de opslag van productie heeft, bereikt een besmette kopie de productie niet. Een omgeving op afroep vraagt geen eigen servers, maar deelt de reserve met onderhoud en overname.

Capaciteit, termijnen, adressen en stromen zijn een voorstel; de twee herstelpaden volgen uit de eis dat een heel cluster alleen onder dezelfde naam terug kan komen.

Uitspraken

2 vastgesteld16 voorstellen

Alle 16 voorstellen vaststellen

Op afroep in de gezonde cel

VastgesteldOntwerpbesluit#

De herstelomgeving is een gehost cluster uit een clusterdefinitie in het versiebeheer, op afroep opgebouwd: de besturing op het clusterbeheer, de werkers uit de reserve van de werkervirtualisatie van de gezonde cel. Zij staat in een eigen zone, de herstelzone, en wordt na de proef of het herstel weer verwijderd. Zolang er één cel is, is dat cel 1 zelf; vanaf groeipadstap 2 herstelt iedere cel de kopieën van de andere.

Toelichting

Afgewezen alternatief: een vast, compact herstelcluster. Dat vraagt drie of meer eigen servers die er niet zijn; het past alsnog als er hardware komt voor een eigen herstelvoorziening. De herstelomgeving dekt het gewone herstel op een gezonde cel, in de eerste levering dus alleen zolang cel 1 gezond is.

VoorstelWaarde#

De herstelomgeving krijgt een NodePool van drie werkers van maat L, in verschillende rekken, uit de reserve van de werkervirtualisatie. Samen met een teruggezet cluster en de twee herstelservers gebruikt zij ten hoogste de capaciteit van één werkerknooppunt van de werkervirtualisatie. Er is één herstelomgeving tegelijk per cel.

Toelichting

Terugzetten en scannen vragen rekenkracht, en de reserve is begrensd. De besturing gebruikt de vrije plaats voor de herstelomgeving op het clusterbeheer; een teruggezet applicatiecluster neemt daar de plaats van het uitgesloten origineel in.

VoorstelRegel#

Back-ups, buckets en sleutels zijn per cel; de andere cel levert alleen capaciteit. Die reserve draagt ook onderhoud, uitval en de overname van bedrijfskritische diensten. Een herstelproef valt daarom nooit samen met een incident, een overname of onderhoud op die reserve, en bij een incident gaat herstel voor onderhoud.

Toelichting

De voorrang tussen herstel, overname en onderhoud hoort bij Beheercellen & samenhang. Gecontroleerd met de capaciteitscontrole in het proefverslag.

VoorstelWaarde#

De herstelomgeving staat binnen 90 minuten klaar, inclusief het ophalen van de kopie uit de back-upvoorziening, behalve bij een kopie uit FortKnox.

Toelichting

De opbouwtijd en het ophalen tellen mee in de hersteltijd.

VoorstelRegel#

De herstelomgeving heeft eigen aanmelding, geheimen en sleutels, zonder productiegeheim: een eigen realm voor herstel in Keycloak met alleen herstelrollen, of de noodaanmelding uit de kluis als de toegangsvoorziening zelf is aangetast, en een eigen naamruimte herstel-<cel> in OpenBao met nieuwe waarden. Na afloop wordt zij met al haar onderdelen verwijderd: volumes, momentopnamen, geheimen, realm, herstelservers en herstelbucket, en komt de reserve weer vrij.

Toelichting

Het applicatieteam controleert zijn gegevens met leesrecht via de beheerwerkplek. Het proefverslag legt de verwijdering vast, en de inventaris toont geen restanten.

Eerst controleren, dan terugzetten

VastgesteldRegel#

Een kopie van buiten de cel en ieder herstel na een aanval gaan eerst door de controle in de herstelomgeving; pas na een geslaagde controle wordt productie hersteld. Software komt daarbij uit de vrijgave, niet uit de kopie.

Toelichting

Afgewezen: rechtstreeks terugzetten in productie, want een besmette kopie zet de aanval dan terug. Binnen de cel, na een fout zonder aanwijzing van aantasting, mag wel rechtstreeks worden teruggezet.

VoorstelOntwerpbesluit#

De controle op besmetting vergelijkt de controlesom van de kopie met de registratie van Cohesity, scant containerbeelden met Clair en scant bestanden, volumes, virtuele schijven en databasebestanden met de eindpuntbeveiliging van RWS op twee herstelservers: Tanium op Linux en Windows Defender op Windows. De indicatoren komen van het SOC, en het verslag gaat via de beheerwerkplek naar het SOC.

Toelichting

De herstelservers zijn virtuele machines op de werkervirtualisatie, uit een vrijgegeven schijfbeeld. Handtekening en inhoudskenmerk sluiten gewijzigde beelden uit, en niets komt uit de kopie zelf.

VoorstelUitgangspunt#

De controle toetst de integriteit en sluit bekende aantasting uit, onbekende niet. Dat restrisico is aanvaard en wordt begrensd door een kopie van vóór het tijdstip van aantasting, software uit de vrijgave en nieuwe sleutels.

VoorstelRegel#

Containerbeelden komen bij herstel op inhoudskenmerk uit de containerregistry, zijn door Clair gescand en starten alleen na controle van de handtekening; een niet-ondertekend beeld start in de herstelomgeving niet.

Toelichting

Afgewezen: beelden meenemen in de kopie, want een gewijzigd beeld komt dan terug zonder controle van de handtekening. In de herstelkern gaan de beelden wel mee, als ondertekend archief.

Twee herstelpaden

VoorstelOntwerpbesluit#

Er zijn twee herstelpaden. Voor een toepassing en haar gegevens worden objecten, volumes en databases teruggezet in de herstelomgeving zelf. Voor een heel applicatiecluster wordt ook de gehoste besturing uit de etcd-momentopname opgebouwd, met werkers in de herstelzone, maar pas na uitsluiting van het origineel, omdat dat herstel dezelfde naam vraagt.

Toelichting

Een in de herstelzone van de andere cel teruggezette besturing houdt haar API-naam en gebruikt het API-certificaat van haar eigen clusterautoriteit, in de kubeconfig van de beheerwerkplek; cert-manager van de andere cel geeft die naam niet uit.

VoorstelRegel#

Herstel van een gehoste besturing, een platformcluster of het vlootbeheer begint pas na uitsluiting van het oorspronkelijke exemplaar.

Toelichting

Zo bestaan er nooit twee exemplaren met dezelfde naam, of twee vlootclusters voor dezelfde clusters. Het draaiboek en het proefverslag tonen de uitsluiting.

VoorstelOntwerpbesluit#

Na een geslaagde controle wordt productie hersteld uit dezelfde kopie, herkend aan haar controlesom; een cluster verhuist niet van de herstelzone naar productie. Volumes komen pas bij de terugkeer naar productie weer op het opslagcluster.

Toelichting

Afgewezen: het gecontroleerde cluster naar productie verhuizen. Er is geen route naar productie, en verhuizen vraagt nieuwe werkers en een wijziging onder tijdsdruk.

VoorstelOntwerpbesluit#

Terugzetten uit Cohesity gaat via een herstelbucket. Back-upbeheer zet op verzoek van platformbeheer een kopie van vóór het gekozen tijdstip terug in een herstelbucket op Cohesity, en de herstelomgeving, voor een etcd-momentopname het clusterbeheer, leest die met een eigen leesidentiteit. Zo is er geen schrijfpad van de herstelomgeving naar de kopieën.

Toelichting

Voor herstel zonder gezonde cel ligt in de kluis een herstelidentiteit die alleen leest en naar een herstelbucket terugzet; ieder gebruik ervan gaat naar het SOC.

VoorstelWerking#

Een dienst wordt in vijf stappen uit een kopie hersteld, op verzoek van de diensteigenaar of het SOC.

StapWie of watHandeling
1PlatformbeheerBouwt een tijdelijk, afgeschermd cluster met gereserveerde capaciteit.
2Back-upbeheerLevert een gecontroleerde kopie; controlesom en scan vóór het gebruik voor productie.
3HerstelZet definitie, sleutels, clusterobjecten, volumes en database terug naar het gekozen punt.
4GebruikerspadBeproeft toegang, gegevens en koppelingen en meet de duur en het gegevensverlies.
5AfrondingBewaart het bewijs en verwijdert tijdelijke objecten en toegang.
Toelichting

Een geslaagde status van het terugzetten vervangt de dienstproef niet. Koppelingen worden als code nagebootst; wat daardoor niet is beproefd, staat in het verslag.

Herstelzone

VoorstelRegel#

De herstelzone, VLAN 690 in vrf-herstel, bestaat ook zonder opgebouwde omgeving en heeft geen route van of naar productie; alleen de vaste stromen voor back-up en herstel zijn toegestaan. Vanuit productie, de afnemerszones en vrf-platform is de herstelzone niet bereikbaar, en iedere andere stroom weigert en logt de firewall.

Toelichting

Gecontroleerd met de netwerktest bij iedere herstelproef. Het routeringsdomein zelf hoort bij Netwerk, ingang & zones. Vanaf groeipadstap 2 herstelt iedere cel de kopieën van de andere over het gekoppelde routeringsdomein voor herstel; bij Beheercellen & samenhang staat dat de herstelzone alleen vaste stromen binnen de eigen cel kent, niet over de koppeling. Hoe die twee samengaan, vraagt een besluit.

VoorstelOntwerpbesluit#

Ieder cluster in de herstelzone, ook een daar teruggezet applicatiecluster, krijgt zijn volumes alleen via de gastklasse van de werkervirtualisatie (RBD, storageDriver Manual), geen opslagclientnetwerk en een statisch adres; er is geen DHCP-doorgifte. Een definitie met een opslagclientnetwerk of DHCP in de herstelzone wordt geweigerd.

Toelichting

Afgewezen: een rechtstreekse koppeling met het opslagcluster, zoals in productie. Die vraagt het opslagclientnetwerk in de herstelzone en daarmee een pad naar de opslag van productie. Gecontroleerd met beleidstoetsing en een negatieve proef.

VoorstelWaarde#

Werkers en herstelservers krijgen een statisch adres uit de herstelreeks, gereserveerd in Infoblox, geregistreerd in NetBox en vastgelegd in hun definitie als code. Besturingen in de herstelzone krijgen een API-adres uit een eigen deelreeks en een eigen ingangsadres op het clusterbeheer; het API-adres van de herstelomgeving heeft een vaste naam onder het domein van de cel.

VoorstelWaarde#

Back-up en herstel gebruiken deze verbindingen.

VanNaarPoortDoel
Clusters van de cel (vrf-platform en de afnemersdomeinen)Objectgateway, realm platform (VLAN 622)TCP 443Back-ups naar de eigen buckets en herstel daaruit, ook door een herstelexemplaar van een database
Cohesity (vrf-extern)Objectgateway, realm platformTCP 443Ophalen met alleen leesrecht
Kopieertaak op het basisdienstencluster (vrf-platform)Vergrendeld S3-doel van Cohesity (vrf-extern)TCP 443Terugvaloptie: alleen toevoegen
Beheerwerkplek (vrf-beheer)Herstelomgeving (vrf-herstel)TCP 443 en 6443Bediening, met eigen aanmelding
Herstelomgeving (vrf-herstel)Cohesity (vrf-extern)TCP 443De kopie uit de herstelbucket lezen
Werkers in de herstelzoneGehoste besturing op het clusterbeheer (vrf-platform), alleen de deelreeks voor besturingen in de herstelzoneTCP 6443 (API-adres) en 443 (OAuth, Konnectivity en Ignition)Werkers melden zich bij hun besturing
Werkers en herstelservers in de herstelzoneContainerregistry, geheimenbeheer, naamdienst en tijd (vrf-platform)TCP 443 en 8200; 53; UDP 123Beelden op inhoudskenmerk, definities en indicatoren, de naamruimte voor herstel en de transitsleutel van de cel, namen en tijd
Teruggezet geheimenbeheer (vrf-herstel)Hardwaresleutelmodule van PKI-beheer (vrf-extern)PKCS#11 over TLS, op de poort van de moduleOntgrendeling met het sleutelslot van de cel
Clusterbeheer (vrf-platform)Herstelbucket op Cohesity (vrf-extern)TCP 443Een etcd-momentopname lezen voor herstel van een heel cluster; alleen lezen, alleen de herstelbucket
Toelichting

De vaste stromen van de herstelzone zijn een aanvaard restrisico, begrensd door de deelreeks, de toegangslijsten, de leesrobot van de containerregistry, het beleid in OpenBao voor alleen de naamruimte voor herstel en de netwerktest. Netwerkbeheer legt ze vast in de opslagplaats Beleid.

Verwijzen hiernaar

Onderwerpen 5