1 open besluit1414 voorstellen

Onderwerp

Reserve, capaciteit en bewaking

Drie soorten reserve per cel, die niet naar afnemers gaan en in een vaste voorrang worden ingezet, de plaatsen op het clusterbeheer, de dienstniveaus van de samenstelling en de meldingen die uitval en krapte zichtbaar maken.

Nog niet bevestigd door een mens. Eigenaar: vdo89. Bron in de atlas

Domein
Volgt uit
Functies
Producten
Verwant

Wat het is

Iedere cel houdt drie soorten reserve vast: uitvalreserve per cluster, reserve voor herstel en overname, en een koude reserveserver. Die reserve gaat niet naar afnemers. Daarnaast liggen de plaatsen op het clusterbeheer, de omvang en groei van de samenstelling, de dienstniveaus en de meetwaarden met hun drempels vast.

Waarom zo

Herstel en overname moeten capaciteit vinden op het moment dat het nodig is. Uitvalreserve die als afnamecapaciteit is uitgegeven, of overname uit de uitvalreserve, laat een cel na overname op één knooppunt van stilstand draaien. Een vaste voorrang maakt vooraf duidelijk wat wijkt als de reserve tekortschiet.

De waarden zijn een voorstel, afgeleid van de capaciteit van de eerste levering; de meldingen maken zichtbaar wanneer de reserve wordt aangesproken of een grens nadert.

Uitspraken

0 vastgesteld16 voorstellen

Alle 16 voorstellen vaststellen

Drie soorten reserve

VoorstelRegel#

De reserve voor uitval, herstel en overname ligt per cel vast en gaat niet naar afnemers. Uitvalreserve is capaciteit voor het verlies van één knooppunt, geen vrij uit te geven quotum.

Toelichting

Zo vinden herstel en overname capaciteit wanneer het nodig is. Gecontroleerd met de capaciteitsrapportage en de beleidstoetsing.

VoorstelWaarde#

Iedere cel kent drie soorten reserve, naast de capaciteitsgrenzen van de samenstelling. De capaciteit per cluster ligt vast bij de clusters zelf.

OnderdeelGrens of reserveActie
UitvalreservePer cluster de uitval van één knooppunt: bij het vlootcluster en het basisdienstencluster twee van drie knooppunten; bij het clusterbeheer de middelen van één werkerknooppunt; bij de werkervirtualisatie één werkerknooppunt; bij het opslagcluster het vierde rek en de vulgrens van 65 procentNooit voor afnemers of overname. De reserve van de werkervirtualisatie draagt ook de werkers van de herstelomgeving; uitval gaat voor, verder geldt de voorrang voor herstel en overname
Reserve voor herstel en overnamePer cel één plaats op het clusterbeheer voor de besturing van de herstelomgeving; vanaf groeipadstap 2 de capaciteit die de bedrijfskritische diensten van de andere cel na overname vragen, en in cel 2 het hersteldoel van het vlootbeheer: de koude reserveserver en twee werkerknooppunten van de werkervirtualisatieVaste voorrang; schiet de reserve tekort, dan gaan eerst werkers van clusters in het profiel ontwikkelen en beproeven in die cel uit
Koude reserveserverEén per cel, van het werkertype, zonder stroomVervangt een werkerknooppunt van het clusterbeheer na blijvend verlies; schone capaciteit voor de herstelkern
ClusterbeheerTien plaatsen bij drie werkerknooppunten, 24 bij zes: bouwcluster, portaalcluster, één voor de herstelomgeving en zeven voor applicatieclustersGroei met werkerknooppunten
WerkervirtualisatieCirca 130 werkers van maat M bij één werkerknooppunt in reserve; in cel 2 ten minste zes werkerknooppuntenGroei met werkerknooppunten of geheugen
Ruimte, vermogen en poorten44 hoogte-eenheden en circa 22 kW bij vollast in de eerste levering; per leaf 6 van de 32 poorten in gebruikGroeibesluit met ruimte, vermogen, poorten en rekindeling; vier spines boven acht rekken
VoorstelRegel#

De reserve voor herstel en overname wordt in een vaste voorrang ingezet: overname van bedrijfskritische diensten, herstel van vlootbrede voorzieningen, de herstelomgeving bij een incident, gepland onderhoud en als laatste een herstelproef. Schiet de reserve tekort, dan gaan eerst de werkers van clusters in het profiel ontwikkelen en beproeven in die cel uit.

Toelichting

Dat kan omdat clusters in dat profiel opnieuw op te bouwen zijn. De voorrang wordt aangetoond vóór de vrijgave voor bedrijfskritische productie.

VoorstelOntwerpbesluit#

Vanaf groeipadstap 2 ligt de capaciteit voor de overname van bedrijfskritische diensten apart van de uitvalreserve.

Toelichting

Afgewezen: overname uit de uitvalreserve. Na overname draagt de cel het extra werk blijvend, en uitval van één knooppunt legt dan diensten stil. Een herstelproef gebruikt de reserve van de werkervirtualisatie wel tijdelijk.

VoorstelOntwerpbesluit#

Iedere cel heeft één koude reserveserver van het werkertype, zonder stroom. Zij vervangt een werkerknooppunt van het clusterbeheer na blijvend verlies, levert schone rekencapaciteit voor de herstelkern en is in cel 2 deel van het hersteldoel van het vlootbeheer. Na inzet komt er een nieuwe.

Toelichting

Het reserveknooppunt voor herstel zonder gezonde cel is deze koude reserveserver.

VoorstelOntwerpbesluit#

Het hersteldoel van het vlootbeheer in cel 2, de koude reserveserver en twee werkerknooppunten van de werkervirtualisatie, hoort bij de reserve van cel 2. De werkervirtualisatie in cel 2 krijgt daarom ten minste zes werkerknooppunten, plus wat de overname van bedrijfskritische diensten vraagt; zo houdt zij na dat herstel haar uitvalreserve.

Toelichting

Aangetoond bij de opbouw van cel 2.

VoorstelRegel#

Een aanvraag voor bedrijfskritische productie zonder reserve in de andere cel wordt geweigerd. Vragen de bedrijfskritische diensten van cel 1 na overname meer dan de reserve van cel 2, dan krijgt cel 2 werkerknooppunten erbij voordat die diensten in dat profiel gaan. De reserve voor bedrijfskritische diensten wordt afgeleid uit de werkelijk afgenomen diensten en hun bedrijfsimpactanalyse.

VoorstelRegel#

Een herstelproef gebruikt de reserve alleen als geen overname, onderhoud of incident haar nodig heeft; vóór iedere proef wordt de capaciteit gecontroleerd.

Toelichting

Echte uitval gaat voor.

Plaatsen, omvang en groei

VoorstelOntwerpbesluit#

Van de tien plaatsen op het clusterbeheer zijn er twee voor het bouw- en het portaalcluster, één voor de herstelomgeving en zeven voor applicatieclusters van teams, waaronder de proefgroep; er is geen apart proefcluster. Iedere cel houdt één plaats vrij voor de herstelomgeving. Het besturingscluster van het dienstennetwerk telt pas mee zodra het dienstennetwerk er is; de gedeelde databasevoorziening krijgt vanaf groeipadstap 3 plaatsen buiten de tien.

Toelichting

De capaciteit van het clusterbeheer staat bij het clusterbeheer. Aangetoond bij de acceptatie van het clusterbeheer.

VoorstelRegel#

De cel van een applicatiecluster staat in zijn naam in de dienstbeschrijving; de beleidstoetsing weigert een cel zonder vrije plaats. Een bedrijfskritische dienst noemt beide cellen, de schrijvende cel en haar dienstnaam onder het vlootdomein. Een afnemer kiest profiel en cel, niet de plaatsing binnen de cel of de reserve.

VoorstelWaarde#

De samenstelling heeft bij de eerste levering deze omvang en groeit zo.

KenmerkEerste leveringGroei
CellenBeheercel 1 in AM4; het vlootbeheer daarbuiten, op eigen servers in de rekken van AM4Beheercel 2 in AM2 in groeipadstap 2; een volgende cel na een ontwerpbesluit over herstel en gedeelde afhankelijkheden
ServersVlootbeheer en cel 1 volgens de apparatuur per cluster, met de koude reserveserver; daarnaast acht servers voor de leeromgevingCel 2: 25 zoals cel 1 zonder vlootcluster, plus ten minste twee werkerknooppunten voor de werkervirtualisatie en de capaciteit voor bedrijfskritische diensten; drie per cel voor de eigen bewakingsvoorziening in groeipadstap 2; GPU-knooppunten in de werkervirtualisatie in groeipadstap 3
RekkenVier per cel, ieder met drie besturingsknooppunten, twee werkerknooppunten of reserveservers en twee opslagknooppunten; in cel 1 daarnaast het rek van de leeromgevingEerst een derde opslagknooppunt per rek, dan nieuwe rekken; vier spines pas boven acht rekken
Platformclustersvl-01 voor de vloot; in cel 1 c1-os-01, c1-bd-01, c1-vw-01 en c1-cb-01Per nieuwe cel dezelfde vier; één vlootcluster voor de hele vloot
Plaatsen op het clusterbeheerTien, waarvan zeven voor applicatieclusters24 per cel met zes werkerknooppunten; het besturingscluster van het dienstennetwerk telt mee zodra het er is; vanaf groeipadstap 3 per profiel een plaats voor de gedeelde databasevoorziening; tot circa tweehonderd clusters per opslagcluster
Virtuele werkers en opslagCirca 130 werkers van maat M; circa 266 TB bruikbare opslagWerkerknooppunten of geheugen erbij; opslag tot circa 444 TB met schijven, daarna knooppunten en rekken
Ruimte en vermogen44 hoogte-eenheden; circa 22 kW bij vollast, zonder netwerkapparatuur en leeromgevingPer uitbreiding opnieuw berekend
AfnemersHet eerste applicatieteam, in het profiel ontwikkelen en beproevenReguliere productie na de vrijgave daarvoor; bedrijfskritische productie per dienst na de vrijgave daarvoor
VoorstelRegel#

Iedere uitbreiding volgt de rekindeling en heeft een groeibesluit over reserve, foutdomeinen, ruimte, vermogen en poorten; ruimte en vermogen worden per uitbreiding opnieuw berekend.

Dienstniveaus

VoorstelWaarde#

De samenstelling draagt de dienstprofielen met deze normen: volledige opslagbescherming binnen 8 uur, herstart van het versiebeheer binnen 15 minuten, de herstelomgeving binnen 90 minuten opgebouwd, herstel van het vlootbeheer binnen 24 uur en overname binnen de hersteltijd en het herstelpunt uit de dienstbeschrijving. Blijft de reactie op een melding uit, dan volgt escalatie naar de vervanger en daarna naar platformbeheer.

DienstprofielReactie op een meldingBegin van het herstel
Ontwikkelen en beproevenBinnen 8 werkuren, tijdens kantoortijdGeen aparte norm
Reguliere productieBinnen 1 uur, tijdens kantoortijdBinnen 4 uur
Bedrijfskritische productieBinnen 30 minuten, 24 uur per dag en 7 dagen per weekBinnen 1 uur

Bewaking van de samenstelling

VoorstelRegel#

Ieder cluster bewaakt zichzelf en meldt rechtstreeks aan de meldingsroutes. Het vlootbeheer vat de metingen samen, met de historie in de objectopslag van cel 1; in de eerste levering gaat die historie met cel 1 verloren. Ieder platformcluster, ook het vlootcluster, levert zijn audit- en beveiligingslogboeken rechtstreeks aan het SOC.

Toelichting

Zo werkt de detectie ook bij verlies van een cel. Het SOC bevestigt de aansluiting.

VoorstelWaarde#

Iedere meetwaarde van de samenstelling heeft een drempel, een ontvanger en een actie, zodat uitval en krapte zichtbaar worden vóór de harde grens. De meldingen voor een onbereikbaar vlootcluster, uitval van de koppeling, mislukte replicatie en inzet van reserve komen erbij voor de samenstelling en staan in de meldingsroutes zodra de bewaking in gebruik gaat.

MeetwaardeDrempel of normActie
Cluster of basisdienst onbereikbaar, gezien vanuit het vlootbeheerLanger dan 5 minutenMelding aan platformbeheer; zijn alle clusters van een cel onbereikbaar, dan het draaiboek voor uitval van een cel
Vlootcluster onbereikbaarLanger dan 5 minuten, gezien vanuit de bewaking van de basisdienstenclustersMelding aan platformbeheer; controle dat de clusters doorwerken
Koppeling tussen de cellenIedere uitvalMelding aan netwerkbeheer en platformbeheer; geen overname op grond van verbindingsverlies alleen
Replicatie tussen de cellenIedere mislukte replicatie van vrijgegeven inhoud of van de hubback-upMelding aan platformbeheer; achterstand in het vlootoverzicht
TijdsafwijkingMeer dan 1 seconde, ook tussen de tijdbronnenMelding aan platformbeheer
Bezetting van een bundel van serverpoorten60 procent per poort en richtingMelding; beproefd onder uitval
Inzet van reserveIedere inzet van een van de drie reservesMelding aan platformbeheer; capaciteitsrapportage
FirmwarebasislijnAfwijking binnen 30 dagen hersteldNalevingsoverzicht van het firmwarebeheer per cel

Verwijzen hiernaar

Onderwerpen 4