Drie soorten reserve per cel, die niet naar afnemers gaan en in een vaste voorrang worden ingezet, de plaatsen op het clusterbeheer, de dienstniveaus van de samenstelling en de meldingen die uitval en krapte zichtbaar maken.
Nog niet bevestigd door een mens. Eigenaar: vdo89. Bron in de atlas
Iedere cel houdt drie soorten reserve vast: uitvalreserve per cluster, reserve voor herstel en overname, en een koude
reserveserver. Die reserve gaat niet naar afnemers. Daarnaast liggen de plaatsen op het clusterbeheer, de omvang en
groei van de samenstelling, de dienstniveaus en de meetwaarden met hun drempels vast.
Waarom zo
Herstel en overname moeten capaciteit vinden op het moment dat het nodig is. Uitvalreserve die als afnamecapaciteit is
uitgegeven, of overname uit de uitvalreserve, laat een cel na overname op één knooppunt van stilstand draaien. Een vaste
voorrang maakt vooraf duidelijk wat wijkt als de reserve tekortschiet.
De waarden zijn een voorstel, afgeleid van de capaciteit van de eerste levering; de meldingen maken zichtbaar wanneer de
reserve wordt aangesproken of een grens nadert.
De reserve voor uitval, herstel en overname ligt per cel vast en gaat niet naar afnemers. Uitvalreserve is capaciteit voor het verlies van één knooppunt, geen vrij uit te geven quotum.
Toelichting
Zo vinden herstel en overname capaciteit wanneer het nodig is. Gecontroleerd met de capaciteitsrapportage en de beleidstoetsing.
Iedere cel kent drie soorten reserve, naast de capaciteitsgrenzen van de samenstelling. De capaciteit per cluster ligt vast bij de clusters zelf.
Onderdeel
Grens of reserve
Actie
Uitvalreserve
Per cluster de uitval van één knooppunt: bij het vlootcluster en het basisdienstencluster twee van drie knooppunten; bij het clusterbeheer de middelen van één werkerknooppunt; bij de werkervirtualisatie één werkerknooppunt; bij het opslagcluster het vierde rek en de vulgrens van 65 procent
Nooit voor afnemers of overname. De reserve van de werkervirtualisatie draagt ook de werkers van de herstelomgeving; uitval gaat voor, verder geldt de voorrang voor herstel en overname
Reserve voor herstel en overname
Per cel één plaats op het clusterbeheer voor de besturing van de herstelomgeving; vanaf groeipadstap 2 de capaciteit die de bedrijfskritische diensten van de andere cel na overname vragen, en in cel 2 het hersteldoel van het vlootbeheer: de koude reserveserver en twee werkerknooppunten van de werkervirtualisatie
Vaste voorrang; schiet de reserve tekort, dan gaan eerst werkers van clusters in het profiel ontwikkelen en beproeven in die cel uit
Koude reserveserver
Eén per cel, van het werkertype, zonder stroom
Vervangt een werkerknooppunt van het clusterbeheer na blijvend verlies; schone capaciteit voor de herstelkern
Clusterbeheer
Tien plaatsen bij drie werkerknooppunten, 24 bij zes: bouwcluster, portaalcluster, één voor de herstelomgeving en zeven voor applicatieclusters
Groei met werkerknooppunten
Werkervirtualisatie
Circa 130 werkers van maat M bij één werkerknooppunt in reserve; in cel 2 ten minste zes werkerknooppunten
Groei met werkerknooppunten of geheugen
Ruimte, vermogen en poorten
44 hoogte-eenheden en circa 22 kW bij vollast in de eerste levering; per leaf 6 van de 32 poorten in gebruik
Groeibesluit met ruimte, vermogen, poorten en rekindeling; vier spines boven acht rekken
De reserve voor herstel en overname wordt in een vaste voorrang ingezet: overname van bedrijfskritische diensten, herstel van vlootbrede voorzieningen, de herstelomgeving bij een incident, gepland onderhoud en als laatste een herstelproef. Schiet de reserve tekort, dan gaan eerst de werkers van clusters in het profiel ontwikkelen en beproeven in die cel uit.
Toelichting
Dat kan omdat clusters in dat profiel opnieuw op te bouwen zijn. De voorrang wordt aangetoond vóór de vrijgave voor bedrijfskritische productie.
Vanaf groeipadstap 2 ligt de capaciteit voor de overname van bedrijfskritische diensten apart van de uitvalreserve.
Toelichting
Afgewezen: overname uit de uitvalreserve. Na overname draagt de cel het extra werk blijvend, en uitval van één knooppunt legt dan diensten stil. Een herstelproef gebruikt de reserve van de werkervirtualisatie wel tijdelijk.
Iedere cel heeft één koude reserveserver van het werkertype, zonder stroom. Zij vervangt een werkerknooppunt van het clusterbeheer na blijvend verlies, levert schone rekencapaciteit voor de herstelkern en is in cel 2 deel van het hersteldoel van het vlootbeheer. Na inzet komt er een nieuwe.
Toelichting
Het reserveknooppunt voor herstel zonder gezonde cel is deze koude reserveserver.
Het hersteldoel van het vlootbeheer in cel 2, de koude reserveserver en twee werkerknooppunten van de werkervirtualisatie, hoort bij de reserve van cel 2. De werkervirtualisatie in cel 2 krijgt daarom ten minste zes werkerknooppunten, plus wat de overname van bedrijfskritische diensten vraagt; zo houdt zij na dat herstel haar uitvalreserve.
Een aanvraag voor bedrijfskritische productie zonder reserve in de andere cel wordt geweigerd. Vragen de bedrijfskritische diensten van cel 1 na overname meer dan de reserve van cel 2, dan krijgt cel 2 werkerknooppunten erbij voordat die diensten in dat profiel gaan. De reserve voor bedrijfskritische diensten wordt afgeleid uit de werkelijk afgenomen diensten en hun bedrijfsimpactanalyse.
Een herstelproef gebruikt de reserve alleen als geen overname, onderhoud of incident haar nodig heeft; vóór iedere proef wordt de capaciteit gecontroleerd.
Van de tien plaatsen op het clusterbeheer zijn er twee voor het bouw- en het portaalcluster, één voor de herstelomgeving en zeven voor applicatieclusters van teams, waaronder de proefgroep; er is geen apart proefcluster. Iedere cel houdt één plaats vrij voor de herstelomgeving. Het besturingscluster van het dienstennetwerk telt pas mee zodra het dienstennetwerk er is; de gedeelde databasevoorziening krijgt vanaf groeipadstap 3 plaatsen buiten de tien.
Toelichting
De capaciteit van het clusterbeheer staat bij het clusterbeheer. Aangetoond bij de acceptatie van het clusterbeheer.
De cel van een applicatiecluster staat in zijn naam in de dienstbeschrijving; de beleidstoetsing weigert een cel zonder vrije plaats. Een bedrijfskritische dienst noemt beide cellen, de schrijvende cel en haar dienstnaam onder het vlootdomein. Een afnemer kiest profiel en cel, niet de plaatsing binnen de cel of de reserve.
De samenstelling heeft bij de eerste levering deze omvang en groeit zo.
Kenmerk
Eerste levering
Groei
Cellen
Beheercel 1 in AM4; het vlootbeheer daarbuiten, op eigen servers in de rekken van AM4
Beheercel 2 in AM2 in groeipadstap 2; een volgende cel na een ontwerpbesluit over herstel en gedeelde afhankelijkheden
Servers
Vlootbeheer en cel 1 volgens de apparatuur per cluster, met de koude reserveserver; daarnaast acht servers voor de leeromgeving
Cel 2: 25 zoals cel 1 zonder vlootcluster, plus ten minste twee werkerknooppunten voor de werkervirtualisatie en de capaciteit voor bedrijfskritische diensten; drie per cel voor de eigen bewakingsvoorziening in groeipadstap 2; GPU-knooppunten in de werkervirtualisatie in groeipadstap 3
Rekken
Vier per cel, ieder met drie besturingsknooppunten, twee werkerknooppunten of reserveservers en twee opslagknooppunten; in cel 1 daarnaast het rek van de leeromgeving
Eerst een derde opslagknooppunt per rek, dan nieuwe rekken; vier spines pas boven acht rekken
Platformclusters
vl-01 voor de vloot; in cel 1 c1-os-01, c1-bd-01, c1-vw-01 en c1-cb-01
Per nieuwe cel dezelfde vier; één vlootcluster voor de hele vloot
Plaatsen op het clusterbeheer
Tien, waarvan zeven voor applicatieclusters
24 per cel met zes werkerknooppunten; het besturingscluster van het dienstennetwerk telt mee zodra het er is; vanaf groeipadstap 3 per profiel een plaats voor de gedeelde databasevoorziening; tot circa tweehonderd clusters per opslagcluster
Virtuele werkers en opslag
Circa 130 werkers van maat M; circa 266 TB bruikbare opslag
Werkerknooppunten of geheugen erbij; opslag tot circa 444 TB met schijven, daarna knooppunten en rekken
Ruimte en vermogen
44 hoogte-eenheden; circa 22 kW bij vollast, zonder netwerkapparatuur en leeromgeving
Per uitbreiding opnieuw berekend
Afnemers
Het eerste applicatieteam, in het profiel ontwikkelen en beproeven
Reguliere productie na de vrijgave daarvoor; bedrijfskritische productie per dienst na de vrijgave daarvoor
Iedere uitbreiding volgt de rekindeling en heeft een groeibesluit over reserve, foutdomeinen, ruimte, vermogen en poorten; ruimte en vermogen worden per uitbreiding opnieuw berekend.
De samenstelling draagt de dienstprofielen met deze normen: volledige opslagbescherming binnen 8 uur, herstart van het versiebeheer binnen 15 minuten, de herstelomgeving binnen 90 minuten opgebouwd, herstel van het vlootbeheer binnen 24 uur en overname binnen de hersteltijd en het herstelpunt uit de dienstbeschrijving. Blijft de reactie op een melding uit, dan volgt escalatie naar de vervanger en daarna naar platformbeheer.
Dienstprofiel
Reactie op een melding
Begin van het herstel
Ontwikkelen en beproeven
Binnen 8 werkuren, tijdens kantoortijd
Geen aparte norm
Reguliere productie
Binnen 1 uur, tijdens kantoortijd
Binnen 4 uur
Bedrijfskritische productie
Binnen 30 minuten, 24 uur per dag en 7 dagen per week
Ieder cluster bewaakt zichzelf en meldt rechtstreeks aan de meldingsroutes. Het vlootbeheer vat de metingen samen, met de historie in de objectopslag van cel 1; in de eerste levering gaat die historie met cel 1 verloren. Ieder platformcluster, ook het vlootcluster, levert zijn audit- en beveiligingslogboeken rechtstreeks aan het SOC.
Toelichting
Zo werkt de detectie ook bij verlies van een cel. Het SOC bevestigt de aansluiting.
Iedere meetwaarde van de samenstelling heeft een drempel, een ontvanger en een actie, zodat uitval en krapte zichtbaar worden vóór de harde grens. De meldingen voor een onbereikbaar vlootcluster, uitval van de koppeling, mislukte replicatie en inzet van reserve komen erbij voor de samenstelling en staan in de meldingsroutes zodra de bewaking in gebruik gaat.
Meetwaarde
Drempel of norm
Actie
Cluster of basisdienst onbereikbaar, gezien vanuit het vlootbeheer
Langer dan 5 minuten
Melding aan platformbeheer; zijn alle clusters van een cel onbereikbaar, dan het draaiboek voor uitval van een cel
Vlootcluster onbereikbaar
Langer dan 5 minuten, gezien vanuit de bewaking van de basisdienstenclusters
Melding aan platformbeheer; controle dat de clusters doorwerken
Koppeling tussen de cellen
Iedere uitval
Melding aan netwerkbeheer en platformbeheer; geen overname op grond van verbindingsverlies alleen
Replicatie tussen de cellen
Iedere mislukte replicatie van vrijgegeven inhoud of van de hubback-up
Melding aan platformbeheer; achterstand in het vlootoverzicht