1 open besluit1414 voorstellen

Onderwerp

Capaciteit, overboeking en reserve

Hoeveel de werkervirtualisatie draagt, hoe processor en geheugen worden toegewezen, welke reserve niet wordt uitgegeven en wanneer het platform uitbreidt of bevriest.

Nog niet bevestigd door een mens. Eigenaar: vdo89. Bron in de atlas

Domein
Volgt uit
Functies
Producten
Verwant

Wat het is

De werkervirtualisatie telt haar capaciteit bij N-1: wat drie van de vier werkerknooppunten dragen als één knooppunt vrij blijft. Processor en geheugen worden per profiel toegewezen, met een quotum per naamruimte, en geboekt op de gereserveerde capaciteit: het maximumaantal werkers plus één per applicatiecluster en het quotum per afnemer van virtuele servers. Drempels bij 75, 90 en 100 procent sturen uitbreiding en bevriezing.

Waarom zo

Voorspelbare prestaties vragen dat geheugen niet wordt overboekt en de processor per fysieke kern begrensd blijft. De reserve is een ontwerpvoorwaarde en geen vrije capaciteit: zij vangt onderhoud, uitval, herstel en later de overname van bedrijfskritische diensten op. Omdat groei per server gaat en servers een levertijd hebben, rekent dit voorstel met gereserveerde capaciteit en ligt de actiedrempel ruim vóór de harde grens.

Uitspraken

0 vastgesteld11 voorstellen

Alle 11 voorstellen vaststellen

Toewijzing van processor en geheugen

VoorstelOntwerpbesluit#

De profielen delen één werkervirtualisatie. De clusterbrede toewijzingsverhouding is 4:1 per kern, ingesteld als 2 per thread omdat de virtualisatie per thread rekent; werkers en machines in reguliere en bedrijfskritische productie vragen per vCPU één thread aan en komen zo op 2:1 per fysieke kern.

Toelichting

Alternatief: aparte werkerknooppunten per profiel. Met vier werkerknooppunten versnippert dat capaciteit en reserve; het past pas bij veel meer werkerknooppunten per profiel. De processoraanvraag per machine en per NodePool is een acceptatiecriterium; terugvaloptie is 2:1 voor het hele cluster zodra reguliere productie op de werkervirtualisatie staat, en dan passen er circa 96 in plaats van 130 werkers van maat M.

VoorstelRegel#

Iedere naamruimte op de werkervirtualisatie heeft een quotum voor processor, geheugen, opslag en aantal machines, per afnemer vastgelegd in de dienstbeschrijving. Een aanvraag erboven wordt geweigerd.

Reserve

VoorstelRegel#

Eén werkerknooppunt blijft vrij als reserve voor onderhoud en uitval (N-1), en ook de reserve voor overname wordt niet uitgegeven. Bij krapte komen er geen nieuwe afnemers bij.

Toelichting

Alternatief: alle werkerknooppunten vullen. Dan is er na uitval of bij onderhoud geen plaats en geen herstelomgeving. Het capaciteitsoverzicht toont de reserve.

VoorstelOntwerpbesluit#

De N-1-reserve draagt onderhoud, uitval en op afroep de herstelomgeving: zolang er één cel is, die van cel 1 zelf, met drie werkers en twee herstelservers en samen met een teruggezet applicatiecluster ten hoogste één werkerknooppunt. Vanaf groeipadstap 2 komt de overname van de diensten in bedrijfskritische productie van de andere cel erbovenop, en moeten in cel 2 twee werkerknooppunten vrij te maken zijn voor het herstel van het vlootbeheer. Bij een incident gaat overname vóór herstel en herstel vóór onderhoud.

Toelichting

Gevolg: tijdens onderhoud is er geen herstelproef.

VoorstelOntwerpbesluit#

De koude reserveserver blijft het vervangknooppunt van het clusterbeheer; de werkervirtualisatie gebruikt haar alleen tijdelijk, met een besluit van platformbeheer. Na blijvend verlies van een werkerknooppunt werkt de werkervirtualisatie zonder N-1-reserve tot de vervanger er is: dan komen er geen nieuwe afnemers bij en is er geen gepland onderhoud.

Rekenwaarden, drempels en groei

VoorstelWaarde#

De capaciteit bij N-1 is wat drie van de vier werkerknooppunten dragen: circa 4,2 TB geheugen (3 × 1,5 TB, min circa 100 GB per knooppunt voor systeem en virtualisatie) en 384 fysieke kernen, dus 1.536 vCPU bij 4:1 of 768 bij 2:1. Dat zijn circa 130 werkers van maat M in ontwikkelen en beproeven, waar het geheugen begrenst, of 96 in reguliere en bedrijfskritische productie, waar de processor begrenst: rekenwaarden, geen verkochte capaciteit.

Toelichting

Geboekt wordt de gereserveerde capaciteit: per applicatiecluster het maximumaantal werkers plus één, per afnemer van virtuele servers zijn quotum. De werkelijke kernen, threads, het geheugen, de overhead en de plaatsbaarheid worden onder belasting gemeten op het gebruikte servertype en vastgelegd. De rekenregel staat ook op de clusterpagina.

VoorstelWaarde#

De omvang bij de eerste levering en de beoogde groei staan in de tabel.

KenmerkBij de eerste leveringGroei
Servers3 besturingsknooppunten en 4 werkerknooppuntenPer werkerknooppunt; geheugen tot 6 TB per knooppunt
Geheugen voor machinesCirca 4,2 TB bij één werkerknooppunt in reserveCirca 1,4 TB per extra werkerknooppunt
Processor1.536 vCPU bij 4:1 of 768 bij 2:1, per fysieke kern over drie werkerknooppunten512 of 256 vCPU per extra werkerknooppunt
Virtuele werkersCirca 130 van maat M in ontwikkelen en beproeven of 96 in reguliere en bedrijfskritische productie; rekenwaardenVolgt de werkerknooppunten
Applicatieclusters10 plaatsen op het clusterbeheer, elk cluster met een eigen segment24 bij zes werkerknooppunten van het clusterbeheer; ten hoogste 1.000 clustersegmenten per cel
Virtuele serversAlleen proefmachines van het platformVanaf groeipadstap 3 per afnemer, binnen zijn quotum
Virtuele schijven64 GiB rootvolume per werker, circa 8,9 TB bij 130 werkersBinnen de grenzen van het opslagcluster
OpslagaansluitingenEén vast adres op VLAN 620 per werker van een applicatiecluster met volumesCirca 1.000 adressen in het /22 van de cel, gedeeld met platformclusters en opslagknooppunten
GPUGeenGPU-knooppunten met 2 × 96 GB in groeipadstap 3, als eigen groep
VoorstelWaarde#

De capaciteitsdrempels gelden voor de gereserveerde capaciteit bij N-1: bij 75 procent wordt uitgebreid, bij 90 procent bevroren, en 100 procent is de harde grens. Omdat groei per server gaat, wordt tijdig besteld.

GrensMetingActie
75 procentGereserveerd geheugen en gereserveerde processorcapaciteit als deel van de capaciteit bij N-1; het in reeksen gereserveerde deel van het /22 op VLAN 620Uitbreiding in gang zetten: werkerknooppunt of geheugen bestellen, met de levertijd erin; jaarlijks herijkt
90 procentAls hierbovenBevriezen: geen nieuwe afnemers en geen hogere maxima; alleen vervanging en herstel
100 procentCapaciteit bij N-1Harde grens: meer past niet na uitval van een werkerknooppunt; melding met hoge urgentie
SegmentenAantal clustersegmenten in de celGeen nieuw segment boven de in de leeromgeving aangetoonde grens voor localnet-netwerken per werkerknooppunt, of boven 1.000 per cel
Toelichting

Aanvaard restrisico: reeksen van maximum plus één vullen het /22 op VLAN 620 sneller dan het gebruik; de drempels rekenen daarom met het gereserveerde deel.

VoorstelUitgangspunt#

Meer geheugen helpt alleen in ontwikkelen en beproeven, tot de processor begrenst bij circa 2,1 TB per werkerknooppunt (1.536 vCPU, 192 werkers van maat M); in reguliere en bedrijfskritische productie begrenst de processor al bij 1,5 TB. Groei gaat daarom vooral per werkerknooppunt.

VoorstelRegel#

Toegewezen en gebruikte capaciteit is per applicatiecluster en afnemer maandelijks zichtbaar voor kostenbeheer; teams zien alleen hun eigen naamruimten.

Toelichting

De maandelijkse capaciteitsrapportage is het bewijs.

Verwijzen hiernaar

Onderwerpen 3