1 open besluit1414 voorstellen

Onderwerp

Capaciteit en reserve

Hoeveel besturingen het clusterbeheer draagt, hoe groot een applicatiecluster mag worden, welke reserve niet wordt uitgegeven en wanneer het platform uitbreidt of bevriest.

Nog niet bevestigd door een mens. Eigenaar: vdo89. Bron in de atlas

Domein
Volgt uit
Functies
Producten
Verwant

Wat het is

De capaciteit van het clusterbeheer telt in plaatsen: iedere plaats is één gehoste besturing. Een applicatiecluster vraagt daarnaast werkers op de werkervirtualisatie, binnen een quotum dat met het maximumaantal werkers plus één rekent. Dit onderwerp legt vast hoeveel plaatsen er zijn, hoe ze verdeeld zijn, hoe groot een cluster mag worden en bij welke grenzen het platform uitbreidt, bevriest of weigert.

Waarom zo

Het aantal pods per knooppunt begrenst het clusterbeheer eerder dan de rekenkracht. Een hogere dichtheid dan de leverancier aanbeveelt, maakt de gevolgen van één uitval groter; daarom groeit het clusterbeheer met werkerknooppunten. De reserve is een ontwerpvoorwaarde en geen vrije capaciteit: zij vangt uitval, onderhoud en herstel op. Omdat servers een levertijd hebben, ligt de actiedrempel ruim vóór de grens, en een aanvraag die de reserve zou aantasten, wordt geweigerd.

Uitspraken

0 vastgesteld15 voorstellen

Alle 15 voorstellen vaststellen

Plaatsen op het clusterbeheer

VoorstelWaarde#

Een hoog beschikbare gehoste besturing vraagt circa 78 pods, 5 processorkernen, 18 GiB geheugen, drie etcd-volumes van 8 GiB en één API-adres (de aangevraagde middelen volgens de leveranciersdocumentatie). Vijf besturingen plus 50 tot 60 eigen pods blijven op een werkerknooppunt onder de 500 pods, terwijl zij maar 25 van de 128 kernen en 90 GiB van de 1,5 TB geheugen vragen.

Toelichting

Het aantal pods per knooppunt begrenst het clusterbeheer dus eerder dan de rekenkracht.

VoorstelOntwerpbesluit#

Het clusterbeheer zet maxPods op 500 per werkerknooppunt (KubeletConfig), het door de leverancier aanbevolen maximum, en nooit hoger. Dat geeft vijf besturingen per werkerknooppunt: tien plaatsen bij drie werkerknooppunten, met de middelen van één werkerknooppunt als reserve, en 24 bij zes. Groei gaat via extra werkerknooppunten van hetzelfde type, niet via een hogere dichtheid; het aantal besturingsknooppunten blijft drie.

Toelichting

Bij de standaardwaarde van 250 pods passen maar twee besturingen per werkerknooppunt. Alternatief: een hogere dichtheid dan 500 pods. Die valt buiten de aanbeveling van de leverancier, en één uitval raakt dan meer besturingen. De aantallen staan ook op de clusterpagina.

VoorstelOntwerpbesluit#

Van de tien plaatsen in cel 1 zijn er twee voor het bouwcluster en het portaalcluster, één voor de herstelomgeving en zeven voor applicatieclusters van teams, waaronder de proefgroep: clusters van teams die dat afspraken, te beginnen met dat van de testtoepassing van het eerste applicatieteam. Het besturingscluster van het dienstennetwerk telt mee vanaf zijn ingebruikname, en vanaf groeipadstap 3 komt er per profiel een plaats voor de gedeelde databasevoorziening bij. De beleidstoetsing telt de plaatsen.

Toelichting

Platformfuncties en herstel krijgen zo een vaste plaats. Bij het tellen geldt de gereserveerde plaats voor de herstelomgeving als bezet.

VoorstelRegel#

De reserve van het clusterbeheer (de middelen van één werkerknooppunt, de plaats voor de herstelomgeving en de koude reserveserver) wordt niet uitgegeven. Een nieuwe besturing komt er alleen bij als na uitval van één werkerknooppunt alles nog past; anders weigert de beleidstoetsing de aanvraag, met uitleg.

Toelichting

Een maandelijks capaciteitsrapport toont het gebruik en de reserve.

VoorstelOntwerpbesluit#

De koude reserveserver van het clusterbeheer is het vervangknooppunt na blijvend verlies van een werkerknooppunt, en tegelijk schone rekenkracht voor de herstelkern. Wordt zij ingezet, dan wordt direct een nieuwe besteld.

Toelichting

Alternatieven: geen reserve, of een vierde actief werkerknooppunt. Zonder reserve blijft een besturing na blijvend verlies op twee stemmers; een actief knooppunt is geen schone reserve voor de herstelkern. Een vierde actief werkerknooppunt past alsnog bij groei boven zes werkerknooppunten.

VoorstelWaarde#

Het clusterbeheer zet bij 80 procent van de plaatsen een uitbreiding in gang en bevriest bij volle bezetting, zodat de levertijd van servers erin past en de reserve vrij blijft. De overige grenzen en acties staan in de tabel.

GrensMetingActie
80 procent van de plaatsenBezette en aangevraagde plaatsen tegen 10, na uitbreiding 24; in cel 1 dus 8 van 10Uitbreiding in gang zetten: werkerknooppunten bestellen, met de levertijd erin; netwerkbeheer bereidt poorten en adressen voor
Alle plaatsen bezetIdemGeen nieuwe besturing: de beleidstoetsing weigert de aanvraag met uitleg; bestaande clusters groeien alleen in werkers
450 pods op een werkerknooppuntPods per knooppuntMelding; controle van de spreiding; maxPods blijft 500
85 procent processor of geheugen gedurende 15 minutenPer werkerknooppuntMelding; onderzoek naar een besturing die meer gebruikt dan zij aanvraagt
65 procent van een etcd-volumeVulling per volume van 8 GiBMelding; onderzoek naar het aantal objecten in dat cluster
28 van de 32 API-adressenToegewezen adressen in InfobloxNetwerkbeheer breidt de reeks uit of voegt vanaf groeipadstap 3 een reeks voor BGP toe
VoorstelRegel#

Iedere groeistap van het clusterbeheer vraagt werkerknooppunten van hetzelfde type, poorten op het leaf-paar, adressen in VLAN 610 en 622, een serverprofiel met de firmwarebasislijn en een herhaalde dichtheids- en uitvalproef. Cel 2 komt uit dezelfde code, met eigen VLAN-reeksen; binnen een cluster blijft het IPv4. Buiten het clusterbeheer liggen andere grenzen: ten hoogste 1.000 clustersegmenten per cel in de fabric en circa 200 clusters per opslagcluster.

VoorstelMaatregel#

Bij de acceptatie van het clusterbeheer worden het pod-, volume-, processor- en geheugenbudget per knooppunt onder belasting gemeten, met de overhead en de reserve voor onderhoud en uitval. De meting moet aantonen dat een werkerknooppunt vijf besturingen met reserve draagt. De leeromgeving bewijst alleen werking en volgorde, geen prestaties.

Toelichting

Platformbeheer is eigenaar van de capaciteitsafspraken en herhaalt de meting bij iedere groeistap.

Grootte van een applicatiecluster

VoorstelOntwerpbesluit#

Een applicatiecluster heeft 2 tot 8 werkers in het profiel ontwikkelen en beproeven en 3 tot 8 in reguliere en bedrijfskritische productie, bij bedrijfskritische productie per cel. Het quotum rekent met het maximum plus één werker. Een groter cluster kan alleen met een ontwerpbesluit.

Toelichting

Acht werkers passen in een onderhoudsvenster van 4 uur. Dat de NodePool uitgevallen werkers vervangt en tussen minimum en maximum schaalt, is een acceptatiecriterium; terugvaloptie is een vast aantal werkers met vervanging via een draaiboek.

VoorstelRegel#

Het maximumaantal werkers plus één past in het teamquotum en in de gereserveerde capaciteit van de werkervirtualisatie. Het quotum op de infra-naamruimte is dat aantal maal de werkermaat, met een rootvolume van 64 GiB per werker. Een aanvraag die de reserve aantast, wordt geweigerd, en de uitgegeven opslagquota blijven samen onder 75 procent van de bruikbare capaciteit.

Toelichting

De extra werker is de ruimte voor de vervanging bij een update. De beleidstoetsing en de capaciteitsrapportage tonen de naleving aan.

VoorstelOntwerpbesluit#

In bedrijfskritische productie geldt voor werkers dezelfde processorverhouding als in reguliere productie: 2 vCPU per fysieke kern. Het profiel verschilt door het tweede exemplaar in de andere cel, niet door de processor, en rekent dus als reguliere productie.

VoorstelWaarde#

Voor applicatieclusters grijpt het platform in vóór de harde grens. De actiedrempels zijn pods die 15 minuten wachten op het maximum, 85 procent van een quotum en 6.000 regels in een EgressFirewall; voor de standaardinrichting ook een geheimenkoppeling die 1 uur niet synchroniseert en een compliancescan die ouder is dan 8 dagen. De grenzen en acties staan in de tabel.

GrensMetingActie
Plaatsen op het clusterbeheerBezet tegen 10, na uitbreiding 24Uitbreiding vanaf 8; weigering als alles bezet is
Werkers van alle clustersSom van de maximumaantallen plus één, maal de maat, bij de processorverhouding van het profielEen aanvraag die de reserve aantast, wordt geweigerd
Werkers van één clusterOp het maximum, pods 15 minuten wachtendMelding aan het team
WerkerProcessor of geheugen boven 85 procent gedurende 15 minutenMelding aan platformbeheer
Quotum van een naamruimteAangevraagd tegen quotum85 procent: melding aan het team; 100 procent: weigering
OpslagclusterUitgegeven quota; feitelijk verbruikQuota samen onder 75 procent; meldingen bij 50, 65 en 85 procent van het verbruik
EgressFirewallRegels per naamruimte, grens 8.000Bij 6.000 een melding; bestemmingen samenvoegen
Adressen/26 per clusterDraagt 8 werkers, één extra werker, het ingangsadres en de databaseadressen
VoorstelWaarde#

Het aanbod applicatieclusters begint in cel 1 klein en groeit langs het groeipad, zoals de tabel laat zien.

KenmerkEerste levering in cel 1Groei
Plaatsen voor gehoste besturingen10: bouwcluster, portaalcluster, 1 voor de herstelomgeving en 7 voor applicatieclusters van teams24 met zes werkerknooppunten; het besturingscluster van het dienstennetwerk komt erbij met het dienstennetwerk; vanaf groeipadstap 3 per profiel een plaats voor de gedeelde databasevoorziening
Per besturingCirca 78 pods, 5 vCPU, 18 GiB geheugen, 3 etcd-volumes van 8 GiB en één API-adresGelijk; een hogere dichtheid is uitgesloten
AfnemersHet eerste applicatieteam met zijn testtoepassingMeer teams in groeipadstap 3; overname van bestaande containerclusters
Dienstprofielen en cellenOntwikkelen en beproeven in cel 1Reguliere en bedrijfskritische productie na hun vrijgave; cel 2 met een eigen clusterbeheer in groeipadstap 2 en een tweede cluster per bedrijfskritische dienst
WerkersMaten S, M en L; 2 tot 8 per cluster; rekenwaarde circa 130 werkers van maat MIn reguliere productie circa 96 van maat M (processor 2:1); GPU-werkers in groeipadstap 3
OpslagNormaal-blok (standaard) en normaal-bestand via directe opslagtoegang, alleen voor clusters met volumes; objectopslag als dienstLagen ‘snel’ en ‘bulk’
NetwerkStandaardvariant: eigen VLAN en /26 per cluster, ingang via de externe verkeersverdelingAfgeschermd applicatienetwerk en bestaand netwerkverband; IPv6 aan de ingang in groeipadstap 3
Verkeer tussen dienstenNetwerkbeleid en versleuteling door de toepassing zelfDienstennetwerk met één besturing per cel vanaf zijn ingebruikname in groeipadstap 3
Toelichting

De aantallen werkers zijn rekenwaarden bij de processorverhouding per profiel, geen verkochte capaciteit.

Reserve en zichtbaarheid

VoorstelUitgangspunt#

De reserve van de werkervirtualisatie, één werkerknooppunt, draagt uitval, onderhoud, de werkers van de herstelomgeving en vanaf groeipadstap 2 de overname van diensten in bedrijfskritische productie. Zij draagt geen nieuwe clusters.

VoorstelRegel#

Het gebruik van het clusterbeheer wordt per gehost cluster gemeten, en de toegewezen en gebruikte capaciteit per cluster is zichtbaar voor kostenbeheer.

Toelichting

Zo zijn kosten en gebruik per dienst te volgen; het maandelijkse capaciteitsrapport bundelt ze.

Verwijzen hiernaar

Onderwerpen 4