Hoeveel besturingen het clusterbeheer draagt, hoe groot een applicatiecluster mag worden, welke reserve niet wordt uitgegeven en wanneer het platform uitbreidt of bevriest.
Nog niet bevestigd door een mens. Eigenaar: vdo89. Bron in de atlas
De capaciteit van het clusterbeheer telt in plaatsen: iedere plaats is één gehoste besturing. Een applicatiecluster
vraagt daarnaast werkers op de werkervirtualisatie, binnen een quotum dat met het maximumaantal werkers plus één
rekent. Dit onderwerp legt vast hoeveel plaatsen er zijn, hoe ze verdeeld zijn, hoe groot een cluster mag worden en
bij welke grenzen het platform uitbreidt, bevriest of weigert.
Waarom zo
Het aantal pods per knooppunt begrenst het clusterbeheer eerder dan de rekenkracht. Een hogere dichtheid dan de
leverancier aanbeveelt, maakt de gevolgen van één uitval groter; daarom groeit het clusterbeheer met
werkerknooppunten. De reserve is een ontwerpvoorwaarde en geen vrije capaciteit: zij vangt uitval, onderhoud en
herstel op. Omdat servers een levertijd hebben, ligt de actiedrempel ruim vóór de grens, en een aanvraag die de
reserve zou aantasten, wordt geweigerd.
Een hoog beschikbare gehoste besturing vraagt circa 78 pods, 5 processorkernen, 18 GiB geheugen, drie etcd-volumes van 8 GiB en één API-adres (de aangevraagde middelen volgens de leveranciersdocumentatie). Vijf besturingen plus 50 tot 60 eigen pods blijven op een werkerknooppunt onder de 500 pods, terwijl zij maar 25 van de 128 kernen en 90 GiB van de 1,5 TB geheugen vragen.
Toelichting
Het aantal pods per knooppunt begrenst het clusterbeheer dus eerder dan de rekenkracht.
Het clusterbeheer zet maxPods op 500 per werkerknooppunt (KubeletConfig), het door de leverancier aanbevolen maximum, en nooit hoger. Dat geeft vijf besturingen per werkerknooppunt: tien plaatsen bij drie werkerknooppunten, met de middelen van één werkerknooppunt als reserve, en 24 bij zes. Groei gaat via extra werkerknooppunten van hetzelfde type, niet via een hogere dichtheid; het aantal besturingsknooppunten blijft drie.
Toelichting
Bij de standaardwaarde van 250 pods passen maar twee besturingen per werkerknooppunt. Alternatief: een hogere dichtheid dan 500 pods. Die valt buiten de aanbeveling van de leverancier, en één uitval raakt dan meer besturingen. De aantallen staan ook op de clusterpagina.
Van de tien plaatsen in cel 1 zijn er twee voor het bouwcluster en het portaalcluster, één voor de herstelomgeving en zeven voor applicatieclusters van teams, waaronder de proefgroep: clusters van teams die dat afspraken, te beginnen met dat van de testtoepassing van het eerste applicatieteam. Het besturingscluster van het dienstennetwerk telt mee vanaf zijn ingebruikname, en vanaf groeipadstap 3 komt er per profiel een plaats voor de gedeelde databasevoorziening bij. De beleidstoetsing telt de plaatsen.
Toelichting
Platformfuncties en herstel krijgen zo een vaste plaats. Bij het tellen geldt de gereserveerde plaats voor de herstelomgeving als bezet.
De reserve van het clusterbeheer (de middelen van één werkerknooppunt, de plaats voor de herstelomgeving en de koude reserveserver) wordt niet uitgegeven. Een nieuwe besturing komt er alleen bij als na uitval van één werkerknooppunt alles nog past; anders weigert de beleidstoetsing de aanvraag, met uitleg.
Toelichting
Een maandelijks capaciteitsrapport toont het gebruik en de reserve.
De koude reserveserver van het clusterbeheer is het vervangknooppunt na blijvend verlies van een werkerknooppunt, en tegelijk schone rekenkracht voor de herstelkern. Wordt zij ingezet, dan wordt direct een nieuwe besteld.
Toelichting
Alternatieven: geen reserve, of een vierde actief werkerknooppunt. Zonder reserve blijft een besturing na blijvend verlies op twee stemmers; een actief knooppunt is geen schone reserve voor de herstelkern. Een vierde actief werkerknooppunt past alsnog bij groei boven zes werkerknooppunten.
Het clusterbeheer zet bij 80 procent van de plaatsen een uitbreiding in gang en bevriest bij volle bezetting, zodat de levertijd van servers erin past en de reserve vrij blijft. De overige grenzen en acties staan in de tabel.
Grens
Meting
Actie
80 procent van de plaatsen
Bezette en aangevraagde plaatsen tegen 10, na uitbreiding 24; in cel 1 dus 8 van 10
Uitbreiding in gang zetten: werkerknooppunten bestellen, met de levertijd erin; netwerkbeheer bereidt poorten en adressen voor
Alle plaatsen bezet
Idem
Geen nieuwe besturing: de beleidstoetsing weigert de aanvraag met uitleg; bestaande clusters groeien alleen in werkers
450 pods op een werkerknooppunt
Pods per knooppunt
Melding; controle van de spreiding; maxPods blijft 500
85 procent processor of geheugen gedurende 15 minuten
Per werkerknooppunt
Melding; onderzoek naar een besturing die meer gebruikt dan zij aanvraagt
65 procent van een etcd-volume
Vulling per volume van 8 GiB
Melding; onderzoek naar het aantal objecten in dat cluster
28 van de 32 API-adressen
Toegewezen adressen in Infoblox
Netwerkbeheer breidt de reeks uit of voegt vanaf groeipadstap 3 een reeks voor BGP toe
Iedere groeistap van het clusterbeheer vraagt werkerknooppunten van hetzelfde type, poorten op het leaf-paar, adressen in VLAN 610 en 622, een serverprofiel met de firmwarebasislijn en een herhaalde dichtheids- en uitvalproef. Cel 2 komt uit dezelfde code, met eigen VLAN-reeksen; binnen een cluster blijft het IPv4. Buiten het clusterbeheer liggen andere grenzen: ten hoogste 1.000 clustersegmenten per cel in de fabric en circa 200 clusters per opslagcluster.
Bij de acceptatie van het clusterbeheer worden het pod-, volume-, processor- en geheugenbudget per knooppunt onder belasting gemeten, met de overhead en de reserve voor onderhoud en uitval. De meting moet aantonen dat een werkerknooppunt vijf besturingen met reserve draagt. De leeromgeving bewijst alleen werking en volgorde, geen prestaties.
Toelichting
Platformbeheer is eigenaar van de capaciteitsafspraken en herhaalt de meting bij iedere groeistap.
Een applicatiecluster heeft 2 tot 8 werkers in het profiel ontwikkelen en beproeven en 3 tot 8 in reguliere en bedrijfskritische productie, bij bedrijfskritische productie per cel. Het quotum rekent met het maximum plus één werker. Een groter cluster kan alleen met een ontwerpbesluit.
Toelichting
Acht werkers passen in een onderhoudsvenster van 4 uur. Dat de NodePool uitgevallen werkers vervangt en tussen minimum en maximum schaalt, is een acceptatiecriterium; terugvaloptie is een vast aantal werkers met vervanging via een draaiboek.
Het maximumaantal werkers plus één past in het teamquotum en in de gereserveerde capaciteit van de werkervirtualisatie. Het quotum op de infra-naamruimte is dat aantal maal de werkermaat, met een rootvolume van 64 GiB per werker. Een aanvraag die de reserve aantast, wordt geweigerd, en de uitgegeven opslagquota blijven samen onder 75 procent van de bruikbare capaciteit.
Toelichting
De extra werker is de ruimte voor de vervanging bij een update. De beleidstoetsing en de capaciteitsrapportage tonen de naleving aan.
In bedrijfskritische productie geldt voor werkers dezelfde processorverhouding als in reguliere productie: 2 vCPU per fysieke kern. Het profiel verschilt door het tweede exemplaar in de andere cel, niet door de processor, en rekent dus als reguliere productie.
Voor applicatieclusters grijpt het platform in vóór de harde grens. De actiedrempels zijn pods die 15 minuten wachten op het maximum, 85 procent van een quotum en 6.000 regels in een EgressFirewall; voor de standaardinrichting ook een geheimenkoppeling die 1 uur niet synchroniseert en een compliancescan die ouder is dan 8 dagen. De grenzen en acties staan in de tabel.
Grens
Meting
Actie
Plaatsen op het clusterbeheer
Bezet tegen 10, na uitbreiding 24
Uitbreiding vanaf 8; weigering als alles bezet is
Werkers van alle clusters
Som van de maximumaantallen plus één, maal de maat, bij de processorverhouding van het profiel
Een aanvraag die de reserve aantast, wordt geweigerd
Werkers van één cluster
Op het maximum, pods 15 minuten wachtend
Melding aan het team
Werker
Processor of geheugen boven 85 procent gedurende 15 minuten
Melding aan platformbeheer
Quotum van een naamruimte
Aangevraagd tegen quotum
85 procent: melding aan het team; 100 procent: weigering
Opslagcluster
Uitgegeven quota; feitelijk verbruik
Quota samen onder 75 procent; meldingen bij 50, 65 en 85 procent van het verbruik
EgressFirewall
Regels per naamruimte, grens 8.000
Bij 6.000 een melding; bestemmingen samenvoegen
Adressen
/26 per cluster
Draagt 8 werkers, één extra werker, het ingangsadres en de databaseadressen
Het aanbod applicatieclusters begint in cel 1 klein en groeit langs het groeipad, zoals de tabel laat zien.
Kenmerk
Eerste levering in cel 1
Groei
Plaatsen voor gehoste besturingen
10: bouwcluster, portaalcluster, 1 voor de herstelomgeving en 7 voor applicatieclusters van teams
24 met zes werkerknooppunten; het besturingscluster van het dienstennetwerk komt erbij met het dienstennetwerk; vanaf groeipadstap 3 per profiel een plaats voor de gedeelde databasevoorziening
Per besturing
Circa 78 pods, 5 vCPU, 18 GiB geheugen, 3 etcd-volumes van 8 GiB en één API-adres
Gelijk; een hogere dichtheid is uitgesloten
Afnemers
Het eerste applicatieteam met zijn testtoepassing
Meer teams in groeipadstap 3; overname van bestaande containerclusters
Dienstprofielen en cellen
Ontwikkelen en beproeven in cel 1
Reguliere en bedrijfskritische productie na hun vrijgave; cel 2 met een eigen clusterbeheer in groeipadstap 2 en een tweede cluster per bedrijfskritische dienst
Werkers
Maten S, M en L; 2 tot 8 per cluster; rekenwaarde circa 130 werkers van maat M
In reguliere productie circa 96 van maat M (processor 2:1); GPU-werkers in groeipadstap 3
Opslag
Normaal-blok (standaard) en normaal-bestand via directe opslagtoegang, alleen voor clusters met volumes; objectopslag als dienst
Lagen ‘snel’ en ‘bulk’
Netwerk
Standaardvariant: eigen VLAN en /26 per cluster, ingang via de externe verkeersverdeling
Afgeschermd applicatienetwerk en bestaand netwerkverband; IPv6 aan de ingang in groeipadstap 3
Verkeer tussen diensten
Netwerkbeleid en versleuteling door de toepassing zelf
Dienstennetwerk met één besturing per cel vanaf zijn ingebruikname in groeipadstap 3
Toelichting
De aantallen werkers zijn rekenwaarden bij de processorverhouding per profiel, geen verkochte capaciteit.
De reserve van de werkervirtualisatie, één werkerknooppunt, draagt uitval, onderhoud, de werkers van de herstelomgeving en vanaf groeipadstap 2 de overname van diensten in bedrijfskritische productie. Zij draagt geen nieuwe clusters.
Het gebruik van het clusterbeheer wordt per gehost cluster gemeten, en de toegewezen en gebruikte capaciteit per cluster is zichtbaar voor kostenbeheer.
Toelichting
Zo zijn kosten en gebruik per dienst te volgen; het maandelijkse capaciteitsrapport bundelt ze.