Alle inzichten
Inference · On-prem & private cloud

Soevereine vLLM-deployment — en de vendorchecklist

Open gewichten hosten is geen soevereiniteit. Soevereiniteit is controle over de GPU’s, het netwerkpad, de gewichten en het supportcontract. Dit is de deploymentvorm die LMXAI gebruikt en de vragen die we elke vendor stellen.

Runtime
vLLM op Kubernetes
Standaard
Geen verplichte egress
Hardware
A100-klasse / equivalent
Regio
EU, onder uw contract

English version  ·  Türkçe versie

Wat “soevereine vLLM” betekent

Een soevereine vLLM-deployment is een OpenAI-compatibele inferenceservice die u draait op GPU’s die u beheert, in een netwerk dat geen Amerikaanse API hoeft te bellen om een prompt te beantwoorden. vLLM geeft continuous batching, prefix caching en tensorparallelisme. Soevereiniteit is de rest van het ontwerp: waar de nodes staan, wie SSH mag, waar logs naartoe gaan, en of een supportengineer in een andere jurisdictie een coredump kan ophalen.

LMXAI levert dit patroon voor enterprise-werkplekken en interne agents. De servinglaag hoort bij hetzelfde gezin als het sovereign AI-platform en de mdGPT-gateway die ervoor zit.

Referentievorm

  • Cluster: Kubernetes in uw DC of een EU bare-metal-/private-cloudaccount dat u bezit.
  • Serving: vLLM (optioneel AWQ/INT4) achter een interne gateway — FastAPI, SSE, keys per namespace.
  • Netwerk: default-deny egress. Images van een mirror die u beheert. Geen callback naar een modelvendor bij een request.
  • State: gewichten op uw volume; KV-cache op de GPU-nodes; applicatielogs in uw collector (OpenTelemetry).
  • Ops: autoscaling op wachtrijdiepte, niet op de quotapagina van een vendor.

Vendorchecklist (gebruik dit in inkoop)

VraagGeslaagdGezakt
Waar staan de GPU’s fysiek?Genoemde EU-metro / uw rack“EU-regio” met onuitgesproken replicatie
Wie is verwerker van prompts?U, of een genoemde EU-entiteit met DPAOnduidelijke subverwerkers, VS-moederstandaard
Kan inference met geblokkeerde egress?Ja, gedocumenteerdLicentiecheck of telemetry moet thuisbellen
Wie houdt de gewichten?Uw object store / PVCVendor ontsleutelt gewichten per request
SupporttoegangBreak-glass, gelogd, EU-staf optioneelPermanente admin van buiten de Unie
ExitU houdt gewichten, traces en IaCModel of index vast in hun control plane
ContractjurisdictieEU-lidstaatAlleen Californische ToS

EU-hosts die kunnen slagen: uw eigen racks; EU-bare-metal (bijvoorbeeld OVHcloud, Hetzner, Scaleway) als u het account bezit en overbodige extras uitzet; een gereguleerde private cloud met een schriftelijk no-egress-ontwerp. Een hyperscaler-“EU-regio” kan deel van een ontwerp zijn, maar is niet automatisch soeverein — lees de subverwerkers en het privileged-access-verhaal.

Kostenfactoren vóór u GPU’s koopt

Tokens zijn niet de rekening. De rekening is idle GPU-tijd, contextlengte, gelijktijdige sessies, en hoe vaak u een corpus opnieuw embedt. Een 32B AWQ-model op een paar high-memory-GPU’s wint vaak van een 70B die op 15% bezetting staat. LMXAI dimensionneert dit vanuit een verkeersschets en een latency-SLO, en voegt speculative decoding of expert-offload alleen toe als de cijfers de complexiteit rechtvaardigen.

Wat LMXAI overdraagt

Een draaiende vLLM-service, een gateway met auth en traces, een runbook voor gewichtsupdates, en de ingevulde vendorchecklist voor wie de machines host. U moet later van GPU-vendor kunnen wisselen zonder de applicatie te herschrijven.

Volgende stap. Als dit de beslissing is die voor u ligt, scoped LMXAI het systeem — geen workshopreeks.

Start een project