Open gewichten hosten is geen soevereiniteit. Soevereiniteit is controle over de GPU’s, het netwerkpad, de gewichten en het supportcontract. Dit is de deploymentvorm die LMXAI gebruikt en de vragen die we elke vendor stellen.
Een soevereine vLLM-deployment is een OpenAI-compatibele inferenceservice die u draait op GPU’s die u beheert, in een netwerk dat geen Amerikaanse API hoeft te bellen om een prompt te beantwoorden. vLLM geeft continuous batching, prefix caching en tensorparallelisme. Soevereiniteit is de rest van het ontwerp: waar de nodes staan, wie SSH mag, waar logs naartoe gaan, en of een supportengineer in een andere jurisdictie een coredump kan ophalen.
LMXAI levert dit patroon voor enterprise-werkplekken en interne agents. De servinglaag hoort bij hetzelfde gezin als het sovereign AI-platform en de mdGPT-gateway die ervoor zit.
| Vraag | Geslaagd | Gezakt |
|---|---|---|
| Waar staan de GPU’s fysiek? | Genoemde EU-metro / uw rack | “EU-regio” met onuitgesproken replicatie |
| Wie is verwerker van prompts? | U, of een genoemde EU-entiteit met DPA | Onduidelijke subverwerkers, VS-moederstandaard |
| Kan inference met geblokkeerde egress? | Ja, gedocumenteerd | Licentiecheck of telemetry moet thuisbellen |
| Wie houdt de gewichten? | Uw object store / PVC | Vendor ontsleutelt gewichten per request |
| Supporttoegang | Break-glass, gelogd, EU-staf optioneel | Permanente admin van buiten de Unie |
| Exit | U houdt gewichten, traces en IaC | Model of index vast in hun control plane |
| Contractjurisdictie | EU-lidstaat | Alleen Californische ToS |
EU-hosts die kunnen slagen: uw eigen racks; EU-bare-metal (bijvoorbeeld OVHcloud, Hetzner, Scaleway) als u het account bezit en overbodige extras uitzet; een gereguleerde private cloud met een schriftelijk no-egress-ontwerp. Een hyperscaler-“EU-regio” kan deel van een ontwerp zijn, maar is niet automatisch soeverein — lees de subverwerkers en het privileged-access-verhaal.
Tokens zijn niet de rekening. De rekening is idle GPU-tijd, contextlengte, gelijktijdige sessies, en hoe vaak u een corpus opnieuw embedt. Een 32B AWQ-model op een paar high-memory-GPU’s wint vaak van een 70B die op 15% bezetting staat. LMXAI dimensionneert dit vanuit een verkeersschets en een latency-SLO, en voegt speculative decoding of expert-offload alleen toe als de cijfers de complexiteit rechtvaardigen.
Een draaiende vLLM-service, een gateway met auth en traces, een runbook voor gewichtsupdates, en de ingevulde vendorchecklist voor wie de machines host. U moet later van GPU-vendor kunnen wisselen zonder de applicatie te herschrijven.
Volgende stap. Als dit de beslissing is die voor u ligt, scoped LMXAI het systeem — geen workshopreeks.