Model serving, Kubernetes, gateway en private RAG — zonder verplichte hyperscaler-afhankelijkheid.
Project: sovereign AI platform
LMXAI bouwt soevereine LLM-infrastructuur die op eigen servers, on-premise of in een gekozen private omgeving kan draaien zonder verplichte afhankelijkheid van AWS, Azure of Google Cloud. Modellen, prompts, documenten, logs en applicatiedata kunnen binnen de door de organisatie bepaalde infrastructuurgrens blijven.
LMXAI is gevestigd in Leiden en combineert model serving, Kubernetes, backend engineering, RAG, agentic systemen, observability en productarchitectuur in één deploymenttraject.
Een deployment is pas echt soeverein wanneer de organisatie controle houdt over de relevante technische lagen. Alleen een Europees datacenter gebruiken is daarvoor niet automatisch voldoende.
Bij een soevereine architectuur kijken we onder meer naar:
Het gewenste niveau kan variëren van een EU-private omgeving tot volledig on-premise of een sterk afgeschermde infrastructuur zonder externe model-API's.
Open modellen kunnen worden geserveerd via bijvoorbeeld vLLM op eigen GPU's. Het servingprofiel wordt afgestemd op modelgrootte, contextlengte, concurrency, latency en beschikbaar geheugen.
Waar relevant worden quantization, batching, KV-cachegebruik en model routing geoptimaliseerd om de hardware efficiënt te benutten.
Voor omgevingen waar schaalbaarheid en operationele standaardisatie nodig zijn, kan inference op Kubernetes worden ingericht met duidelijke scheiding tussen model serving, applicaties, data services en observability.
Dat kan onder meer bestaan uit:
Een interne gateway voorkomt dat applicaties hard worden gekoppeld aan één model of runtime. De gateway kan requests routeren, authenticeren, limiteren en observeren.
Daardoor kan een organisatie bijvoorbeeld een kleiner lokaal model gebruiken voor standaardtaken en een sterker model voor specifieke workloads — zonder de applicatiestructuur opnieuw te ontwerpen.
Document retrieval kan volledig binnen dezelfde gecontroleerde omgeving draaien. LMXAI ontwerpt ingestion, parsing, indexering, retrieval en bronvermelding met aandacht voor tenant- en gebruikersisolatie.
Voor enterprise search kan bijvoorbeeld Elasticsearch worden ingezet, eventueel gecombineerd met dense retrieval, metadata filtering en reranking.
Een lokaal gehost model kan ook interne tools gebruiken via gecontroleerde API's of MCP. Daarmee kan een sovereign AI-platform workflows uitvoeren zonder bedrijfsdata via een externe agentprovider te laten lopen.
Tool permissions, approval gates en audit logging worden daarbij expliciet ontworpen.
Een typische architectuur kan bestaan uit:
Interne gebruiker → AI-interface → interne gateway → lokale modelserver → RAG/tools → interne datasystemen
Daaromheen:
Identity + RBAC → observability → evaluation → audit logging → security policies
Alle kerncomponenten kunnen binnen de infrastructuur van de klant draaien. Externe diensten worden alleen toegevoegd wanneer daar bewust voor wordt gekozen.
Dat hangt af van het model en de workload. De belangrijkste variabelen zijn:
Een groot model is niet automatisch de beste enterprise-oplossing. Een kleiner of gespecialiseerd model kan goedkoper, sneller en beter beheersbaar zijn wanneer de taak duidelijk is.
LMXAI begint daarom met workloadprofilering in plaats van direct GPU-capaciteit te kopen.
Een eigen deployment is vooral interessant wanneer:
Self-hosting is niet altijd de goedkoopste keuze. Bij lage volumes en weinig operationele eisen kan een managed API efficiënter zijn. LMXAI maakt die afweging expliciet op basis van workload, risico en total cost of ownership.
Een model op een GPU laden is nog geen production platform. LMXAI behandelt inference als een service met eigen reliability- en operationsvereisten.
Een traject kan bestaan uit:
LMXAI heeft een sovereign enterprise AI-platform gebouwd voor een Nederlandse hostinggroep met meer dan 500 medewerkers. Daarbij werd een interne AI-werkplek ontworpen rond datasoevereiniteit, met onder andere vLLM, Kubernetes, FastAPI en on-premise inference.
LMXAI werkt daarnaast met open-model fine-tuning, LangGraph, MCP, Elasticsearch, OpenTelemetry en Phoenix voor production AI-systemen.
Bekijk het sovereign AI-project
Ja. De kernstack kan op eigen of andere private infrastructuur worden gebouwd zonder verplichte hyperscalercomponenten.
Ja, wanneer de gekozen use case en operationele processen dat toelaten. Model artifacts, dependencies, updates en externe databronnen moeten dan vooraf in het deploymentproces worden meegenomen.
Ja. LMXAI werkt met LoRA/QLoRA en gequantiseerde modelvarianten en kan serving daarop afstemmen.
Ja. Een centrale gateway en model-servinglaag kan inference als interne platformdienst aanbieden met authenticatie, quotas, routing en observability.
LMXAI kan het traject uitvoeren van workloadanalyse en hardware sizing tot model serving, Kubernetes, gateway, RAG, agentic tooling en production hardening.