Een notebook die drie PDF’s beantwoordt is geen systeem. Productie-RAG en agents hebben een kostenmodel, een eval-harnas en een vendorlijst nodig die uw index niet in een Amerikaanse SaaS duwt.
Productie-RAG is retrieval plus generatie met een gemeten foutpercentage, een budget en een eigenaar. Productie-agents voegen tools en meerstapscontrole toe. Demo’s sterven omdat ze drie dingen overslaan: een bevroren evaluatieset, traces die tonen welk chunk is gebruikt, en een kostenmodel dat langer meegaat dan een pilotweek. LMXAI behandelt die als launchcriteria, niet als “fase twee”.
Dat is dezelfde discipline achter de agentic patronen van LMXAI en klinisch werk zoals Savion — LangGraph-orkestratie, MCP-tools, en eval (inclusief BFCL-achtige tool-use-checks) voordat iemand het betrouwbaar noemt.
| Poort | Wat “goed” is |
|---|---|
| Retrieval-hitrate | Gouden vragen halen het bedoelde document in top-k |
| Faithfulness | Antwoord steunt op opgehaalde tekst, of het model onthoudt zich |
| Toolsucces | Function calls matchen het schema; geen verzonnen argumenten |
| Latency-SLO | p95 time-to-first-token en end-to-end afgesproken met de business |
| Tracecompleetheid | Elk antwoord heeft query, chunks, modelversie, tool-I/O |
| Fallback | Lege retrieval → “ik weet het niet” of een menselijke wachtrij, geen hallucinatie |
Kies componenten die u in uw cluster kunt draaien: Elasticsearch of OpenSearch, Qdrant, of pgvector bij een klein corpus; vLLM voor generatie; LangGraph voor control flow; OpenTelemetry plus Phoenix of equivalent voor traces. Managed EU-diensten zijn prima als de checklist op de vLLM-vendorpagina slaagt — vooral geen stille training op uw prompts en een contract onder EU-recht.
Behandel in de VS gehoste “agentplatforms” als prototypes tenzij inkoop het datapad heeft geaccepteerd. Het productoppervlak is zelden het probleem. De index en de traces wel.
LMXAI-standaard: hybride retrieval die u bezit, een agentgraaf met harde staplimieten, een gateway die tokens per team meet, en een evalsuite die in CI draait als prompts of chunking veranderen. Kosten en betrouwbaarheid zijn hetzelfde engineeringprobleem.
Volgende stap. Als dit de beslissing is die voor u ligt, scoped LMXAI het systeem — geen workshopreeks.