Alle inzichten
RAG · LangGraph · Evaluatie

Productie-RAG en agents — kosten, betrouwbaarheid, EU-vendors

Een notebook die drie PDF’s beantwoordt is geen systeem. Productie-RAG en agents hebben een kostenmodel, een eval-harnas en een vendorlijst nodig die uw index niet in een Amerikaanse SaaS duwt.

Orkestratie
LangGraph · MCP
Retrieval
Hybride · uw index
Risico
Kosten + stil falen
EU-houding
Eerst zelf hosten

English version  ·  Türkçe versie

Waarom de demo sterft

Productie-RAG is retrieval plus generatie met een gemeten foutpercentage, een budget en een eigenaar. Productie-agents voegen tools en meerstapscontrole toe. Demo’s sterven omdat ze drie dingen overslaan: een bevroren evaluatieset, traces die tonen welk chunk is gebruikt, en een kostenmodel dat langer meegaat dan een pilotweek. LMXAI behandelt die als launchcriteria, niet als “fase twee”.

Dat is dezelfde discipline achter de agentic patronen van LMXAI en klinisch werk zoals Savion — LangGraph-orkestratie, MCP-tools, en eval (inclusief BFCL-achtige tool-use-checks) voordat iemand het betrouwbaar noemt.

Kosten: modelleer het systeem, niet de tokenprijs

  • Eén keer embedden, vaak queryen. Elke nacht een rommelige share drive opnieuw embedden overschaduwt generatiekosten.
  • Context is de stille rekening. 40 chunks in een 32B-model stoppen is meestal slechter én duurder dan 6 goede.
  • Agentstappen vermenigvuldigen. Een lus met vijf tools kan 5–15 modelcalls zijn. Beperk stappen, cache toolresultaten, fail closed.
  • Idle GPU’s vs API-facturen. Zelf-gehoste vLLM wint bij stabiele interne load; API’s winnen bij spiky experimenten. Mix is normaal.

Betrouwbaarheid: wat we meten vóór go-live

PoortWat “goed” is
Retrieval-hitrateGouden vragen halen het bedoelde document in top-k
FaithfulnessAntwoord steunt op opgehaalde tekst, of het model onthoudt zich
ToolsuccesFunction calls matchen het schema; geen verzonnen argumenten
Latency-SLOp95 time-to-first-token en end-to-end afgesproken met de business
TracecompleetheidElk antwoord heeft query, chunks, modelversie, tool-I/O
FallbackLege retrieval → “ik weet het niet” of een menselijke wachtrij, geen hallucinatie

EU-vriendelijke vendorhouding

Kies componenten die u in uw cluster kunt draaien: Elasticsearch of OpenSearch, Qdrant, of pgvector bij een klein corpus; vLLM voor generatie; LangGraph voor control flow; OpenTelemetry plus Phoenix of equivalent voor traces. Managed EU-diensten zijn prima als de checklist op de vLLM-vendorpagina slaagt — vooral geen stille training op uw prompts en een contract onder EU-recht.

Behandel in de VS gehoste “agentplatforms” als prototypes tenzij inkoop het datapad heeft geaccepteerd. Het productoppervlak is zelden het probleem. De index en de traces wel.

LMXAI-standaard: hybride retrieval die u bezit, een agentgraaf met harde staplimieten, een gateway die tokens per team meet, en een evalsuite die in CI draait als prompts of chunking veranderen. Kosten en betrouwbaarheid zijn hetzelfde engineeringprobleem.

Volgende stap. Als dit de beslissing is die voor u ligt, scoped LMXAI het systeem — geen workshopreeks.

Start een project