Wat is een RAG-chatbot, en hoe houd je hallucinaties zeldzaam?
Een RAG-chatbot (Retrieval-Augmented Generation) is een AI-chatbot die jouw eigen documenten als kennisbron gebruikt. In plaats van te "raden" wat het antwoord is, zoekt hij eerst de meest relevante stukken uit jouw bronnen en formuleert dan een antwoord op basis van alleen die fragmenten. Dat maakt fouten zeldzaam en controleerbaar, het sluit ze niet uit: een model kan een goed gevonden fragment nog verkeerd samenvatten. Twijfelgevallen gaan naar een mens, en vooraf spreken we een testset met een acceptatiegrens af.
RAG · pgvector · Anthropic ClaudeAI IN PRODUCTIE · Wat is RAG?
Hoe verschilt het van ChatGPT?
ChatGPT antwoordt op basis van wat het tijdens training heeft geleerd — algemeen internet-publieke informatie tot een bepaalde datum. Een RAG-chatbot antwoordt op basis van jouw eigen documenten: jouw retourbeleid, jouw productcatalogus, jouw FAQ. Hij antwoordt uit wat in jouw bronnen staat, en zegt het als daar niets bruikbaars tussen zit.
Hoe houd je hallucinaties zeldzaam?
Drie mechanismen werken samen: (1) retrieval beperkt de context tot relevante fragmenten; (2) de prompt instrueert "antwoord alleen op basis van deze fragmenten, anders zeg je het niet te weten"; (3) de bronvermelding maakt een fout direct zichtbaar voor wie hem naleest.
Wat ze niet doen: garanderen dat het antwoord klopt. Het model kan een goed gevonden fragment verkeerd samenvatten, en op een vraag die nergens in je bronnen beantwoord wordt hoort "dat weet ik niet" te komen in plaats van een gok. Daarom staat er vóór livegang een testset klaar: twintig tot vijftig echte vragen uit je praktijk, met het goede antwoord erbij, beoordeeld door iemand uit je team. Haalt de assistent de acceptatiegrens niet, dan gaat hij niet live. Na livegang herhalen we dezelfde set, zodat je de kwaliteit ziet veranderen in plaats van hem moet geloven.
Veelgestelde vragen
Q1Geschikt voor advocatenkantoor / zorg?+
Vaak wel, mits goed gebouwd en met het kantoor aan tafel over wat er de index in mag. Opslag binnen de EU, een vastgelegde retentie-afspraak met de leverancier en audit-logging per vraag zijn alle drie in te richten, maar ze volgen niet vanzelf uit de keuze voor een model: het hangt af van je contract, je endpoint en je instellingen. Het oordeel over beroepsgeheim blijft bij het kantoor.
Q2Wat als bronnen veranderen?+
Re-indexering werkt incrementeel. Nieuwe of gewijzigde bronnen worden binnen 5 minuten beschikbaar voor de chatbot.
Voor Nederlandse mkb-bedrijven is de keuze om AI in productie te zetten sinds 2024 fundamenteel veranderd. Drie ontwikkelingen liggen daaraan ten grondslag: EU-data-residency wordt door alle grote LLM-providers nu aangeboden (Anthropic op AWS Frankfurt en GCP EU, OpenAI op Azure EU), retentie-instellingen zijn bespreekbaar geworden in plaats van een gegeven, en de kosten per query zijn met 5–10x gedaald sinds 2023. Wat twee jaar geleden alleen voor scale-ups haalbaar was, draait nu binnen het mkb-budget.
De grootste praktijk-misvatting in deze ronde van AI-adoptie: founders denken dat ze "een model moeten trainen". In vrijwel alle mkb-toepassingen die wij bouwen klopt dat niet — wat je doet is retrieval-augmented generation bovenop een bestaand model. Geen training, geen ML-expertise, geen GPU-cluster. Wel: heldere bronnen, een Postgres-database met pgvector, en discipline in prompts.
20–50
Testvragen vóór livegang
€0,002
Rekenvoorbeeld: lijstprijs per Haiku-vraag
2–6 wk
Bouwtijd AI-integratie
EU
Data-residency waar de leverancier die biedt
Stappenplan: van idee tot productie-AI
1Spike-week (1 week)+
Geen grote commitment vooraf. We starten met een spike-week (prijs op aanvraag, verrekenbaar met het vervolgtraject) waarin we 20–50 voorbeeldvragen verzamelen, een prototype bouwen en accuracy meten. Pas dan beslis je over verdere bouw.
2Bronnen voorbereiden+
Documentatie, FAQ, productdata, support-tickets — alles wat antwoorden zou moeten voeden. Niet perfect: één goede bron is meer waard dan vijf middelmatige. Bronnen blijven in jouw eigen Postgres.
3Indexeren met pgvector+
Chunking (500–800 tokens), embeddings via OpenAI text-embedding-3-large, opslag in Postgres met pgvector. Volledig in EU-regio. Re-indexering automatisch bij brongewijzigingen.
4Productie-pipeline+
Edge function (Vercel of Cloudflare) doet retrieval + Claude/GPT-call + bron-citatie. Streaming responses naar de client. Logging per vraag voor accuracy-tuning. Fallback naar tweede provider bij downtime.
5Monitoring & tweaken+
Thumbs-up/down per antwoord, lage-confidence-vragen worden gelogd voor handmatige review. Maandelijkse prompt-iteratie op basis van echte vragen. Hoeveel dat oplevert verschilt per bron en per vraagsoort; we meten het met dezelfde testset als bij de acceptatie, zodat je de verandering ziet in plaats van hem moet geloven.
Sterk in: latency, function calling, breed ecosysteem
Context window: 200k tokens (Claude Sonnet)
Context window: 128k tokens
Prijs: $3 / $15 per 1M tokens
Prijs: $2,50 / $10 per 1M tokens
Goedkoop alternatief: Claude Haiku ($0,25 / $1,25)
Goedkoop alternatief: GPT-4o-mini ($0,15 / $0,60)
EU-residency: AWS Frankfurt + GCP EU
EU-residency: Azure EU
Prijzen, context-limieten en modelnamen zijn indicatief en verschuiven per modelgeneratie — controleer de actuele tarieven bij de aanbieder.
De Bron-of-Halve-Bron-regel voor RAG
Een RAG-systeem is nooit beter dan zijn slechtste bron. Voeg liever 10 goed-gecontroleerde documenten toe dan 100 ruwe exports. Bij elke vraag waar de bot fout zit, vraag eerst: zat het antwoord überhaupt eenduidig in een bron? Pas daarna kijk je naar prompts of model.
Houd dit als debug-volgorde aan: bronnen → chunking → prompt → model. In die volgorde zit 80% van alle accuracy-issues.
Veelgestelde vragen
Q1Wat als de chatbot iets fout zegt?+
Bronbinding en een bronvermelding bij elk antwoord maken fouten zeldzaam en controleerbaar; uitsluiten doen ze het niet, want een model kan een goed gevonden fragment nog verkeerd samenvatten. Daarom leggen we vooraf een testset met echte vragen en een acceptatiegrens vast, escaleren kritieke onderwerpen altijd naar een mens, en logt de assistent elke vraag zodat je kunt nalezen waar het misging.
Q2Hoeveel kost een typische maand in productie?+
Voor een RAG-chatbot met 5.000 vragen per maand op Claude Haiku: ongeveer €10–€15. Met cache-hitting en prompt-optimalisatie nog minder. Vision-pipelines voor facturen: €0,01–€0,05 per document. Eerste maand-rekening valt vrijwel altijd lager uit dan vooraf gedacht.
Q3Kan dit voor advocatenkantoor of zorgpraktijk?+
Vaak wel, mits goed gebouwd. Opslag binnen de EU, een retentie-afspraak met de leverancier, audit-logging per vraag en een verwerkersovereenkomst zijn alle vier in te richten, maar geen van vier volgt vanzelf uit de keuze voor een model. Voor extreem gevoelige sectoren is een model op eigen infrastructuur het alternatief; dat is een andere opzet, met eigen kosten en een lagere antwoordkwaliteit. Voor de meeste mkb-opdrachten is een API met EU-residency voldoende. Welke variant je krijgt, leggen we per opdracht vast.
Q4Hoe vaak moet ik bronnen updaten?+
Re-indexering werkt incrementeel. Wijzigingen worden binnen 5 minuten beschikbaar voor de chatbot. Voor bronnen in Notion/Drive/Dropbox kun je auto-watch instellen — geen handmatige re-uploads nodig.
Q5Wat als Anthropic of OpenAI offline gaat?+
Production-pipelines hebben fallback naar een tweede provider. Bij volledige downtime krijgt de gebruiker een nette "we zijn even offline"-melding, geen crash. Multi-provider setup is standaard onderdeel van het bouwwerk.
Een RAG-assistent, copilot of documentpipeline op jouw eigen data 2–6 weken, vaste prijs na een gratis gesprek. 45 minuten, gratis. Eerstvolgende start: Q4 2026.