RAG-chatbot bouwen voor je website:
zo werkt het in de praktijk.
Een RAG-chatbot in productie bouw je in 2026 in vier stappen: bronnen indexeren, vraag opzoeken, antwoord met bronvermelding genereren, en monitoring. Met Claude (Anthropic) of GPT-4o (OpenAI) als generator, pgvector in Postgres als opslag, en €0,002 per vraag in productie.
De vier productie-stappen
- Indexeer bronnen: chunk je documenten (FAQ, productdata, support-archief) in 500–800 token-stukken, embed met OpenAI's text-embedding-3-large, sla op in pgvector.
- Zoek bij vraag: embed gebruikersvraag, doe similarity search op pgvector, haal top 3–5 fragmenten op.
- Genereer antwoord: stuur fragmenten + vraag naar Claude met instructie "antwoord alleen op basis van deze fragmenten". Inclusief bron-citatie.
- Monitor: log elke vraag/antwoord, accuracy-meting via thumbs-up/down, escalatie bij lage confidence.
Zie ook: RAG zelf bouwen vs. laten bouwen voor de afweging tussen zelf doen en uitbesteden.
Veelgestelde vragen
Q1Wat als de chatbot iets fout zegt?+
Q2Kan de chatbot leren tijdens gebruik?+
Verdieping: waarom AI in NL-mkb anders speelt
Voor Nederlandse mkb-bedrijven is de keuze om AI in productie te zetten sinds 2024 fundamenteel veranderd. Drie ontwikkelingen liggen daaraan ten grondslag: EU-data-residency wordt door alle grote LLM-providers nu aangeboden (Anthropic op AWS Frankfurt en GCP EU, OpenAI op Azure EU), retentie-instellingen zijn bespreekbaar geworden in plaats van een gegeven, en de kosten per query zijn met 5–10x gedaald sinds 2023. Wat twee jaar geleden alleen voor scale-ups haalbaar was, draait nu binnen het mkb-budget.
De grootste praktijk-misvatting in deze ronde van AI-adoptie: founders denken dat ze "een model moeten trainen". In vrijwel alle mkb-toepassingen die wij bouwen klopt dat niet — wat je doet is retrieval-augmented generation bovenop een bestaand model. Geen training, geen ML-expertise, geen GPU-cluster. Wel: heldere bronnen, een Postgres-database met pgvector, en discipline in prompts.
Stappenplan: van idee tot productie-AI
1Spike-week (1 week)+
2Bronnen voorbereiden+
3Indexeren met pgvector+
4Productie-pipeline+
5Monitoring & tweaken+
Welk model wanneer — een eerlijke keuzehulp
Prijzen, context-limieten en modelnamen zijn indicatief en verschuiven per modelgeneratie — controleer de actuele tarieven bij de aanbieder.
Veelgestelde vragen
Q2Hoeveel kost een typische maand in productie?+
Q3Kan dit voor advocatenkantoor of zorgpraktijk?+
Q4Hoe vaak moet ik bronnen updaten?+
Q5Wat als Anthropic of OpenAI offline gaat?+
Lange-termijn perspectief: AI in productie hoort bij je stack
De keuze om AI in productie te zetten is in 2026 vergelijkbaar met de keuze om in 2014 een API-laag op je product te zetten: het voelt nog optioneel, maar wordt binnen 18 maanden de norm. Bedrijven die nu een werkende RAG-laag hebben — gevoed met eigen documentatie, draaiend op een vastgelegde retentie-afspraak, met audit-logs per query — bouwen een asset die door elke volgende productontwikkeling heen meegroeit.
De fout die je nu nog kunt maken is te groots beginnen. Niet "we bouwen een AI-strategie", wel "we lossen één concreet probleem op met AI". Een chatbot die 60% van eerste-lijn klantvragen afhandelt is meer waard dan een grandioos plan voor een “AI-platform” dat over 18 maanden nog niet live is. Klein beginnen, meten, uitbreiden — die volgorde is in deze fase nog steeds doorslaggevend.
Drie ontwikkelingen die de komende 12 maanden het speelveld verschuiven: (a) kosten van inference dalen met nog eens 5–10× door competitie tussen Anthropic, OpenAI, Google en open-source modellen; (b) tool-use en function calling worden volwassen genoeg om echte AI-agents te bouwen voor specifieke workflows; (c) EU-data residency wordt verplicht voor steeds meer sectoren (zorg, juridiek, finance) — wie nu al EU-conform bouwt heeft geen migratie-pijn straks.
Hoe we dit bij een advocatenkantoor bouwden
Een advocatenkantoor in Rotterdam met acht advocaten liet eind 2025 een eerstelijns AI-screening bouwen: Claude met RAG over de openbare publicaties en de standaard-voorlichting van het kantoor. De opdracht valt onder een NDA, dus de naam blijft eruit en beschrijven we alleen de opzet. De opdracht is afgerond, het is geen doorlopend project.
Wij bakenden de bronnenset af tot publiek materiaal, bouwden de indexering en de retrieval, stelden de assistent in om geen juridisch advies te geven en zulke vragen door te zetten naar het kantoor, en zetten onder elk antwoord een klikbare bronvermelding.
Het kantoor besliste zelf welke teksten de index in mochten, stelde de doorzetregels op en las de eerste weken de antwoorden na. Die nalezing telt mee in de uitkomst: zonder die correcties had de screening er anders uitgezien. Wat er aan het eind stond is dus werk van twee partijen.
Na negentig dagen keek het kantoor wat de screening had afgevangen. Die telling komt van de opdrachtgever en niet van ons, en staat in ons claimregister nog als “te verifiëren”: we weten niet uit welk systeem ze komt en hoe een afgevangen gesprek gedefinieerd is. Daarom staan de percentages hier niet. Vraag ernaar in een gesprek, dan laten we zien wat er wél is vastgelegd.
Een foutpercentage hebben we over die periode niet gemeten, dus noemen we er geen getal bij. Wat we bij dit soort opdrachten wel afspreken: vooraf een testset met echte vragen en een acceptatiegrens, en die na livegang herhalen.