Een AI-assistent die antwoord geeft
uit jouw eigen documenten.
Een taalmodel weet niets over jouw retourbeleid of dossiers, dus zoekt een retrieval-laag (RAG, bij ons “Geheugen”) bij elke vraag de juiste stukken uit jouw bronnen op en geeft die aan het model mee. Een assistent op jouw bronnen antwoordt uit jouw documenten en zet de bron erbij. Dat maakt fouten zeldzaam en controleerbaar, niet onmogelijk.
- Index
- Postgres met pgvector, EU-regio
- Model
- Claude of GPT via API. Wat de leverancier bewaart, leggen we per opdracht vast
- Bronnen
- PDF, website, FAQ, supportarchief, database
- Kosten
- Enkele tientjes per maand aan API bij gemiddeld volume
- Doorloop
- 2–6 weken
Drie stappen, elke keer dat iemand een vraag stelt.
- Eenmalig, en bij elke wijziging
Bronnen worden geïndexeerd
Documenten, FAQ-pagina's, catalogi en supportarchieven worden opgeknipt in fragmenten en omgezet naar vectoren, een soort betekeniscoördinaten. Die staan in Postgres met pgvector op jouw account. Schaalt van honderd tot honderdduizend documenten zonder herbouw.
- Per vraag, in milliseconden
De vraag wordt opgezocht
De vraag van de klant wordt ook omgezet naar een vector en vergeleken met alle fragmenten. De paar meest relevante gaan mee als context naar het model. Niet je hele bibliotheek: dat is sneller, goedkoper, en er gaat zo min mogelijk tekst de deur uit.
- Per vraag, in seconden
Het model antwoordt, met bron
Het model krijgt de instructie om alleen uit die fragmenten te antwoorden. Bij elk antwoord staat de bron, klikbaar. Is er niets gevonden, dan zegt de assistent dat en verwijst hij door naar een mens.
Twee vragen aan dezelfde assistent.
De eerste staat in het retourbeleid, de tweede niet. Je wil van tevoren weten hoe het er in beide gevallen uitziet.
Een assistent die bij twijfel doorzet is bruikbaarder dan een die altijd iets zegt. Waar de drempel ligt en wat er bij twijfel gebeurt, spreken we vooraf af.
Beide platen zijn voorbeelddialogen om de werking te tonen. De scores en de drempel zijn voorbeelddata, geen gemeten waarden.
Twijfel je welke route past? In 45 minuten weet je het.
Vier eigenschappen die het verschil maken met 'even ChatGPT erbij'.
Antwoord uit jouw bronnen
Het model krijgt alleen fragmenten uit jouw documentatie en de instructie om daarbuiten niets te beweren. Bij elk antwoord staat de bron, zodat je het kunt nalezen.
Bronnen blijven op jouw infrastructuur
De documenten, de index en de embeddings staan in Postgres in een EU-regio, op jouw eigen account. Naar het model gaat de vraag plus de fragmenten die nodig zijn om hem te beantwoorden.
Altijd actueel
Beleid gewijzigd of voorraad veranderd? De bron wordt opnieuw geïndexeerd, in minuten. Geen hertraining van een model.
Meetbaar
Elke vraag en elk antwoord wordt gelogd met de gebruikte bronnen. Een testset met echte vragen bepaalt of het goed genoeg is voordat het live gaat.
Wat we beloven over de antwoorden, en wat niet.
Bronbinding, een testset en escalatie maken fouten zeldzaam en controleerbaar. Ze sluiten ze niet uit, en dat hoor je liever nu dan na livegang.
| Afspraak | Wat er in de offerte komt te staan |
|---|---|
| Taken | We schrijven op welke vragen de assistent mag beantwoorden en welke niet. |
| Testset | Een set echte vragen uit je praktijk, met het goede antwoord erbij, beoordeeld door iemand uit je team. |
| Ondergrens | Een acceptatiegrens die vooraf vaststaat. Haalt de assistent die niet, dan gaat hij niet live. |
| Bronnen | Elk antwoord wijst naar het fragment waar het vandaan komt, zodat je het kunt nalezen. |
| Escalatie | Bij twijfel of bij een vraag buiten de scope zegt de assistent dat hij het niet weet en zet hij de vraag door naar een mens. |
| Logging | Elke vraag en elk antwoord blijft terug te zoeken, zodat je ziet waar het misging en we het kunnen bijstellen. |
Waar je bij een assistent op je eigen bronnen op moet rekenen.
- Een model kan een goed gevonden fragment nog steeds verkeerd samenvatten. Daarom de testset en de bronverwijzing.
- Staat het antwoord niet in je documenten, dan kan de assistent het niet weten. Dan hoort er 'dat weet ik niet' te komen, geen gok.
- Verouderde documenten geven verouderde antwoorden. Wie de bron bijwerkt, bepaalt wat de assistent zegt.
- Juridisch, medisch of fiscaal advies laten we een mens doen. De assistent zoekt op, hij beslist niet.
Waar je data langskomt.
Zo loopt je data door een assistent die we bouwen. Per stap: waar het draait, wie het ziet en hoe lang het blijft staan.
| Stap | Waar het draait | Wat er heen gaat | Hoe lang het blijft staan |
|---|---|---|---|
| Bronopslag | Jouw Supabase- of Postgres-project, EU-regio, op jouw eigen account | De documenten zelf | Zolang jij ze bewaart. Verwijderen doe je zelf. |
| Indexering | Embedding-API van OpenAI of Anthropic, EU-endpoint waar beschikbaar | De tekst van je documenten, in stukken geknipt | Bij een zero-retention-configuratie niet bewaard. Is die voor jouw endpoint niet beschikbaar, dan staat dat in de verwerkersovereenkomst. |
| Embeddings | pgvector in dezelfde database als de bronopslag | Getallenreeksen per fragment, geen leesbare tekst | Zolang de index bestaat |
| Vraag en antwoord | Claude of GPT via API | De vraag van de gebruiker plus de gevonden fragmenten | Bij zero retention niet bewaard en niet gebruikt voor training. Dit hangt af van je contract, endpoint en instellingen; we leggen de gekozen variant vast. |
| Logging | Jouw eigen database | Vraag, antwoord, gebruikte bronnen en tijdstip | Standaard 90 dagen, aanpasbaar |
| Verwijderen | Jouw account | Bron, index en logs | Eén handeling verwijdert document, fragmenten en logregels |
Zero retention, niet trainen op je data en opslag binnen de EU zijn drie verschillende dingen. Welke je krijgt, hangt af van de leverancier, het contract en het endpoint. We zetten per opdracht op papier wat er geldt.
Wil je dat er helemaal niets naar een externe API gaat, dan kan dat met een model dat op eigen infrastructuur draait. Dat is een andere opzet, met eigen kosten en een lagere antwoordkwaliteit. We noemen het apart in de offerte, niet als standaard.
Wat het per maand kost, en waarvan dat afhangt.
| Volume | API-kosten per maand | Hosting |
|---|---|---|
| Tot 1.000 vragen | Enkele euro's | Gratis of laagste tarief Supabase en Vercel |
| 1.000 tot 10.000 vragen | Enkele tientjes | Laagste betaalde tarief |
| Meer dan 10.000 vragen | Op maat, met caching en een kleiner model waar dat kan | Op maat |
De bouw valt onder AI-integratie: 2–6 weken, vaste prijs na een gratis gesprek. De kostenraming per maand krijg je vooraf, in de haalbaarheidscheck.
Neem een echte vraag mee.
Dan laten we zien wat de assistent ermee doet.
Een map met documenten en drie vragen die je klanten echt stellen zijn genoeg voor een eerste indruk. 45 minuten, gratis. Eerstvolgende start: Q4 2026.
Laatst herzien september 2026. Kosten zijn indicaties bij gemiddeld volume; de raming voor jouw situatie volgt uit de haalbaarheidscheck.