Stel betrouwbaarheidsdrempels voor chatbots in die fouten echt verminderen

Gebruik betrouwbaarheidsdrempels om onzekere chatbotbeurten veilig te routeren. Een praktisch ontwerp heeft drie banden: beantwoord bij hoge betrouwbaarheid, bevestig of verduidelijk in het midden en schakel bij lage betrouwbaarheid over naar een medewerker. De numerieke grenswaarden moeten worden gekalibreerd voor jouw model en verkeer. Waarden zoals 0.85 en 0.5 kunnen het beleid illustreren, maar zijn geen universele standaardwaarden.
Oracle’s documentatie over intentresolutie gebruikt 0.70 als startpunt voor het eigen intentmodel en raadt aan hogere waarden te testen wanneer de resultaten dat ondersteunen. Dat advies is platformspecifiek. Een drempel die werkt voor het ene model, domein of de ene scoredefinitie kan verkeerd zijn voor een andere.
Stel voordat je een drempel wijzigt een representatieve evaluatieset samen op basis van recente gesprekken. Label of elke voorspelde intent of elk antwoord correct was en vergelijk die uitkomsten vervolgens met de scores en acties die door het systeem zijn geregistreerd. Zo beschik je over bewijs om een grenswaarde te kiezen, in plaats van alleen op een standaardwaarde van de leverancier te vertrouwen.
- Hoge band (illustratief: 0.85+): de bot antwoordt automatisch, zonder bevestigingsstap.
- Middelste band (illustratief: 0.5 tot 0.85): de bot bevestigt of verduidelijkt voordat hij handelt.
- Lage band (illustratief: lager dan 0.5): de bot schakelt over naar een medewerker of activeert een fallback-intent.
Pro-tip: Begin met voldoende recente gesprekken om veelvoorkomende intents, dubbelzinnige formuleringen en bekende probleemgevallen te omvatten. Een kleinere, zorgvuldig gelabelde set is nuttiger dan een grote steekproef met onbetrouwbare labels.
Belangrijkste punten
Een beleid met drie banden kan stille verkeerde antwoorden verminderen door dubbelzinnige beurten een bevestigingsroute te geven. Het effect ervan op automatisering en nauwkeurigheid moet worden gemeten met je eigen gelabelde gesprekken.
| Punt | Details |
|---|---|
| Begin met drie banden | Definieer acties voor hoge, middelste en lage betrouwbaarheid. Beschouw 0.85 en 0.5 als voorbeelden en kalibreer vervolgens de werkelijke grenswaarden. |
| Kalibreer op echte gegevens | Label een representatieve set op juistheid en onderzoek vervolgens de prestaties per scoreband voordat je een drempel vertrouwt. |
| Wantrouw zelfvertrouwen van LLM’s | Evalueer in RAG-systemen signalen voor retrieval en grounding in plaats van te vertrouwen op de door het model uitgesproken zekerheid. |
| Monitor zowel automatisering als fouten | Houd het automatiseringspercentage en het percentage verkeerde antwoorden samen in de gaten; wanneer slechts één ervan stijgt, is dat een waarschuwingssignaal. |
| Gebruik onderbouwde, goedgekeurde kennis | De AI-chatbot van Deskhero beantwoordt vragen uitsluitend op basis van door de User goedgekeurde openbare FAQ-inhoud en schakelt over wanneer hij niet met voldoende vertrouwen kan antwoorden. |
Inhoudsopgave
- Wat is precies een betrouwbaarheidsdrempel voor een chatbot?
- Waarom drie betrouwbaarheidsbanden beter zijn dan één grenswaarde
- Hoe kalibreer je betrouwbaarheidsdrempels voor je bot?
- Wat gaat er mis wanneer drempels slecht worden ingesteld?
- Hoe moeten RAG- en LLM-chatbots anders omgaan met betrouwbaarheid?
- Wat moet je monitoren nadat je een drempel hebt gewijzigd?
- Kopieerbare beleidsplannen voor drempelgebaseerde routering
- Wat moet je bij je chatbotplatform controleren?
- Hoe Deskhero omgaat met onzekere chatbotantwoorden
- Wat deze gids goed doet en de meeste adviezen niet
- Laat de onderbouwde AI-chatbot van Deskhero werken voor je supportteam
- Bronnen
- Veelgestelde vragen
Wat is precies een betrouwbaarheidsdrempel voor een chatbot?
Een betrouwbaarheidsscore is het getal dat je intentclassificator of retrievalsysteem aan zijn beste inschatting toekent, meestal ergens tussen 0 en 1. Een betrouwbaarheidsdrempel is de grens die je binnen dat bereik trekt om te bepalen wat de bot vervolgens doet. De score rangschikt je opties; de drempel is de beleidsbeslissing die je daar bovenop legt.
De betekenis van een betrouwbaarheidsscore hangt af van het systeem. Sommige classificatoren geven scores die kunnen worden gekalibreerd aan de hand van waargenomen juistheid. Andere platforms bieden alleen rangschikkings- of similariteitssignalen. Ga er niet van uit dat een score van 0.92 een kans van 92% op een correct antwoord betekent, tenzij de leverancier die interpretatie documenteert en je evaluatiegegevens dit bevestigen.
Retrieval-augmented generation (RAG) voegt nog een laag toe. Het gegenereerde antwoord kan zeker klinken, zelfs wanneer het opgehaalde materiaal verouderd of irrelevant is. Retrievalsimilariteit, bronkwaliteit, antwoordondersteuning en modelgedrag zijn afzonderlijke signalen. Test elk signaal aan de hand van gelabelde uitkomsten voordat je ze combineert in een routeringsbeleid.
Pro-tip: Gebruik de door een LLM gerapporteerde zekerheid niet als enige routeringssignaal. Vereis relevant bronmateriaal en test of retrieval- of groundingcontroles de juistheid in jouw gegevens daadwerkelijk voorspellen.
Waarom drie betrouwbaarheidsbanden beter zijn dan één grenswaarde
Een enkele drempel dwingt tot een binaire keuze: antwoorden of niet antwoorden. Een middelste band voegt een derde optie toe: een korte verduidelijkende vraag stellen. Zo kunnen stille fouten worden verminderd zonder elke onzekere beurt rechtstreeks naar een medewerker te sturen.
| Band | Gebruikelijk bereik | Gedrag van de bot | UX-voorbeeld |
|---|---|---|---|
| Hoog | Illustratief: 0.85 en hoger | Automatisch antwoorden, zonder wrijving | De bot antwoordt rechtstreeks: “Je bestelling wordt donderdag verzonden.” |
| Middel | Illustratief: 0.5 tot 0.85 | Bevestigen of verduidelijken | “Bedoel je je bestelling volgen of deze annuleren?” |
| Laag | Illustratief: lager dan 0.5 | Fallback of overdracht | “Ik verbind je met iemand uit ons team.” |

Deze bereiken zijn voorbeelden die de routeringslogica concreet maken. Vervang ze door waarden die zijn afgeleid van je eigen platform, scoredefinitie en de kosten van een verkeerd antwoord.
De redenatie is eenvoudig zodra je die in de praktijk ziet. Een enkele grenswaarde van bijvoorbeeld 0.70 betekent dat elke score net boven die lijn automatisch met volledig vertrouwen wordt beantwoord, ook al verschilt een score van 0.71 nauwelijks van 0.69. De middelste band biedt een bufferzone waarin de bot enige onzekerheid toegeeft in plaats van te doen alsof die niet bestaat.
- Houd bevestigingsflows kort. Aanklikbare keuzes verminderen dubbelzinnigheid vaak beter dan nog een open vraag.
- Fallbackteksten moeten de misser erkennen zonder defect te klinken: “Ik weet niet zeker of ik je goed heb begrepen. Ik haal er iemand bij.”
- Meet of bevestigingen in de middelste band de dubbelzinnigheid oplossen of alleen maar extra wrijving veroorzaken.
Dit is de afweging die stakeholders duidelijk moeten horen: wanneer je je drempel verlaagt, stijgt het automatiseringspercentage, maar elk verkeerd antwoord dat over een verlaagde lat komt, wordt onzichtbaar. Niemand markeert het, omdat de bot zelfverzekerd leek. Een hogere drempel doet het tegenovergestelde: fouten worden zichtbaar als fallbacks. Operationeel voelt dat slechter, maar het is eigenlijk veiliger, omdat een zichtbare fout wordt geregistreerd en hersteld, terwijl een onzichtbare fout het vertrouwen stilletjes blijft aantasten.
Hoe kalibreer je betrouwbaarheidsdrempels voor je bot?
Standaardwaarden van leveranciers en bandbreedtes uit de sector zijn startpunten. Je werkelijke grenswaarden moeten voortkomen uit je eigen transcripties, omdat de nauwkeurigheid van chatbots sterk varieert per domein, complexiteit van intents en de mate waarin de formuleringen van gebruikers rommelig zijn.
- Stel een representatieve testset samen. Gebruik echte vragen die veelvoorkomende intents, dubbelzinnige formuleringen en kostbare probleemgevallen omvatten. De benodigde steekproefgrootte hangt af van het verkeer en de precisie die je nodig hebt.
- Label de ground truth. Markeer voor elk transcript of het gegeven antwoord daadwerkelijk correct was, en niet alleen of de bot zelfverzekerd klonk.
- Koppel uitkomsten aan scores. Zet de betrouwbaarheidsscore voor elke gelabelde beurt af tegen de juistheid. Je zoekt naar het punt waarop verkeerde antwoorden zich beginnen te clusteren.
- Bereken precisie en recall per band. Bereken voor elke voorgestelde band welk percentage van de antwoorden daadwerkelijk correct was (precisie) en welk percentage van de correcte antwoorden zonder onnodige fallback werd doorgelaten (recall).
- Maak een betrouwbaarheidsdiagram. Groepeer voorspellingen op basis van hun betrouwbaarheidsscore en zet voorspelde betrouwbaarheid af tegen waargenomen nauwkeurigheid. Een goed gekalibreerde bot produceert een lijn die dicht bij een diagonaal ligt; een slecht gekalibreerde bot wijkt daarvan af.
- Bereken waar mogelijk de Expected Calibration Error (ECE). Dit ene getal kwantificeert het verschil tussen de uitgesproken betrouwbaarheid en de werkelijke nauwkeurigheid over al je groepen.
- Voer een A/B-test uit voordat je wijzigingen breed uitrolt. Verdeel het verkeer op basis van segment of tijdsvenster en vergelijk vervolgens het automatiseringspercentage, het percentage verkeerde antwoorden en het fallbackpercentage tussen de oude en nieuwe drempels.
Zie het als een pipeline: de scoreverdeling vloeit naar grenswaarden voor de banden, de grenswaarden bepalen de actie-uitkomsten en de actie-uitkomsten worden vergeleken met de ground truth om te controleren of de grenswaarden in de eerste plaats juist waren.
| Metriek | Wat de metriek je vertelt | Tool/methode |
|---|---|---|
| Precisie per band | Aandeel automatisch beantwoorde beurten dat daadwerkelijk correct was | Handmatig labelen van transcripties |
| Recall per band | Aandeel correcte antwoorden dat een onnodige fallback heeft vermeden | Handmatig labelen van transcripties |
| Betrouwbaarheidsdiagram | Of de uitgesproken betrouwbaarheid overeenkomt met de waargenomen nauwkeurigheid | Grafiek met gegroepeerde nauwkeurigheid |
| Expected Calibration Error | Eén score die het kalibratieverschil samenvat | Kalibratieanalyse |
Een onderzoek uit 2025 naar een RAG-gebaseerde chatbot voor technische ondersteuning rapporteerde dat de “Combo”-promptstrategie de Expected Calibration Error verlaagde van 23.33 naar 8.4, terwijl de nauwkeurigheid steeg van 69.33% naar 81.33%, binnen de experimentele opzet van dat onderzoek. Het resultaat is geen universele benchmark, maar laat zien dat prompt- en systeemontwerp zowel de kalibratie als de drempel zelf kunnen beïnvloeden.

Wat gaat er mis wanneer drempels slecht worden ingesteld?
Twee foutmodi bevinden zich aan tegenovergestelde uiteinden van dezelfde schaal, en beide komen vaak genoeg voor dat je hun symptomen goed moet kennen.
- Drempel te laag: de bot antwoordt automatisch op basis van zwakke overeenkomsten. Sommige verkeerde antwoorden worden mogelijk niet gemeld, omdat de flow nooit onzekerheid aangeeft.
- Drempel te hoog: de bot escaleert vragen die hij correct had kunnen beantwoorden, waardoor vertraging ontstaat en het nuttige automatiseringspercentage afneemt.
- Toenemende correctiegebeurtenissen: als gebruikers hun vraag steeds vaker herformuleren, corrigeren of expliciet zeggen “dat is niet wat ik vroeg”, is dat een sterk signaal dat je middelste band te smal is of je grenswaarde voor de hoge band te agressief.
- Verschil tussen fallbackpercentage en volume van supporttickets: als het aantal fallbacks daalt maar je supportwachtrij toch groeit, beantwoordt de bot mogelijk automatisch verkeerd in plaats van te escaleren.
- Feedbackmarkeringen die zich rond je grenswaarde verzamelen: als duimpjes omlaag of signalen als “niet nuttig” zich precies rond je drempelgrens clusteren, staat die grens waarschijnlijk op de verkeerde plaats.
De oplossing kan een andere grenswaarde, een bredere middelste band, betere trainingsgegevens of sterkere retrieval- en groundingcontroles zijn. Controleer bij bots die op RAG zijn gebaseerd of het opgehaalde materiaal het antwoord ondersteunt, in plaats van een vloeiend antwoord als bewijs te beschouwen. Evalueer een voorgestelde drempel eerst offline op gelabelde gesprekken. Als je daarna een online test uitvoert, definieer dan veiligheids- en rollbackcriteria voordat je meer verkeer blootstelt.
Hoe moeten RAG- en LLM-chatbots anders omgaan met betrouwbaarheid?
Generatieve modellen maken routering op basis van betrouwbaarheid complexer, omdat vloeiende, stellige tekst niet bewijst dat een antwoord onderbouwd is. Een nuttig beleid scheidt daarom signalen zoals retrievalkwaliteit, ondersteuning door citaten, consistentie van het antwoord en eventuele classificatorscores. Elk signaal moet nog steeds worden gevalideerd aan de hand van de werkelijke juistheid.
In een medische evaluatie over meerdere specialismen beoordeelden 33 artsen uit 17 specialismen antwoorden op 284 vragen. Het mediane antwoord kreeg een hoge beoordeling, maar 36 eerste antwoorden ontvingen een van de twee laagste nauwkeurigheidsscores op een schaal van zes punten. Die combinatie van sterke gemiddelde prestaties en belangrijke fouten ondersteunt zorgvuldige validatie in domeinen met hoge kosten. In een afzonderlijke consumentenkwestie stelde een tribunaal een luchtvaartmaatschappij aansprakelijk voor onjuiste terugbetalingsinformatie die door haar chatbot was verstrekt.
Praktische patronen die zich in productie bewijzen:
- Vereis een relevante bronpassage voor feitelijke antwoorden in workflows waarin de kennisbank leidend is.
- Behandel een leeg of zwak retrievalresultaat automatisch als lage betrouwbaarheid, ongeacht wat het taalmodel zelf beweert.
- Bouw een expliciet pad in voor “Ik weet het niet” of escalatie dat het model zonder negatieve gevolgen kan kiezen, omdat modellen die zijn getraind om altijd een antwoord te geven ook antwoorden zullen geven wanneer dat niet hoort.
- Sla de herkomst bij het antwoord op, zodat een beoordelaar kan controleren of de bron de bewering ondersteunt.
Pro-tip: Als een antwoord afkomstig hoort te zijn uit een goedgekeurde kennisbank en retrieval niets relevants oplevert, stuur dan door naar verduidelijking of fallback in plaats van het model te vragen iets te improviseren.
Wat moet je monitoren nadat je een drempel hebt gewijzigd?
Een drempelwijziging is geen eenmalige aanpassing die je daarna vergeet. Het is het begin van een monitoringperiode waarin je let op specifieke signalen die aangeven of de wijziging heeft geholpen of de zaken stilletjes erger heeft gemaakt.
- Automatiseringspercentage: het percentage gesprekken dat zonder menselijke tussenkomst wordt opgelost.
- Percentage verkeerde antwoorden: handmatig gelabeld op basis van een steekproef van transcripties, niet door de bot zelf gerapporteerd.
- Fallbackpercentage: hoe vaak de bot escaleert of overdraagt, gevolgd in de tijd en per intent.
- Correcties per 100 gesprekken: hoe vaak gebruikers een vraag herformuleren, corrigeren of een antwoord expliciet afwijzen.
- Escalatielatentie: hoe lang het duurt voordat een overgedragen gesprek een menselijke reactie krijgt.
- Gebruikerstevredenheid of CSAT: idealiter uitgesplitst per band, zodat je kunt zien of bevestigingen in de middelste band daadwerkelijk goed aankomen.
Maak een dashboard dat de verdeling van betrouwbaarheidsscores in de tijd weergeeft naast uitkomstpercentages per band, en houd een vaste steekproef bij van gemarkeerde verkeerde antwoorden voor wekelijkse handmatige beoordeling. De belangrijkste correlatie om in de gaten te houden: als het automatiseringspercentage stijgt terwijl ook het percentage verkeerde antwoorden stijgt, is je drempel zojuist de verkeerde kant op verschoven, ook al lijkt het totale automatiseringscijfer een overwinning. Evaluatie van chatbotprestaties werkt alleen wanneer je beide cijfers naast elkaar volgt, nooit één ervan afzonderlijk.
Kopieerbare beleidsplannen voor drempelgebaseerde routering
Hier is een beleidsstructuur die je rechtstreeks kunt aanpassen, samen met de telemetriecontroles die na elke implementatie automatisch moeten worden uitgevoerd.
Een minimale pseudocodevorm voor de routeringslogica:
if confidence >= HIGH_CUTOFF:
auto_answer(intent)
elif confidence >= MEDIUM_CUTOFF:
present_confirmation(top_2_intents)
else:
escalate_to_human()
Houd de tekst voor de bevestigingsstap kort: “Het lijkt erop dat je iets vraagt over [X] of [Y]. Welke van de twee bedoel je?” Twee aanklikbare keuzes kunnen een dubbelzinnige overeenkomst omzetten in een verduidelijking met één tik. Zorg voor een pad met vrije tekst wanneer de keuzes niet passen.
Valideer een drempelwijziging offline voordat je deze naar al het verkeer uitrolt en gebruik daarna een gecontroleerde test als het platform dat ondersteunt. Stel vooraf rollbackcriteria vast voor het percentage verkeerde antwoorden, het fallbackpercentage en gebruikersfeedback. Een flow voor overdracht aan een medewerker voor de lage band moet het gesprek behouden en de volgende stap duidelijk maken.
Wat moet je bij je chatbotplatform controleren?
Bevestig voordat je op een vendorplatform een productiedrempel inschakelt dat het platform je daadwerkelijk de beheeropties biedt waarvan deze hele aanpak afhankelijk is.
- Kun je onbewerkte betrouwbaarheidsscores per beurt uitlezen, en niet alleen een binair resultaat als “matchte/matchte niet”?
- Kun je drempels per intent of per vaardigheid instellen, in plaats van één globaal getal voor de hele bot?
- Kun je bij RAG-configuraties de retrievalsimilariteitsscore afzonderlijk van de uitvoer van de generatiestap bekijken?
- Ondersteunt het platform een instelling voor de “confidence win margin”, zodat intents met vergelijkbare scores als opties worden gepresenteerd in plaats van dat er stilletjes één wordt gekozen?
- Kun je volledige transcripties exporteren voor offline labeling en analyse, zonder dat de metadata over betrouwbaarheid wordt verwijderd?
- Is er een testmodus waarmee je een voorgestelde drempel op historische verkeersgegevens kunt uitvoeren voordat deze live gebruikers bereikt?
Oracle’s eigen documentatie over het afstellen van intentresolutie is een nuttige referentie voor hoe deze instellingen eruitzien op een volwassen platform: zowel de betrouwbaarheidsdrempel als de “confidence win margin” worden expliciet weergegeven als benoemde, aanpasbare instellingen. Als een leverancier deze vragen tijdens de inkoopfase niet duidelijk kan beantwoorden, beschouw dat dan als een waarschuwingssignaal en niet als een klein tekort. Je kunt niet kalibreren wat je niet kunt zien, en een platform dat zijn scores verbergt, vraagt je om er blind op te vertrouwen.
Hoe Deskhero omgaat met onzekere chatbotantwoorden
Deskhero toont geen onbewerkte chatbotbetrouwbaarheidsscores en biedt geen door klanten aanpasbare betrouwbaarheidsbanden. In plaats daarvan beantwoordt de AI-chatbot vragen vanuit de goedgekeurde openbare FAQ van de workspace en toont hij het contactformulier wanneer hij niet met voldoende vertrouwen kan antwoorden. FAQ-suggesties kunnen worden aangemaakt op basis van opgeloste tickets en gescrapete website-inhoud, maar een User moet ze goedkeuren voordat de chatbot ze kan gebruiken.
- Antwoorden van de chatbot voor klanten gebruiken uitsluitend door de User goedgekeurde openbare FAQ-inhoud.
- Wanneer de chatbot niet met voldoende vertrouwen kan antwoorden, toont hij een formulier waarmee de bezoeker contact kan opnemen met het team.
- Elke chatsessie wordt een ticket met het transcript; automatische acties worden gelabeld en geregistreerd.
- De chatbot wordt per widget ingeschakeld en vereist ten minste 100 goedgekeurde openbare FAQ-items.
Pro-tip: Test veelvoorkomende vragen en bekende randgevallen aan de hand van de goedgekeurde FAQ voordat je een supportchatbot breed inschakelt. Beoordeel zowel beantwoorde als overgedragen chattickets om ontbrekende, dubbelzinnige of verouderde FAQ-items te vinden.
Wat deze gids goed doet en de meeste adviezen niet
De meeste online adviezen over betrouwbaarheidsdrempels behandelen het getal zelf als het product: vind de magische grenswaarde, stel die in en ga verder. Die benadering staat op zijn kop. De drempel is het resultaat van twee zaken die er werkelijk meer toe doen: de kwaliteit van je grounding en je discipline bij het labelen. Geen enkele grenswaarde herstelt een gebrekkige versie van een van beide.
Het onderscheid is het belangrijkst voor generatieve en RAG-chatbots. Een classificatorscore, een retrievalsimilariteitsscore en de uitgesproken zekerheid van een LLM zijn niet onderling uitwisselbaar. Ze komen voort uit verschillende mechanismen en kunnen zeer verschillende relaties met juistheid hebben.
Grounding en drempelkalibratie lossen verschillende problemen op. Relevant bronmateriaal kan niet-onderbouwde antwoorden verminderen, maar garandeert niet dat het model de bron correct interpreteert. Een gekalibreerd routeringsbeleid kan risicovolle automatisering verminderen, maar kan verouderde of onvolledige kennis niet herstellen. Valideer zowel de kennispipeline als de actiedrempels en richt je beoordeling vervolgens op de scorebereiken waarin fouten en overdrachten zich clusteren.
Laat de onderbouwde AI-chatbot van Deskhero werken voor je supportteam
Een aangepaste pipeline voor routering op basis van betrouwbaarheid heeft model- of retrievalscores, transcriptregistratie, evaluatiegegevens en een flow voor overdracht aan een medewerker nodig. Deskhero kiest voor een beheerde aanpak voor zijn AI-chatbot: antwoorden vanuit de goedgekeurde openbare FAQ en het contactformulier tonen wanneer de bot niet met voldoende vertrouwen kan antwoorden.

Deskhero koppelt Gmail-, Google Workspace- en Microsoft 365-mailboxen aan een gedeelde helpdesk, terwijl antwoorden je bedrijfsadres blijven gebruiken. Vragen die binnenkomen via e-mail, een ingebed formulier of de AI-chatbot worden tickets. Deskhero kan openbare FAQ-items voorstellen op basis van opgeloste tickets en gescrapete pagina’s. Zodra een User een item goedkeurt, kunnen zowel de chatbot als AI-automatische antwoorden dit gebruiken. Voor e-commerceteams toont het Shopify-klantenpaneel klant- en bestelcontext naast het ticket.
Start de gratis proefperiode van 30 dagen, zonder creditcard, en test je eigen set van 30 tot 100 vragen voordat je beslist welk deel van je supportvolume je wilt automatiseren.
Bronnen
- Intentresolutie afstellen vóór publicatie
- Confidence scoring optimaliseren in RAG-gebaseerde LLM-chatbots voor technische ondersteuningsdiensten: een aanpak voor prompt engineering
- Hoe nauwkeurig zijn AI-chatbots in klinische scenario’s (peer-reviewed analyse)
Veelgestelde vragen
Wat is een goede betrouwbaarheidsscore voor een chatbot?
Er bestaat geen universeel getal. Een beleid met drie banden kan 0.85 en 0.5 als illustratieve grenzen gebruiken, maar deze waarden zijn geen algemene aanbevelingen. Oracle documenteert 0.7 als startpunt voor het eigen intentmodel. Kalibreer elke grenswaarde aan de hand van gelabelde gesprekken van het model en platform dat je daadwerkelijk gebruikt.
Hoe wordt een betrouwbaarheidsscore berekend?
Voor een intentclassificator is de score modelspecifiek en geeft deze meestal aan hoe sterk het model de voorkeur geeft aan een intent. Beschouw de score alleen als een waarschijnlijkheid wanneer het platform deze zo definieert en kalibratiegegevens die interpretatie ondersteunen. RAG-systemen kunnen ook retrievalsimilariteit, grounding- of antwoordvalidatiesignalen tonen; elk daarvan vereist afzonderlijke evaluatie.
Wat is de betrouwbaarheidsscore in een chatbot op basis van een LLM?
Je mag er niet van uitgaan dat de door een LLM gerapporteerde zekerheid de juistheid voorspelt. Evalueer bij een RAG-chatbot de retrievalkwaliteit en of het antwoord wordt ondersteund door het opgehaalde materiaal. Gebruik deze geteste signalen, in plaats van alleen vloeiende formuleringen of uitgesproken zekerheid, om te bepalen of je antwoordt of terugvalt.
Wat mag je nooit aan een chatbot vertellen?
Deel met geen enkele chatbot gevoelige persoonsgegevens, wachtwoorden, financiële rekeningnummers of vertrouwelijke bedrijfsinformatie, tenzij je het specifieke beleid van het platform voor gegevensverwerking en -bewaring hebt gecontroleerd. Dit is nog belangrijker voor supportbots die gesprekken registreren voor training of kwaliteitscontrole.
Hoe controleer je of het antwoord van een chatbot correct is?
Gebruik een representatieve steekproef van echte gesprekken, label of elk antwoord onderbouwd en correct is en vergelijk die uitkomsten met de beschikbare scores en routeringsacties van het systeem. Deskhero beperkt het bronmateriaal van de chatbot tot door de User goedgekeurde openbare FAQ-inhoud, maar teams moeten antwoorden en overdrachten nog steeds controleren op ontbrekende of verouderde kennis.