← Back to articles

Nastavte prahy důvěry chatbotu, které skutečně snižují počet chyb

Nastavte prahy důvěry chatbotu, které skutečně snižují počet chyb

Pomocí prahových hodnot spolehlivosti bezpečně směrujte nejisté vstupy chatbota. Jeden praktický návrh má tři pásma: při vysoké spolehlivosti odpovědět, uprostřed potvrdit nebo upřesnit a při nízké spolehlivosti předat konverzaci člověku. Číselné hranice je nutné kalibrovat pro váš model a provoz. Hodnoty jako 0.85 a 0.5 mohou pravidlo ilustrovat, ale nejde o univerzální výchozí hodnoty.

Dokumentace společnosti Oracle k rozpoznávání záměrů používá pro vlastní model záměrů hodnotu 0.70 jako výchozí bod a doporučuje testovat vyšší hodnoty, pokud tomu výsledky nasvědčují. Tato rada je specifická pro danou platformu. Prahová hodnota, která funguje pro jeden model, doménu nebo definici skóre, může být pro jiný nesprávná.

Než prahovou hodnotu změníte, vytvořte reprezentativní evaluační sadu z nedávných konverzací. Označte, zda byl každý předpovězený záměr nebo odpověď správný, a poté tyto výsledky porovnejte se skóre a akcemi zaznamenanými systémem. Získáte tak podklady pro volbu hranice místo toho, abyste se spoléhali pouze na výchozí hodnotu dodavatele.

  • Vysoké pásmo (ilustrativně: 0.85+): bot odpovídá automaticky, bez kroku potvrzení.
  • Střední pásmo (ilustrativně: 0.5 až 0.85): bot před provedením akce požádá o potvrzení nebo upřesnění.
  • Nízké pásmo (ilustrativně: pod 0.5): bot předá konverzaci člověku nebo aktivuje záložní záměr.

Tip pro profesionály: Začněte s dostatečným počtem nedávných konverzací, které pokrývají běžné záměry, nejednoznačné formulace a známé případy selhání. Menší, pečlivě označená sada je užitečnější než velký vzorek s nespolehlivými štítky.

Hlavní závěry

Pravidla se třemi pásmy mohou omezit tiché nesprávné odpovědi tím, že nejednoznačným vstupům nabídnou cestu přes potvrzení. Jejich vliv na automatizaci a přesnost je nutné měřit pomocí vlastních označených konverzací.

Konkrétní bod Podrobnosti
Začněte se třemi pásmy Definujte akce pro vysokou, střední a nízkou spolehlivost. Hodnoty 0.85 a 0.5 berte jako příklady a skutečné hranice následně kalibrujte.
Kalibrujte na reálných datech Označte reprezentativní sadu z hlediska správnosti a před důvěrou v jakoukoli prahovou hodnotu zkontrolujte výkon v jednotlivých pásmech skóre.
Nedůvěřujte vlastnímu hodnocení spolehlivosti LLM V systémech RAG vyhodnocujte signály získávání a ukotvení místo spoléhání na deklarovanou jistotu modelu.
Sledujte automatizaci i chyby Sledujte míru automatizace a míru nesprávných odpovědí společně; růst pouze jedné z nich je varovným signálem.
Používejte ukotvené a schválené znalosti AI chat-bot Deskhero odpovídá pouze z veřejného obsahu FAQ schváleného Uživatelem a v případě, že nedokáže odpovědět s dostatečnou jistotou, předá konverzaci člověku.

Obsah

Co přesně je prahová hodnota spolehlivosti chatbota?

Skóre spolehlivosti je číslo, které klasifikátor záměrů nebo vyhledávací systém přiřadí svému nejlepšímu odhadu, obvykle někde mezi 0 a 1. Prahová hodnota spolehlivosti je hranice, kterou v tomto rozsahu nastavíte, abyste rozhodli, co bot udělá dál. Skóre řadí dostupné možnosti; prahová hodnota je pravidlo, které na toto skóre navrstvíte.

Význam skóre spolehlivosti závisí na systému. Některé klasifikátory poskytují skóre, která lze kalibrovat podle pozorované správnosti. Jiné platformy zpřístupňují pouze signály pořadí nebo podobnosti. Nepředpokládejte, že skóre 0.92 znamená 92% pravděpodobnost správné odpovědi, pokud dodavatel tento výklad nepopisuje v dokumentaci a vaše evaluační data jej nepotvrdí.

Generování rozšířené vyhledáváním (RAG) přidává další vrstvu. Vygenerovaná odpověď může znít sebejistě, i když je vyhledaný materiál zastaralý nebo nerelevantní. Podobnost při vyhledávání, kvalita zdroje, opora odpovědi a chování modelu jsou samostatné signály. Každý z nich před sloučením do směrovacích pravidel otestujte proti označeným výsledkům.

Tip pro profesionály: Nepoužívejte vlastní deklarovanou jistotu LLM jako jediný signál pro směrování. Vyžadujte relevantní zdrojový materiál a ověřte, zda kontroly vyhledávání nebo ukotvení skutečně předpovídají správnost na vašich datech.

Proč jsou tři pásma spolehlivosti lepší než jediná hranice?

Jediná prahová hodnota vynucuje binární volbu: odpovědět, nebo neodpovědět. Střední pásmo přidává třetí možnost: položit krátkou upřesňující otázku. To může omezit tichá selhání, aniž by každý nejistý vstup putoval přímo k člověku.

Pásmo Typický rozsah Chování bota Příklad UX
Vysoké Ilustrativně: 0.85 a více Automatická odpověď bez tření Bot odpoví přímo: „Vaše objednávka bude odeslána ve čtvrtek.“
Střední Ilustrativně: 0.5 až 0.85 Potvrzení nebo upřesnění „Myslíte sledování objednávky, nebo její zrušení?“
Nízké Ilustrativně: pod 0.5 Záložní postup nebo předání „Spojím vás s někým z našeho týmu.“

Diagram pásem spolehlivosti chatbota a jejich chování

Tyto rozsahy jsou příklady, které konkretizují logiku směrování. Nahraďte je hodnotami odvozenými z vlastní platformy, definice skóre a nákladů na nesprávnou odpověď.

Jakmile ji uvidíte v praxi, je logika jednoduchá. Jediná hranice nastavená například na 0.70 znamená, že každé skóre těsně nad touto hranicí bude automaticky zodpovězeno s plnou jistotou, přestože skóre 0.71 se od 0.69 liší jen nepatrně. Střední pásmo vytváří nárazníkovou zónu, v níž bot přizná určitou nejistotu, místo aby předstíral, že žádnou nemá.

  • Udržujte potvrzovací postupy krátké. Volby, na které lze klepnout, často snižují nejednoznačnost lépe než další otázka s otevřenou odpovědí.
  • Text záložní odpovědi by měl uznat neúspěch, aniž by zněl rozbitě: „Nejsem si jistý, že jsem tomu správně porozuměl, spojím vás s člověkem.“
  • Měřte, zda potvrzení ve středním pásmu nejednoznačnost skutečně vyřeší, nebo pouze přidají tření.

Zde je kompromis, který je třeba zúčastněným stranám vysvětlit jasně: snížení prahové hodnoty zvýší míru automatizace, ale každá nesprávná odpověď, která přes sníženou laťku projde, se stane neviditelnou. Nikdo ji neoznačí, protože bot působil sebejistě. Zvýšení prahové hodnoty udělá opak: selhání se projeví jako předání nebo záložní postup, což provozně působí hůře, ale je ve skutečnosti bezpečnější, protože viditelné selhání se zaznamená a opraví, zatímco neviditelné pouze tiše narušuje důvěru.

Jak kalibrovat prahové hodnoty spolehlivosti pro svého bota?

Výchozí hodnoty dodavatelů a oborová pásma jsou pouze začátkem. Skutečné hranice by měly vycházet z vašich vlastních přepisů, protože úroveň přesnosti chatbotů se výrazně liší podle domény, složitosti záměrů a toho, jak neuspořádané jsou formulace vašich uživatelů.

  1. Vytvořte reprezentativní testovací sadu. Použijte skutečné dotazy pokrývající běžné záměry, nejednoznačné formulace a nákladná selhání. Požadovaná velikost vzorku závisí na provozu a potřebné přesnosti.
  2. Označte skutečný stav. U každého přepisu vyznačte, zda byla poskytnutá odpověď skutečně správná, nikoli pouze zda bot zněl sebejistě.
  3. Propojte výsledky se skóre. U každého označeného vstupu vyneste skóre spolehlivosti proti správnosti. Hledáte místa, kde se začínají shlukovat nesprávné odpovědi.
  4. Vypočítejte přesnost a úplnost pro jednotlivá pásma. Pro každé navrhované pásmo spočítejte, jaké procento odpovědí bylo skutečně správných (přesnost) a jaké procento správných odpovědí prošlo bez zbytečného předání (úplnost).
  5. Vytvořte diagram spolehlivosti. Seskupte předpovědi podle skóre spolehlivosti a vyneste předpokládanou spolehlivost proti pozorované přesnosti. Dobře kalibrovaný bot vytvoří téměř diagonální čáru; špatně kalibrovaný se od ní odchyluje.
  6. Pokud je to možné, vypočítejte očekávanou chybu kalibrace (ECE). Toto jediné číslo vyjadřuje rozdíl mezi deklarovanou spolehlivostí a skutečnou přesností napříč všemi vašimi skupinami.
  7. Před širším nasazením změn proveďte A/B test. Rozdělte provoz podle segmentu nebo časového okna a porovnejte míru automatizace, míru nesprávných odpovědí a míru předání mezi starými a novými prahovými hodnotami.

Představte si to jako postup: rozložení skóre vede k hranicím pásem, hranice pásem určují výsledné akce a výsledky akcí se porovnávají se skutečným stavem, aby se ověřilo, zda byly hranice vůbec správné.

Metrika Co vám říká Nástroj/metoda
Přesnost pro jednotlivá pásma Podíl automaticky zodpovězených vstupů, které byly skutečně správné Ruční označování přepisů
Úplnost pro jednotlivá pásma Podíl správných odpovědí, které se vyhnuly zbytečnému předání Ruční označování přepisů
Diagram spolehlivosti Zda deklarovaná spolehlivost odpovídá pozorované přesnosti Graf přesnosti podle skupin
Očekávaná chyba kalibrace Jedno skóre shrnující rozdíl v kalibraci Analýza kalibrace

Jedna studie z roku 2025 zaměřená na technickou podporu pomocí chatbota založeného na RAG uvedla, že její strategie promptu „Combo“ snížila očekávanou chybu kalibrace z 23.33 na 8.4, zatímco přesnost vzrostla z 69.33 % na 81.33 %, v rámci experimentálního nastavení dané studie. Výsledek není univerzálním měřítkem, ale ukazuje, že návrh promptů a systému může ovlivnit kalibraci stejně jako samotná prahová hodnota.

Jak kalibrovat prahové hodnoty spolehlivosti pro svého bota? Přehledový diagram

Co se pokazí při nesprávném nastavení prahových hodnot?

Na opačných koncích stejného ovladače se nacházejí dva způsoby selhání a oba jsou natolik běžné, že byste jejich příznaky měli dokonale znát.

  • Příliš nízká prahová hodnota: bot automaticky odpovídá na základě slabých shod. Některé nesprávné odpovědi mohou zůstat nenahlášené, protože postup nikdy nevyjádří nejistotu.
  • Příliš vysoká prahová hodnota: bot předává otázky, na které by dokázal správně odpovědět, čímž přidává prodlevu a snižuje užitečnou míru automatizace.
  • Růst počtu oprav: pokud uživatelé stále častěji přeformulovávají dotazy, opravují bota nebo výslovně říkají „na to jsem se neptal“, je to silný signál, že vaše střední pásmo je příliš úzké nebo že hranice vysokého pásma je příliš přísná.
  • Nesoulad mezi mírou záložních postupů a objemem požadavků na podporu: pokud počet předání klesá, ale fronta podpory přesto roste, bot možná místo eskalace automaticky poskytuje nesprávné odpovědi.
  • Shlukování negativní zpětné vazby v okolí hranice: pokud se záporná hodnocení nebo signály „neužitečné“ shlukují přímo kolem hranice vaší prahové hodnoty, je tato hranice pravděpodobně nastavena na nesprávném místě.

Řešením může být jiná hranice, širší střední pásmo, kvalitnější trénovací data nebo důkladnější kontroly vyhledávání a ukotvení. U botů založených na RAG ověřte, zda vyhledaný materiál odpověď podporuje, místo abyste považovali plynulou odpověď za důkaz. Navrhovanou prahovou hodnotu nejprve otestujte offline na označených konverzacích. Pokud poté spustíte online test, stanovte bezpečnostní a návratová kritéria ještě před zpřístupněním většího objemu provozu.

Jak by měly chatboty RAG a LLM pracovat se spolehlivostí odlišně?

Generativní modely komplikují směrování podle spolehlivosti, protože plynulý a sebejistý text není důkazem, že je odpověď ukotvená ve zdrojích. Užitečná pravidla proto oddělují signály, jako jsou kvalita vyhledávání, podpora citacemi, konzistence odpovědi a případné skóre klasifikátoru. Každý signál je stále třeba ověřit proti skutečné správnosti.

V rámci multispecializačního lékařského hodnocení posuzovalo 33 lékařů ze 17 specializací odpovědi na 284 otázek. Medián hodnocení odpovědí byl vysoký, ale 36 úvodních odpovědí získalo na šestibodové škále jedno ze dvou nejnižších hodnocení přesnosti. Tato kombinace silného průměrného výkonu a závažných selhání podporuje pečlivé ověřování v doménách s vysokými náklady na chyby. V samostatném spotřebitelském případu tribunál shledal leteckou společnost odpovědnou za nepřesné informace o vrácení peněz poskytnuté jejím chatbotem.

Praktické postupy, které se osvědčují v produkci:

  • U faktických odpovědí ve scénářích, kde je znalostní báze autoritativním zdrojem, vyžadujte relevantní pasáž ze zdroje.
  • Prázdný nebo slabý výsledek vyhledávání považujte automaticky za nízkou spolehlivost bez ohledu na to, co tvrdí samotný jazykový model.
  • Vytvořte explicitní cestu „Nevím“ nebo eskalace, kterou může model zvolit bez postihu, protože modely trénované k tomu, aby vždy vytvořily odpověď, ji vytvoří i tehdy, kdy by neměly.
  • Ukládejte spolu s odpovědí informace o původu, aby mohl kontrolor ověřit, zda zdroj dané tvrzení podporuje.

Tip pro profesionály: Pokud má odpověď pocházet ze schválené znalostní báze a vyhledávání nevrátí nic relevantního, přesměrujte uživatele k upřesnění nebo záložnímu postupu, místo abyste model žádali o improvizaci.

Co sledovat po změně prahové hodnoty?

Změna prahové hodnoty není jednorázová úprava, kterou provedete a zapomenete na ni. Je začátkem období sledování, během něhož kontrolujete konkrétní signály ukazující, zda změna pomohla, nebo situaci nenápadně zhoršila.

  • Míra automatizace: procento konverzací vyřešených bez zapojení člověka.
  • Míra nesprávných odpovědí: ručně označená na vzorku přepisů, nikoli uváděná samotným botem.
  • Míra záložních postupů: jak často bot eskaluje nebo předává konverzaci, sledováno v čase a podle záměru.
  • Počet oprav na 100 konverzací: jak často uživatelé přeformulují dotaz, opraví odpověď nebo ji výslovně odmítnou.
  • Prodleva při eskalaci: jak dlouho trvá, než se předaná konverzace dostane k odpovědi člověka.
  • Spokojenost uživatelů nebo CSAT: ideálně rozdělená podle pásem, abyste viděli, zda potvrzení ve středním pásmu skutečně fungují.

Vytvořte dashboard, který v čase zobrazuje rozložení skóre spolehlivosti společně s mírou výsledků podle pásem, a každý týden pravidelně ručně kontrolujte vzorek označených nesprávných odpovědí. Nejdůležitější korelace, kterou je třeba sledovat: pokud roste míra automatizace a současně i míra nesprávných odpovědí, vaše prahová hodnota se posunula špatným směrem, i když celková míra automatizace vypadá jako úspěch. Hodnocení výkonu chatbota funguje pouze tehdy, když obě čísla sledujete vedle sebe, nikdy ne každé izolovaně.

Použitelné scénáře pravidel pro směrování podle prahových hodnot

Zde je struktura pravidel, kterou můžete přímo upravit, spolu s kontrolami telemetrie, jež by se měly po každém nasazení spouštět automaticky.

Minimální podoba pseudokódu pro logiku směrování:

if confidence >= HIGH_CUTOFF:
    auto_answer(intent)
elif confidence >= MEDIUM_CUTOFF:
    present_confirmation(top_2_intents)
else:
    escalate_to_human()

U kroku potvrzení udržujte text stručný: „Vypadá to, že se ptáte na [X] nebo [Y]. Která možnost platí?“ Dvě volby, na které lze klepnout, mohou změnit nejednoznačnou shodu v upřesnění jedním klepnutím. Pokud žádná z možností nesedí, ponechte k dispozici cestu s volným textem.

Před nasazením změny prahové hodnoty na celý provoz ji ověřte offline a poté použijte řízený test, pokud jej platforma podporuje. Předem stanovte kritéria pro návrat zpět s ohledem na míru nesprávných odpovědí, míru záložních postupů a zpětnou vazbu uživatelů. Postup předání konverzace člověku pro nízké pásmo by měl zachovat konverzaci a jasně určit další krok.

Co ověřit u své chatbotové platformy?

Než na jakékoli platformě dodavatele přepnete prahovou hodnotu v produkci, ověřte, zda vám platforma skutečně poskytuje ovládací prvky, na kterých celý tento přístup závisí.

  • Můžete u každého vstupu číst nezpracovaná skóre spolehlivosti, nejen binární výsledek „shoda/bez shody“?
  • Můžete nastavovat prahové hodnoty pro jednotlivé záměry nebo dovednosti, místo jednoho globálního čísla pro celého bota?
  • Můžete u konfigurací RAG získat skóre podobnosti při vyhledávání odděleně od výstupu kroku generování?
  • Podporuje platforma nastavení „marže vítězství spolehlivosti“, aby se záměry s podobným skóre zobrazily jako možnosti namísto tichého výběru jednoho z nich?
  • Můžete exportovat úplné přepisy pro offline označování a analýzu, aniž by se odstranila metadata spolehlivosti?
  • Existuje testovací režim, který vám umožní spustit kandidátní prahovou hodnotu na historickém provozu ještě předtím, než zasáhne živé uživatele?

Vlastní dokumentace společnosti Oracle k ladění rozpoznávání záměrů je užitečnou referencí toho, jak tato nastavení vypadají ve vyspělé platformě: prahová hodnota spolehlivosti i marže vítězství spolehlivosti se v ní objevují explicitně jako pojmenované a nastavitelné ovládací prvky. Pokud dodavatel během výběrového řízení nedokáže na tyto otázky jasně odpovědět, považujte to za varovný signál, nikoli za drobný nedostatek. Co nevidíte, to nemůžete kalibrovat, a platforma, která svá skóre skrývá, po vás chce, abyste jí slepě důvěřovali.

Jak Deskhero pracuje s nejistými odpověďmi chatbota

Deskhero nezpřístupňuje nezpracovaná skóre spolehlivosti chatbota ani zákazníkem nastavovatelná pásma spolehlivosti. Jeho AI chat-bot místo toho odpovídá ze schváleného veřejného FAQ pracovního prostoru a v případě, že nedokáže odpovědět s dostatečnou jistotou, zobrazí kontaktní formulář. Návrhy položek FAQ lze vytvářet z vyřešených tiketů a obsahu načteného z webu, ale před použitím chatbotem je musí schválit Uživatel.

  • Odpovědi chatbota určené zákazníkům používají pouze veřejný obsah FAQ schválený Uživatelem.
  • Pokud chatbot nedokáže odpovědět s dostatečnou jistotou, zobrazí formulář, prostřednictvím kterého může návštěvník kontaktovat tým.
  • Každá chatová relace se stává tiketem s vlastním přepisem a automatické akce jsou označeny a zaznamenány.
  • Chatbot se aktivuje pro každý widget samostatně a vyžaduje alespoň 100 schválených veřejných položek FAQ.

Tip pro profesionály: Než chatbot podpory plošně aktivujete, otestujte běžné otázky a známé okrajové případy proti schválenému FAQ. Projděte zodpovězené i předané chatové tikety a vyhledejte chybějící, nejednoznačné nebo zastaralé položky FAQ.

V čem má tento průvodce pravdu, zatímco většina rad nikoli

Většina rad týkajících se prahových hodnot spolehlivosti na internetu zachází s číslem samotným jako s hlavním produktem: najděte magickou hranici, nastavte ji a pokračujte dál. Tento pohled je obrácený. Prahová hodnota je odvozena od dvou věcí, na kterých ve skutečnosti záleží více — od kvality ukotvení a důslednosti označování — a žádná hranice neopraví vadnou podobu ani jednoho z nich.

Tento rozdíl je nejdůležitější u generativních chatbotů a chatbotů RAG. Skóre klasifikátoru, skóre podobnosti při vyhledávání a deklarovaná jistota LLM nejsou zaměnitelné. Pocházejí z různých mechanismů a jejich vztah ke správnosti může být velmi odlišný.

Ukotvení a kalibrace prahových hodnot řeší různé problémy. Relevantní zdrojový materiál může omezit nepodložené odpovědi, ale nezaručuje, že model zdroj správně interpretuje. Kalibrovaná pravidla směrování mohou omezit rizikovou automatizaci, ale nedokážou opravit zastaralé nebo neúplné znalosti. Ověřte jak znalostní proces, tak akční prahové hodnoty a následně zaměřte kontrolu na rozsahy skóre, v nichž se shlukují chyby a předání.

Zprovozněte ukotvený AI chatbot Deskhero pro svůj tým podpory

Vlastní proces směrování podle spolehlivosti vyžaduje skóre modelu nebo vyhledávání, protokolování přepisů, evaluační data a postup předání konverzace člověku. Deskhero používá pro svůj AI chat-bot spravovaný přístup: odpovídá ze schváleného veřejného FAQ a v případě, že nedokáže odpovědět s dostatečnou jistotou, zobrazí kontaktní formulář.

Deskhero

Deskhero propojí schránky Gmailu, Google Workspace a Microsoft 365 se sdílenou helpdeskovou platformou, přičemž odpovědi se nadále odesílají z adresy vaší společnosti. Otázky doručené e-mailem, prostřednictvím vloženého formuláře nebo AI chat-botu se stávají tikety. Deskhero může navrhovat veřejné položky FAQ z vyřešených tiketů a načtených stránek. Jakmile Uživatel položku schválí, může ji používat chatbot i automatické AI odpovědi. Pro e-commerce týmy zobrazuje zákaznický panel Shopify vedle tiketu kontext zákazníka a objednávky.

Začněte 30denní bezplatnou zkušební verzi bez nutnosti platební karty a před rozhodnutím, jak velkou část podpory automatizovat, na ní spusťte vlastní testovací sadu 30 až 100 otázek.

Zdroje

Časté dotazy

Jaké skóre spolehlivosti je pro chatbota dobré?

Neexistuje univerzální číslo. Pravidla se třemi pásmy mohou jako ilustrativní hranice používat hodnoty 0.85 a 0.5, ale nejde o obecná doporučení. Oracle pro vlastní model záměrů uvádí jako výchozí bod hodnotu 0.7. Každou hranici kalibrujte podle označených konverzací z modelu a platformy, které skutečně používáte.

Jak se skóre spolehlivosti vypočítává?

U klasifikátoru záměrů je skóre specifické pro daný model a obvykle vyjadřuje, jak silně model upřednostňuje určitý záměr. Za pravděpodobnost je lze považovat pouze tehdy, pokud jej tak definuje platforma a tento výklad podporují kalibrační data. Systémy RAG mohou také zpřístupňovat podobnost při vyhledávání, ukotvení nebo signály validace odpovědi, z nichž každý vyžaduje samostatné hodnocení.

Co je skóre spolehlivosti v chatbotu založeném na LLM?

Nelze předpokládat, že vlastní hodnocení spolehlivosti LLM předpovídá správnost. U chatbota RAG vyhodnoťte kvalitu vyhledávání a to, zda je odpověď podložena vyhledaným materiálem. Při rozhodování, zda odpovědět, nebo použít záložní postup, využívejte tyto otestované signály, nikoli pouze plynulou formulaci či deklarovanou jistotu.

Co byste chatbotu nikdy neměli sdělovat?

S žádným chatbotem nesdílejte citlivé osobní údaje, hesla, čísla finančních účtů ani důvěrné obchodní informace, pokud jste si neověřili konkrétní pravidla platformy pro nakládání s daty a jejich uchovávání. Je to ještě důležitější u botů podpory, které zaznamenávají konverzace pro účely trénování nebo kontroly kvality.

Jak ověříte, že je odpověď chatbota správná?

Použijte reprezentativní vzorek skutečných konverzací, označte, zda byla každá odpověď podložená a správná, a porovnejte tyto výsledky s dostupnými skóre a směrovacími akcemi systému. Deskhero omezuje zdrojový materiál chatbota na veřejný obsah FAQ schválený Uživatelem, týmy by však stále měly kontrolovat odpovědi a předání kvůli chybějícím nebo zastaralým znalostem.