← Back to articles

Defina limites de confiança para chatbots que realmente reduzem erros

Defina limites de confiança para chatbots que realmente reduzem erros

Use limites de confiança para encaminhar com segurança as interações incertas do chatbot. Um design prático tem três faixas: responder com alta confiança, confirmar ou esclarecer na faixa intermediária e encaminhar para uma pessoa quando a confiança for baixa. Os valores numéricos devem ser calibrados para o seu modelo e tráfego. Valores como 0.85 e 0.5 podem ilustrar a política, mas não são padrões universais.

A documentação da Oracle sobre resolução de intenções usa 0.70 como ponto de partida para seu próprio modelo de intenções e recomenda testar valores mais altos quando os resultados derem suporte a isso. Essa recomendação é específica da plataforma. Um limite que funciona para um modelo, domínio ou definição de pontuação pode estar errado para outro.

Antes de alterar um limite, crie um conjunto de avaliação representativo a partir de conversas recentes. Identifique se cada intenção ou resposta prevista estava correta e compare esses resultados com as pontuações e ações registradas pelo sistema. Isso fornece evidências para escolher um limite, em vez de depender apenas de um padrão definido pelo fornecedor.

  • Faixa alta (ilustrativa: 0.85+): o bot responde automaticamente, sem etapa de confirmação.
  • Faixa média (ilustrativa: de 0.5 a 0.85): o bot confirma ou esclarece antes de agir.
  • Faixa baixa (ilustrativa: abaixo de 0.5): o bot encaminha para uma pessoa ou aciona uma intenção de fallback.

Dica profissional: Comece com conversas recentes suficientes para abranger intenções comuns, formulações ambíguas e casos de falha conhecidos. Um conjunto menor e cuidadosamente rotulado é mais útil do que uma amostra grande com rótulos pouco confiáveis.

Principais conclusões

Uma política de três faixas pode reduzir respostas erradas silenciosas ao oferecer um caminho de confirmação para interações ambíguas. O efeito sobre a automação e a precisão deve ser medido com suas próprias conversas rotuladas.

Ponto Detalhes
Comece com três faixas Defina ações altas, médias e baixas. Trate 0.85 e 0.5 como exemplos e, em seguida, calibre os limites reais.
Calibre com dados reais Rotule um conjunto representativo quanto à correção e, depois, analise o desempenho por faixa de pontuação antes de confiar em qualquer limite.
Desconfie da autoconfiança dos LLMs Em sistemas RAG, avalie os sinais de recuperação e fundamentação, em vez de depender da certeza declarada pelo modelo.
Monitore automação e erros Acompanhe simultaneamente a taxa de automação e a taxa de respostas erradas; o aumento isolado de uma delas é um sinal de alerta.
Use conhecimento fundamentado e aprovado O chat-bot de IA da Deskhero responde apenas com base no conteúdo público de FAQ aprovado pelo User e encaminha a conversa quando não consegue responder com confiança.

Índice

O que é exatamente um limite de confiança de chatbot?

Uma pontuação de confiança é o número que o classificador de intenções ou sistema de recuperação atribui à sua melhor suposição, geralmente em algum ponto entre 0 e 1. Um limite de confiança é a linha que você traça nesse intervalo para decidir o que o bot fará em seguida. A pontuação classifica suas opções; o limite é a decisão de política aplicada sobre ela.

O significado de uma pontuação de confiança depende do sistema. Alguns classificadores produzem pontuações que podem ser calibradas com base na correção observada. Outras plataformas expõem apenas sinais de classificação ou similaridade. Não presuma que uma pontuação de 0.92 significa 92% de chance de uma resposta correta, a menos que o fornecedor documente essa interpretação e seus dados de avaliação a confirmem.

A geração aumentada por recuperação (RAG) acrescenta outra camada. A resposta gerada pode soar certa mesmo quando o material recuperado está desatualizado ou é irrelevante. Similaridade da recuperação, qualidade da fonte, suporte à resposta e comportamento do modelo são sinais distintos. Teste cada um deles com resultados rotulados antes de combiná-los em uma política de encaminhamento.

Dica profissional: Não use a certeza declarada pelo próprio LLM como único sinal de encaminhamento. Exija material de fonte relevante e teste se as verificações de recuperação ou fundamentação realmente preveem a correção com seus dados.

Por que três faixas de confiança são melhores do que um único limite

Um único limite força uma escolha binária: responder ou não responder. Uma faixa intermediária acrescenta uma terceira opção: fazer uma pergunta curta de esclarecimento. Isso pode reduzir falhas silenciosas sem enviar diretamente para uma pessoa todas as interações incertas.

Faixa Intervalo típico Comportamento do bot Exemplo de UX
Alta Ilustrativo: 0.85 ou mais Resposta automática, sem atrito O bot responde diretamente: “Seu pedido será enviado na quinta-feira.”
Média Ilustrativo: de 0.5 a 0.85 Confirma ou esclarece “Você quis dizer rastrear seu pedido ou cancelá-lo?”
Baixa Ilustrativo: abaixo de 0.5 Fallback ou encaminhamento “Vou conectar você a alguém da nossa equipe.”

Diagrama das faixas de confiança do chatbot e seus comportamentos

Esses intervalos são exemplos que tornam concreta a lógica de encaminhamento. Substitua-os por valores derivados da sua própria plataforma, definição de pontuação e custo de uma resposta errada.

A justificativa é simples quando você a vê na prática. Um único limite em, por exemplo, 0.70 significa que toda pontuação logo acima dessa linha receberá uma resposta automática com confiança total, embora uma pontuação de 0.71 seja apenas ligeiramente diferente de 0.69. A faixa intermediária oferece uma zona de proteção na qual o bot admite alguma incerteza, em vez de fingir que não tem nenhuma.

  • Mantenha os fluxos de confirmação curtos. Opções selecionáveis costumam reduzir a ambiguidade melhor do que outra pergunta aberta.
  • O texto do fallback deve reconhecer o erro sem parecer que o sistema está quebrado: “Não tenho certeza de que entendi isso, deixe-me chamar uma pessoa para ajudar você.”
  • Meça se as confirmações da faixa intermediária resolvem a ambiguidade ou apenas acrescentam atrito.

Esta é a compensação que as partes interessadas precisam ouvir claramente: reduzir seu limite aumenta a taxa de automação, mas cada resposta errada que ultrapassa uma barreira reduzida se torna invisível. Ninguém a sinaliza porque o bot pareceu confiante. Aumentar o limite faz o oposto: torna as falhas visíveis como fallbacks, o que parece pior operacionalmente, mas na verdade é mais seguro, pois uma falha visível é registrada e corrigida, enquanto uma falha invisível apenas corrói a confiança silenciosamente.

Como calibrar os limites de confiança do seu bot?

Padrões de fornecedores e faixas do setor são pontos de partida. Seus limites reais devem vir das suas próprias transcrições, porque os níveis de precisão dos chatbots variam muito conforme o domínio, a complexidade das intenções e o grau de desorganização das formulações dos usuários.

  1. Crie um conjunto de testes representativo. Use perguntas reais que abranjam intenções comuns, formulações ambíguas e casos de falha dispendiosos. O tamanho necessário da amostra depende do tráfego e da precisão de que você precisa.
  2. Rotule a verdade de referência. Para cada transcrição, marque se a resposta fornecida estava realmente correta, não apenas se o bot parecia confiante.
  3. Relacione os resultados às pontuações. Trace a pontuação de confiança em relação à correção para cada interação rotulada. Você está procurando o ponto em que as respostas erradas começam a se concentrar.
  4. Calcule precisão e recall por faixa. Para cada faixa proposta, calcule qual porcentagem das respostas estava realmente correta (precisão) e qual porcentagem das respostas corretas passou sem um fallback desnecessário (recall).
  5. Crie um diagrama de confiabilidade. Agrupe as previsões por pontuação de confiança e trace a confiança prevista em relação à precisão observada. Um bot bem calibrado produz uma linha próxima da diagonal; um bot mal calibrado se afasta dela.
  6. Calcule o Erro Esperado de Calibração (ECE) quando possível. Esse número único quantifica a diferença entre a confiança declarada e a precisão real em todos os seus grupos.
  7. Faça um teste A/B antes de implementar amplamente as alterações. Divida o tráfego por segmento ou janela de tempo e compare a taxa de automação, a taxa de respostas erradas e a taxa de fallback entre os limites antigo e novo.

Pense nisso como um pipeline: a distribuição das pontuações alimenta os limites das faixas, os limites determinam os resultados das ações e os resultados das ações são medidos em relação à verdade de referência para verificar se os limites estavam corretos desde o início.

Métrica O que ela informa Ferramenta/método
Precisão por faixa Parcela das interações respondidas automaticamente que estava realmente correta Rotulagem manual de transcrições
Recall por faixa Parcela das respostas corretas que evitou um fallback desnecessário Rotulagem manual de transcrições
Diagrama de confiabilidade Se a confiança declarada corresponde à precisão observada Gráfico de precisão agrupada
Erro Esperado de Calibração Pontuação única que resume a diferença de calibração Análise de calibração

Um estudo de 2025 sobre um chatbot de suporte técnico baseado em RAG relatou que sua estratégia de prompt “Combo” reduziu o Erro Esperado de Calibração de 23.33 para 8.4, enquanto a precisão aumentou de 69.33% para 81.33%, dentro da configuração experimental daquele estudo. O resultado não é uma referência universal, mas mostra que o design do prompt e do sistema pode afetar a calibração tanto quanto o próprio limite.

Como calibrar os limites de confiança do seu bot? Diagrama geral

O que dá errado quando os limites são mal definidos?

Dois modos de falha ficam em extremidades opostas do mesmo controle, e ambos são comuns o suficiente para que você conheça bem seus sintomas.

  • Limite baixo demais: o bot responde automaticamente com base em correspondências fracas. Algumas respostas erradas podem não ser reportadas porque o fluxo nunca sinaliza incerteza.
  • Limite alto demais: o bot encaminha perguntas que poderia responder corretamente, acrescentando demora e reduzindo a taxa de automação útil.
  • Aumento dos eventos de correção: se os usuários estão reformulando, corrigindo ou dizendo explicitamente “não foi isso que perguntei” com frequência cada vez maior, isso é um forte sinal de que sua faixa intermediária é estreita demais ou de que o limite da faixa alta é agressivo demais.
  • Incompatibilidade entre a taxa de fallback e o volume de chamados de suporte: se os fallbacks estão diminuindo, mas sua fila de suporte continua crescendo, o bot pode estar respondendo automaticamente de forma errada em vez de encaminhar.
  • Concentração de sinalizações de feedback perto do limite: se os sinais de avaliação negativa ou “não foi útil” se concentram bem próximo da fronteira do seu limite, provavelmente essa fronteira está no lugar errado.

A solução pode ser um limite diferente, uma faixa intermediária mais ampla, dados de treinamento melhores ou verificações mais fortes de recuperação e fundamentação. Para bots baseados em RAG, verifique se o material recuperado dá suporte à resposta, em vez de tratar uma resposta fluente como evidência. Avalie primeiro um limite proposto offline em conversas rotuladas. Se depois você executar um teste online, defina critérios de segurança e reversão antes de expor mais tráfego.

Como os chatbots RAG e LLM devem lidar com a confiança de forma diferente?

Os modelos generativos complicam o encaminhamento baseado em confiança porque um texto fluente e assertivo não prova que uma resposta está fundamentada. Portanto, uma política útil separa sinais como qualidade da recuperação, suporte por citações, consistência da resposta e qualquer pontuação do classificador. Cada sinal ainda precisa ser validado em relação à correção real.

Em uma avaliação médica multiespecialidade, 33 médicos de 17 especialidades avaliaram respostas a 284 perguntas. A resposta mediana recebeu uma avaliação alta, mas 36 respostas iniciais receberam uma das duas menores pontuações de precisão em uma escala de seis pontos. Essa combinação de um desempenho médio forte com falhas importantes reforça a necessidade de uma validação cuidadosa em domínios de alto custo. Em um caso separado envolvendo consumidores, um tribunal considerou uma companhia aérea responsável por informações imprecisas sobre reembolsos fornecidas pelo seu chatbot.

Padrões práticos que funcionam em produção:

  • Exija uma passagem de fonte relevante para respostas factuais em fluxos nos quais a base de conhecimento seja a autoridade.
  • Trate um resultado de recuperação vazio ou fraco como baixa confiança automática, independentemente do que o próprio modelo de linguagem afirma.
  • Inclua um caminho explícito de “não sei” ou encaminhamento que o modelo possa escolher sem penalização, pois modelos treinados para sempre produzir uma resposta gerarão uma mesmo quando não deveriam.
  • Armazene a procedência junto com a resposta para que um revisor possa verificar se a fonte dá suporte à afirmação.

Dica profissional: Se uma resposta deveria vir de uma base de conhecimento aprovada e a recuperação não encontrar nada relevante, encaminhe para esclarecimento ou fallback em vez de pedir ao modelo que improvise.

O que monitorar depois de alterar um limite?

Alterar um limite não é uma edição única que você faz e esquece. É o início de uma janela de monitoramento na qual você observa os sinais específicos que mostram se a mudança ajudou ou piorou as coisas silenciosamente.

  • Taxa de automação: a porcentagem de conversas resolvidas sem envolvimento humano.
  • Taxa de respostas erradas: rotulada manualmente a partir de uma amostra de transcrições, não informada pelo próprio bot.
  • Taxa de fallback: com que frequência o bot escala ou encaminha uma conversa, acompanhada ao longo do tempo e por intenção.
  • Correções por 100 conversas: com que frequência os usuários reformulam, corrigem ou rejeitam explicitamente uma resposta.
  • Latência do encaminhamento: quanto tempo uma conversa encaminhada leva para receber uma resposta humana.
  • Satisfação do usuário ou CSAT: idealmente segmentada por faixa, para que você possa ver se as confirmações da faixa intermediária estão realmente funcionando bem.

Crie um painel que apresente a distribuição das pontuações de confiança ao longo do tempo junto às taxas de resultados por faixa e mantenha uma amostra permanente de respostas erradas sinalizadas para revisão manual semanal. A correlação mais importante a observar: se a taxa de automação está aumentando enquanto a taxa de respostas erradas também aumenta, seu limite acabou de se mover na direção errada, mesmo que o número geral de automação pareça uma vitória. A avaliação do desempenho do chatbot só funciona quando você acompanha os dois números lado a lado, nunca um isoladamente.

Manuais de políticas copiáveis para encaminhamento baseado em limites

Veja uma estrutura de política que você pode adaptar diretamente, junto com as verificações de telemetria que devem ser executadas automaticamente após qualquer implementação.

Uma forma mínima de pseudocódigo para a lógica de encaminhamento:

if confidence >= HIGH_CUTOFF:
    auto_answer(intent)
elif confidence >= MEDIUM_CUTOFF:
    present_confirmation(top_2_intents)
else:
    escalate_to_human()

Na etapa de confirmação, mantenha o texto conciso: “Parece que você está perguntando sobre [X] ou [Y]. Qual deles?” Duas opções selecionáveis podem transformar uma correspondência ambígua em um esclarecimento com um toque. Mantenha um caminho de texto aberto quando as opções não forem adequadas.

Antes de implementar uma alteração de limite para todo o tráfego, valide-a offline e depois use um teste controlado, se a plataforma oferecer suporte. Defina antecipadamente os critérios de reversão para a taxa de respostas erradas, a taxa de fallback e o feedback dos usuários. Um fluxo de encaminhamento para uma pessoa da faixa baixa deve preservar a conversa e deixar claro o próximo passo.

O que verificar com sua plataforma de chatbot?

Antes de ativar um limite em produção em qualquer plataforma de fornecedor, confirme se a plataforma realmente oferece os controles dos quais toda esta abordagem depende.

  • Você consegue ler as pontuações brutas de confiança por interação, e não apenas um resultado binário de “correspondeu/não correspondeu”?
  • Você pode definir limites por intenção ou por habilidade, em vez de usar um único número global para todo o bot?
  • Nas configurações de RAG, você pode acessar a pontuação de similaridade da recuperação separadamente da saída da etapa de geração?
  • A plataforma oferece uma configuração de “margem de vitória da confiança”, para que intenções com pontuações próximas sejam apresentadas como opções em vez de uma delas ser escolhida silenciosamente?
  • Você pode exportar transcrições completas para rotulagem e análise offline sem remover os metadados de confiança?
  • Existe um modo de teste que permita executar um limite candidato contra tráfego histórico antes de afetar usuários reais?

A própria documentação da Oracle sobre o ajuste da resolução de intenções é uma referência útil para entender como essas configurações aparecem em uma plataforma madura: tanto o limite de confiança quanto a margem de vitória da confiança aparecem explicitamente como controles nomeados e ajustáveis. Se um fornecedor não conseguir responder claramente a essas perguntas durante a contratação, considere isso um sinal de alerta, não uma pequena lacuna. Você não pode calibrar aquilo que não consegue ver, e uma plataforma que oculta suas pontuações está pedindo que você confie nela às cegas.

Como a Deskhero lida com respostas incertas do chatbot

A Deskhero não expõe pontuações brutas de confiança do chatbot nem faixas de confiança ajustáveis pelo cliente. Em vez disso, seu chat-bot de IA responde com base na FAQ pública aprovada do workspace e revela o formulário de contato quando não consegue responder com confiança. Sugestões de FAQ podem ser criadas a partir de tickets resolvidos e do conteúdo extraído de sites, mas um User precisa aprová-las antes que o chatbot possa utilizá-las.

  • As respostas do chatbot voltadas aos clientes usam apenas conteúdo público de FAQ aprovado pelo User.
  • Quando o chatbot não consegue responder com confiança, ele revela um formulário para que o visitante possa entrar em contato com a equipe.
  • Cada sessão de chat se torna um ticket com sua transcrição, e as ações automáticas são identificadas e registradas.
  • O chatbot é ativado por widget e exige pelo menos 100 itens públicos de FAQ aprovados.

Dica profissional: Antes de ativar amplamente um chatbot de suporte, teste perguntas comuns e casos extremos conhecidos em relação à FAQ aprovada. Revise tanto os tickets de chat respondidos quanto os encaminhados para encontrar entradas de FAQ ausentes, ambíguas ou desatualizadas.

O que este guia acerta e a maioria das recomendações não

A maioria das recomendações online sobre limites de confiança trata o próprio número como se fosse o produto: encontre o limite mágico, defina-o e siga em frente. Essa perspectiva está invertida. O limite depende de duas coisas que realmente importam mais: a qualidade da sua fundamentação e o rigor da sua rotulagem; nenhum limite corrige uma versão deficiente de qualquer uma delas.

A distinção é mais importante para chatbots generativos e RAG. A pontuação de um classificador, a pontuação de similaridade da recuperação e a certeza declarada por um LLM não são intercambiáveis. Elas vêm de mecanismos diferentes e podem ter relações muito distintas com a correção.

Fundamentação e calibração de limites resolvem problemas diferentes. Material de fonte relevante pode reduzir respostas sem suporte, mas não garante que o modelo interpretará a fonte corretamente. Uma política de encaminhamento calibrada pode reduzir a automação arriscada, mas não consegue corrigir um conhecimento desatualizado ou incompleto. Valide tanto o pipeline de conhecimento quanto os limites de ação e, depois, concentre a revisão nos intervalos de pontuação em que os erros e encaminhamentos se concentram.

Coloque o chatbot de IA fundamentado da Deskhero para trabalhar na sua equipe de suporte

Um pipeline personalizado de encaminhamento baseado em confiança precisa de pontuações do modelo ou da recuperação, registro de transcrições, dados de avaliação e um fluxo de encaminhamento para uma pessoa. A Deskhero adota uma abordagem gerenciada para seu chat-bot de IA: responder com base na FAQ pública aprovada e revelar o formulário de contato quando não consegue responder com confiança.

Deskhero

A Deskhero conecta caixas de entrada do Gmail, Google Workspace e Microsoft 365 a uma central de atendimento compartilhada, enquanto as respostas continuam usando o endereço da sua empresa. As perguntas recebidas por e-mail, formulário incorporado ou chat-bot de IA tornam-se tickets. A Deskhero pode sugerir entradas públicas de FAQ a partir de tickets resolvidos e páginas extraídas. Depois que um User aprova uma entrada, tanto o chatbot quanto as respostas automáticas de IA podem utilizá-la. Para equipes de comércio eletrônico, o painel de clientes do Shopify exibe o contexto do cliente e do pedido ao lado do ticket.

Comece o teste gratuito de 30 dias, sem necessidade de cartão de crédito, e execute seu próprio conjunto de testes com 30 a 100 perguntas antes de decidir quanto do seu volume de suporte automatizar.

Fontes

Perguntas frequentes

Qual é uma boa pontuação de confiança para um chatbot?

Não existe um número universal. Uma política de três faixas pode usar 0.85 e 0.5 como limites ilustrativos, mas esses valores não são recomendações gerais. A Oracle documenta 0.7 como ponto de partida para seu próprio modelo de intenções. Calibre qualquer limite com base em conversas rotuladas do modelo e da plataforma que você realmente utiliza.

Como uma pontuação de confiança é calculada?

Para um classificador de intenções, a pontuação é específica do modelo e geralmente indica o quanto o modelo favorece uma intenção. Ela deve ser tratada como uma probabilidade apenas se a plataforma a definir dessa forma e os dados de calibração derem suporte a essa interpretação. Os sistemas RAG também podem expor sinais de similaridade da recuperação, fundamentação ou validação da resposta, e cada um deles precisa de uma avaliação separada.

O que é a pontuação de confiança em um chatbot baseado em LLM?

Não se deve presumir que a confiança declarada pelo próprio LLM preveja a correção. Para um chatbot RAG, avalie a qualidade da recuperação e se a resposta é sustentada pelo material recuperado. Use esses sinais testados, em vez de depender apenas da formulação fluente ou da certeza declarada, ao decidir se deve responder ou usar fallback.

O que você nunca deve informar a um chatbot?

Evite compartilhar dados pessoais confidenciais, senhas, números de contas financeiras ou informações comerciais sigilosas com qualquer chatbot, a menos que você tenha verificado as políticas específicas da plataforma quanto ao tratamento e à retenção de dados. Isso é ainda mais importante para bots de suporte que registram conversas para treinamento ou revisão de qualidade.

Como verificar se a resposta de um chatbot está correta?

Use uma amostra representativa de conversas reais, rotule se cada resposta tem suporte e está correta e compare esses resultados com as pontuações e ações de encaminhamento disponíveis no sistema. A Deskhero limita o material de fonte do chatbot ao conteúdo público de FAQ aprovado pelo User, mas as equipes ainda devem revisar as respostas e os encaminhamentos em busca de conhecimento ausente ou desatualizado.