← Back to articles

Umbrales de confianza para chatbots que reducen errores

Umbrales de confianza para chatbots que reducen errores

Usa umbrales de confianza para dirigir de forma segura los turnos inciertos del chatbot. Un diseño práctico tiene tres bandas: responder con alta confianza, confirmar o aclarar en la banda intermedia y recurrir a una persona con baja confianza. Los límites numéricos deben calibrarse para tu modelo y tráfico. Valores como 0.85 y 0.5 pueden ilustrar la política, pero no son valores predeterminados universales.

La documentación de Oracle sobre la resolución de intenciones utiliza 0.70 como punto de partida para su propio modelo de intenciones y recomienda probar valores más altos cuando los resultados lo respalden. Ese consejo es específico de la plataforma. Un umbral que funciona para un modelo, dominio o definición de puntuación puede ser incorrecto para otro.

Antes de cambiar un umbral, crea un conjunto de evaluación representativo a partir de conversaciones recientes. Etiqueta si cada intención o respuesta predicha fue correcta y, después, compara esos resultados con las puntuaciones y acciones registradas por el sistema. Esto te proporciona evidencia para elegir un límite en lugar de depender únicamente del valor predeterminado del proveedor.

  • Banda alta (ilustrativa: 0.85 o más): el bot responde automáticamente, sin paso de confirmación.
  • Banda media (ilustrativa: de 0.5 a 0.85): el bot confirma o aclara antes de actuar.
  • Banda baja (ilustrativa: por debajo de 0.5): el bot transfiere la conversación a una persona o activa una intención de respaldo.

Consejo profesional: Empieza con suficientes conversaciones recientes para cubrir las intenciones comunes, las expresiones ambiguas y los casos de fallo conocidos. Un conjunto más pequeño y etiquetado cuidadosamente es más útil que una muestra grande con etiquetas poco fiables.

Conclusiones clave

Una política de tres bandas puede reducir las respuestas incorrectas silenciosas al ofrecer una vía de confirmación para los turnos ambiguos. Su efecto sobre la automatización y la precisión debe medirse con tus propias conversaciones etiquetadas.

Punto Detalles
Empieza con tres bandas Define acciones altas, medias y bajas. Trata 0.85 y 0.5 como ejemplos y, después, calibra los límites reales.
Calibra con datos reales Etiqueta un conjunto representativo para determinar su corrección y, después, analiza el rendimiento por banda de puntuación antes de confiar en cualquier umbral.
Desconfía de la autoconfianza de los LLM En los sistemas RAG, evalúa las señales de recuperación y fundamentación en lugar de depender de la certeza declarada por el modelo.
Supervisa tanto la automatización como los errores Observa conjuntamente la tasa de automatización y la tasa de respuestas incorrectas; que una aumente por sí sola es una señal de alerta.
Usa conocimiento fundamentado y aprobado El chat-bot de IA de Deskhero responde únicamente a partir del contenido público de preguntas frecuentes aprobado por el Usuario y transfiere la conversación cuando no puede responder con confianza.

Índice

¿Qué es exactamente un umbral de confianza de un chatbot?

Una puntuación de confianza es el número que tu clasificador de intenciones o sistema de recuperación asigna a su mejor hipótesis, normalmente entre 0 y 1. Un umbral de confianza es la línea que trazas dentro de ese rango para decidir qué hará el bot a continuación. La puntuación ordena tus opciones; el umbral es la decisión de política que aplicas sobre ella.

El significado de una puntuación de confianza depende del sistema. Algunos clasificadores generan puntuaciones que pueden calibrarse comparándolas con la corrección observada. Otras plataformas solo exponen señales de clasificación o similitud. No supongas que una puntuación de 0.92 significa un 92 % de probabilidad de que la respuesta sea correcta, a menos que el proveedor documente esa interpretación y tus datos de evaluación la confirmen.

La generación aumentada por recuperación (RAG) añade otra capa. La respuesta generada puede sonar segura incluso cuando el material recuperado está desactualizado o es irrelevante. La similitud de recuperación, la calidad de la fuente, el respaldo de la respuesta y el comportamiento del modelo son señales independientes. Prueba cada una frente a resultados etiquetados antes de combinarlas en una política de enrutamiento.

Consejo profesional: No uses la certeza declarada por un LLM como única señal de enrutamiento. Exige material fuente relevante y comprueba si las verificaciones de recuperación o fundamentación predicen realmente la corrección en tus datos.

Por qué tres bandas de confianza superan a un único límite

Un único umbral obliga a elegir entre dos opciones: responder o no responder. Una banda intermedia añade una tercera opción: hacer una pregunta breve para aclarar. Esto puede reducir los fallos silenciosos sin enviar directamente a una persona cada turno incierto.

Banda Rango habitual Comportamiento del bot Ejemplo de UX
Alta Ilustrativo: 0.85 o más Respuesta automática, sin fricción El bot responde directamente: “Tu pedido se envía el jueves”.
Media Ilustrativo: de 0.5 a 0.85 Confirmar o aclarar “¿Te refieres a consultar el seguimiento de tu pedido o a cancelarlo?”.
Baja Ilustrativo: por debajo de 0.5 Respaldo o transferencia “Permíteme ponerte en contacto con alguien de nuestro equipo”.

Diagrama de las bandas de confianza y los comportamientos de un chatbot

Estos rangos son ejemplos que hacen concreta la lógica de enrutamiento. Sustitúyelos por valores derivados de tu propia plataforma, definición de puntuación y coste de una respuesta incorrecta.

La lógica es sencilla cuando la ves en la práctica. Un único límite situado, por ejemplo, en 0.70 significa que cada puntuación justo por encima de esa línea recibe una respuesta automática con plena confianza, aunque una puntuación de 0.71 apenas se diferencie de una de 0.69. La banda intermedia te proporciona una zona de amortiguación en la que el bot reconoce cierta incertidumbre en lugar de fingir que no existe.

  • Mantén breves los flujos de confirmación. Las opciones que se pueden tocar suelen reducir la ambigüedad mejor que otra pregunta abierta.
  • El texto de respaldo debe reconocer el fallo sin parecer defectuoso: “No estoy seguro de haber entendido eso; permíteme ponerte en contacto con una persona”.
  • Mide si las confirmaciones de la banda media resuelven la ambigüedad o simplemente añaden fricción.

Esta es la compensación que las partes interesadas deben escuchar con claridad: reducir el umbral aumenta la tasa de automatización, pero cada respuesta incorrecta que supera el límite reducido se vuelve invisible. Nadie la señala porque el bot parecía seguro. Aumentar el umbral produce lo contrario: hace visibles los fallos como transferencias, lo que operativamente parece peor, pero en realidad es más seguro, porque un fallo visible se registra y se corrige, mientras que uno invisible simplemente erosiona la confianza en silencio.

¿Cómo calibras los umbrales de confianza de tu bot?

Los valores predeterminados del proveedor y las bandas del sector son puntos de partida. Tus límites reales deben proceder de tus propias transcripciones, porque los niveles de precisión de los chatbots varían enormemente según el dominio, la complejidad de las intenciones y lo desordenada que sea la forma de expresarse de tus usuarios.

  1. Crea un conjunto de pruebas representativo. Usa preguntas reales que abarquen intenciones comunes, expresiones ambiguas y casos de fallo costosos. El tamaño de muestra necesario depende del tráfico y de la precisión que necesites.
  2. Etiqueta la verdad fundamental. Para cada transcripción, indica si la respuesta proporcionada fue realmente correcta, no solo si el bot sonó seguro.
  3. Relaciona los resultados con las puntuaciones. Representa la puntuación de confianza frente a la corrección para cada turno etiquetado. Busca dónde empiezan a agruparse las respuestas incorrectas.
  4. Calcula la precisión y la exhaustividad por banda. Para cada banda propuesta, calcula qué porcentaje de las respuestas fue realmente correcto (precisión) y qué porcentaje de las respuestas correctas pasó sin una transferencia innecesaria (exhaustividad).
  5. Crea un diagrama de fiabilidad. Agrupa las predicciones por puntuación de confianza y representa la confianza predicha frente a la precisión observada. Un bot bien calibrado produce una línea cercana a la diagonal; uno mal calibrado se aleja de ella.
  6. Calcula el Error de calibración esperado (ECE) cuando sea posible. Este único número cuantifica la diferencia entre la confianza declarada y la precisión real en todos tus grupos.
  7. Realiza una prueba A/B antes de implementar los cambios ampliamente. Divide el tráfico por segmento o intervalo temporal y compara la tasa de automatización, la tasa de respuestas incorrectas y la tasa de transferencias entre los umbrales antiguos y los nuevos.

Piensa en ello como una cadena: la distribución de puntuaciones alimenta los límites de las bandas, los límites determinan los resultados de las acciones y los resultados se miden frente a la verdad fundamental para comprobar si los límites eran correctos desde el principio.

Métrica Qué te indica Herramienta/Método
Precisión por banda Proporción de turnos respondidos automáticamente que fueron realmente correctos Etiquetado manual de transcripciones
Exhaustividad por banda Proporción de respuestas correctas que evitaron una transferencia innecesaria Etiquetado manual de transcripciones
Diagrama de fiabilidad Si la confianza declarada coincide con la precisión observada Gráfico de precisión agrupada
Error de calibración esperado Puntuación única que resume la diferencia de calibración Análisis de calibración

Un estudio de 2025 sobre un chatbot de soporte técnico basado en RAG informó de que su estrategia de indicaciones “Combo” redujo el Error de calibración esperado de 23.33 a 8.4, mientras la precisión aumentó del 69.33 % al 81.33 %, dentro de la configuración experimental de ese estudio. El resultado no es una referencia universal, pero demuestra que el diseño de las indicaciones y del sistema puede afectar a la calibración tanto como el propio umbral.

¿Cómo calibras los umbrales de confianza de tu bot? , diagrama general

¿Qué ocurre cuando los umbrales se configuran mal?

Dos modos de fallo se encuentran en extremos opuestos del mismo dial, y ambos son lo bastante comunes como para que debas conocer perfectamente sus síntomas.

  • Umbral demasiado bajo: el bot responde automáticamente ante coincidencias débiles. Algunas respuestas incorrectas pueden no notificarse porque el flujo nunca señala incertidumbre.
  • Umbral demasiado alto: el bot deriva preguntas que podría responder correctamente, lo que añade demora y reduce la tasa de automatización útil.
  • Aumento de los eventos de corrección: si los usuarios reformulan, corrigen o dicen explícitamente cada vez más “eso no es lo que pregunté”, es una señal clara de que tu banda media es demasiado estrecha o de que el límite de tu banda alta es demasiado agresivo.
  • Desajuste entre la tasa de transferencias y el volumen de tickets de soporte: si las transferencias disminuyen, pero tu cola de soporte sigue creciendo, es posible que el bot esté respondiendo automáticamente de forma incorrecta en lugar de escalar.
  • Concentración de señales de comentarios cerca del límite: si las señales de pulgares abajo o “no es útil” se concentran justo alrededor del límite de tu umbral, probablemente ese límite esté mal situado.

La solución puede ser un límite diferente, una banda media más amplia, mejores datos de entrenamiento o verificaciones más sólidas de recuperación y fundamentación. En los bots respaldados por RAG, comprueba que el material recuperado respalde la respuesta en lugar de tratar una respuesta fluida como evidencia. Evalúa primero sin conexión el umbral propuesto utilizando conversaciones etiquetadas. Si después realizas una prueba en línea, define los criterios de seguridad y reversión antes de exponer un mayor volumen de tráfico.

¿Cómo deben gestionar la confianza de forma diferente los chatbots RAG y LLM?

Los modelos generativos complican el enrutamiento basado en la confianza porque una prosa fluida y categórica no demuestra que una respuesta esté fundamentada. Por ello, una política útil separa señales como la calidad de recuperación, el respaldo de las citas, la coherencia de la respuesta y cualquier puntuación del clasificador. Cada señal debe validarse frente a la corrección real.

En una evaluación médica multidisciplinar, 33 médicos de 17 especialidades calificaron respuestas a 284 preguntas. La respuesta mediana recibió una calificación alta, pero 36 respuestas iniciales obtuvieron una de las dos puntuaciones de precisión más bajas en una escala de seis puntos. Esta combinación de un rendimiento medio sólido y fallos importantes respalda una validación cuidadosa en dominios de alto coste. En un caso independiente de consumo, un tribunal consideró responsable a una aerolínea por la información incorrecta sobre reembolsos proporcionada por su chatbot.

Patrones prácticos que funcionan en producción:

  • Exige un pasaje fuente relevante para las respuestas fácticas en los flujos de trabajo donde la base de conocimientos sea la autoridad.
  • Trata un resultado de recuperación vacío o débil como baja confianza automática, independientemente de lo que afirme el propio modelo de lenguaje.
  • Incorpora una ruta explícita de “No lo sé” o de escalamiento que el modelo pueda elegir sin penalización, ya que los modelos entrenados para producir siempre una respuesta lo harán incluso cuando no deban.
  • Guarda la procedencia junto con la respuesta para que un revisor pueda comprobar si la fuente respalda la afirmación.

Consejo profesional: Si se supone que una respuesta debe proceder de una base de conocimientos aprobada y la recuperación no devuelve nada relevante, dirige la conversación a una aclaración o al respaldo en lugar de pedir al modelo que improvise.

¿Qué debes supervisar después de cambiar un umbral?

Un cambio de umbral no es una modificación puntual que haces y olvidas. Es el comienzo de un periodo de supervisión en el que observas las señales específicas que te indican si el cambio ayudó o empeoró las cosas silenciosamente.

  • Tasa de automatización: porcentaje de conversaciones resueltas sin intervención humana.
  • Tasa de respuestas incorrectas: etiquetada manualmente a partir de una muestra de transcripciones, no declarada por el propio bot.
  • Tasa de transferencias: frecuencia con la que el bot escala o transfiere la conversación, seguida a lo largo del tiempo y por intención.
  • Correcciones por cada 100 conversaciones: frecuencia con la que los usuarios reformulan, corrigen o rechazan explícitamente una respuesta.
  • Latencia de escalamiento: tiempo que tarda una conversación transferida en recibir una respuesta humana.
  • Satisfacción del usuario o CSAT: idealmente segmentada por banda, para que puedas comprobar si las confirmaciones de la banda media realmente funcionan bien.

Crea un panel que muestre a lo largo del tiempo la distribución de las puntuaciones de confianza junto con las tasas de resultados por banda, y mantén una muestra fija de respuestas incorrectas señaladas para revisarlas manualmente cada semana. La correlación más importante que debes observar es la siguiente: si la tasa de automatización aumenta mientras también lo hace la tasa de respuestas incorrectas, tu umbral acaba de moverse en la dirección equivocada, aunque la cifra general de automatización parezca un éxito. La evaluación del rendimiento de un chatbot solo funciona cuando sigues ambas cifras una al lado de la otra, nunca una de forma aislada.

Guías de políticas copiables para el enrutamiento basado en umbrales

Aquí tienes una estructura de política que puedes adaptar directamente, junto con las comprobaciones de telemetría que deberían ejecutarse automáticamente después de cualquier implementación.

Una estructura mínima de pseudocódigo para la lógica de enrutamiento:

if confidence >= HIGH_CUTOFF:
    auto_answer(intent)
elif confidence >= MEDIUM_CUTOFF:
    present_confirmation(top_2_intents)
else:
    escalate_to_human()

Para el paso de confirmación, mantén el texto conciso: “Parece que preguntas por [X] o [Y]. ¿Cuál de las dos opciones?”. Dos opciones que se puedan tocar pueden convertir una coincidencia ambigua en una aclaración con un solo toque. Mantén disponible una vía de texto abierto cuando ninguna de las opciones encaje.

Antes de aplicar un cambio de umbral a todo el tráfico, valídalo sin conexión y, después, utiliza una prueba controlada si la plataforma la admite. Define por adelantado los criterios de reversión para la tasa de respuestas incorrectas, la tasa de transferencias y los comentarios de los usuarios. Un flujo de transferencia a una persona para la banda baja debe conservar la conversación y dejar claro el siguiente paso.

¿Qué debes verificar con tu plataforma de chatbot?

Antes de activar un umbral en producción en cualquier plataforma de proveedor, confirma que la plataforma realmente te ofrece los controles de los que depende todo este enfoque.

  • ¿Puedes leer las puntuaciones de confianza sin procesar de cada turno y no solo obtener un resultado binario de “coincide/no coincide”?
  • ¿Puedes establecer umbrales por intención o por habilidad, en lugar de utilizar un único número global para todo el bot?
  • En las configuraciones RAG, ¿puedes acceder a la puntuación de similitud de recuperación por separado del resultado del paso de generación?
  • ¿Admite la plataforma una configuración de “margen de victoria de confianza”, para que las intenciones con puntuaciones cercanas se presenten como opciones en lugar de seleccionar una silenciosamente?
  • ¿Puedes exportar transcripciones completas para etiquetarlas y analizarlas sin conexión, sin eliminar los metadatos de confianza?
  • ¿Existe un modo de prueba que te permita ejecutar un umbral candidato contra tráfico histórico antes de que afecte a usuarios reales?

La propia documentación de Oracle sobre el ajuste de la resolución de intenciones es una referencia útil para ver el aspecto de estas configuraciones en una plataforma madura: tanto el umbral de confianza como el margen de victoria de confianza aparecen explícitamente como controles con nombre y ajustables. Si un proveedor no puede responder claramente a estas preguntas durante la contratación, considéralo una señal de advertencia, no una carencia menor. No puedes calibrar lo que no puedes ver, y una plataforma que oculta sus puntuaciones te está pidiendo que confíes en ella ciegamente.

Cómo gestiona Deskhero las respuestas inciertas del chatbot

Deskhero no expone las puntuaciones de confianza sin procesar del chatbot ni bandas de confianza ajustables por el cliente. En su lugar, su chat-bot de IA responde a partir de las preguntas frecuentes públicas aprobadas del espacio de trabajo y muestra el formulario de contacto cuando no puede responder con confianza. Las sugerencias de preguntas frecuentes pueden crearse a partir de tickets resueltos y contenido extraído de sitios web, pero un Usuario debe aprobarlas antes de que el chatbot pueda utilizarlas.

  • Las respuestas del chatbot dirigidas a los clientes utilizan únicamente contenido público de preguntas frecuentes aprobado por el Usuario.
  • Cuando el chatbot no puede responder con confianza, muestra un formulario para que el visitante pueda ponerse en contacto con el equipo.
  • Cada sesión de chat se convierte en un ticket con su transcripción, y las acciones automáticas se etiquetan y registran.
  • El chatbot se activa por widget y requiere al menos 100 elementos públicos de preguntas frecuentes aprobados.

Consejo profesional: Antes de activar ampliamente un chatbot de soporte, prueba preguntas habituales y casos límite conocidos con las preguntas frecuentes aprobadas. Revisa tanto los tickets de chat respondidos como los transferidos para detectar entradas de preguntas frecuentes ausentes, ambiguas o desactualizadas.

Lo que esta guía acierta y la mayoría de los consejos no

La mayoría de los consejos sobre umbrales de confianza que aparecen en internet trata el número como si fuera el producto: encuentra el límite mágico, configúralo y sigue adelante. Ese planteamiento está al revés. El umbral depende de dos factores que en realidad importan más: la calidad de tu fundamentación y la disciplina de tu etiquetado, y ningún límite puede solucionar una versión defectuosa de ninguno de los dos.

La distinción es especialmente importante para los chatbots generativos y RAG. La puntuación de un clasificador, la puntuación de similitud de una recuperación y la certeza declarada por un LLM no son intercambiables. Proceden de mecanismos diferentes y pueden tener relaciones muy distintas con la corrección.

La fundamentación y la calibración del umbral resuelven problemas diferentes. El material fuente relevante puede reducir las respuestas no respaldadas, pero no garantiza que el modelo interprete correctamente la fuente. Una política de enrutamiento calibrada puede reducir la automatización arriesgada, pero no puede reparar conocimientos desactualizados o incompletos. Valida tanto el flujo de conocimiento como los umbrales de acción y, después, concentra la revisión en los rangos de puntuación donde se agrupan los errores y las transferencias.

Pon en funcionamiento el chatbot de IA fundamentado de Deskhero para tu equipo de soporte

Un flujo personalizado de enrutamiento basado en la confianza necesita puntuaciones del modelo o de recuperación, registro de transcripciones, datos de evaluación y un flujo de transferencia a una persona. Deskhero adopta un enfoque gestionado para su chat-bot de IA: responde a partir de las preguntas frecuentes públicas aprobadas y muestra el formulario de contacto cuando no puede responder con confianza.

Deskhero

Deskhero conecta buzones de Gmail, Google Workspace y Microsoft 365 con un servicio de asistencia compartido, mientras las respuestas siguen utilizando la dirección de tu empresa. Las preguntas que llegan por correo electrónico, un formulario integrado o el chat-bot de IA se convierten en tickets. Deskhero puede sugerir entradas públicas de preguntas frecuentes a partir de tickets resueltos y páginas extraídas. Una vez que un Usuario aprueba una entrada, tanto el chatbot como las respuestas automáticas de IA pueden utilizarla. Para los equipos de comercio electrónico, el panel de clientes de Shopify muestra el contexto del cliente y del pedido junto al ticket.

Comienza la prueba gratuita de 30 días, sin necesidad de tarjeta de crédito, y prueba tu propio conjunto de 30 a 100 preguntas antes de decidir qué parte de tu volumen de soporte automatizar.

Fuentes

Preguntas frecuentes

¿Cuál es una buena puntuación de confianza para un chatbot?

No existe un número universal. Una política de tres bandas podría utilizar 0.85 y 0.5 como límites ilustrativos, pero esos valores no son recomendaciones generales. Oracle documenta 0.7 como punto de partida para su propio modelo de intenciones. Calibra cualquier límite con conversaciones etiquetadas del modelo y la plataforma que realmente utilices.

¿Cómo se calcula una puntuación de confianza?

En un clasificador de intenciones, la puntuación es específica del modelo y normalmente indica con qué intensidad el modelo favorece una intención. Solo debe tratarse como una probabilidad si la plataforma la define de ese modo y los datos de calibración respaldan esa interpretación. Los sistemas RAG también pueden exponer señales de similitud de recuperación, fundamentación o validación de respuestas, y cada una necesita una evaluación independiente.

¿Qué es la puntuación de confianza en un chatbot basado en LLM?

No debe suponerse que la confianza declarada por un LLM predice la corrección. En un chatbot RAG, evalúa la calidad de la recuperación y si la respuesta está respaldada por el material recuperado. Utiliza esas señales probadas, en lugar de depender únicamente de una redacción fluida o de la certeza declarada, al decidir si responder o recurrir al respaldo.

¿Qué no debes decirle nunca a un chatbot?

Evita compartir datos personales sensibles, contraseñas, números de cuentas financieras o información empresarial confidencial con cualquier chatbot, a menos que hayas verificado las políticas específicas de gestión y conservación de datos de la plataforma. Esto es aún más importante en los bots de soporte que registran conversaciones para entrenamiento o revisión de calidad.

¿Cómo verificas que la respuesta de un chatbot es correcta?

Utiliza una muestra representativa de conversaciones reales, etiqueta si cada respuesta está respaldada y es correcta y compara esos resultados con las puntuaciones y acciones de enrutamiento disponibles del sistema. Deskhero limita el material fuente del chatbot al contenido público de preguntas frecuentes aprobado por el Usuario, pero los equipos deben seguir revisando las respuestas y las transferencias para detectar conocimientos ausentes o desactualizados.