← Back to articles

IA con supervisión humana: cómo funciona y cuándo usarla

IA con supervisión humana: cómo funciona y cuándo usarla

La IA con intervención humana (HITL) es un patrón de diseño en el que el criterio humano se integra directamente en el ciclo de decisión o ejecución de un sistema de IA, ya sea para etiquetar datos de entrenamiento, revisar resultados del modelo o aprobar acciones de los agentes antes de que surtan efecto. La versión resumida: utilízala siempre que una IA pueda provocar efectos en el mundo real, cuando los errores sean costosos de revertir o cuando la responsabilidad normativa exija que una persona identificada asuma la decisión.

Este artículo aborda el panorama completo, desde cómo se construye técnicamente el ciclo hasta cómo diseñar uno que funcione de forma sólida en producción.


Índice

¿Cómo funciona realmente la IA con intervención humana?

El “ciclo” no es una metáfora. Es una secuencia concreta de puntos de control en la que la intervención humana entra en el sistema, y el sistema espera a recibirla o la incorpora de forma asíncrona.

Equipo revisando puntos de control humanos en un sistema de IA

Hay dos etapas diferenciadas en las que participan las personas:

La HITL en la etapa de entrenamiento implica que las personas etiqueten datos sin procesar, evalúen la calidad de los resultados del modelo y proporcionen señales de preferencia. El aprendizaje por refuerzo a partir de comentarios humanos (RLHF), la técnica en la que se basa la mayor parte del trabajo de alineación de los grandes modelos de lenguaje, es el ejemplo canónico. Los anotadores clasifican las respuestas del modelo; esas clasificaciones se convierten en una señal de recompensa; y el modelo se ajusta tomando esa señal como referencia. El aprendizaje activo es un patrón relacionado: el modelo señala los ejemplos sobre los que tiene menos confianza y los etiquetadores humanos priorizan esos casos, haciendo que los presupuestos de anotación rindan más.

La HITL en tiempo de ejecución es donde reside actualmente la mayor parte del valor en producción. A medida que los agentes pasan de las demostraciones a la producción, las aprobaciones antes de acciones con efectos secundarios, como enviar correos electrónicos o escribir en una base de datos, se convierten en un requisito básico para la adopción empresarial. El mecanismo funciona así:

“El middleware HITL puede pausar las llamadas de herramientas de un agente y mostrar una interrupción que enumera las acciones que necesitan revisión; el sistema conserva el estado del agente para que la ejecución pueda reanudarse de forma segura después de las decisiones humanas. Tipos de decisión compatibles habitualmente: aprobar, editar, rechazar y responder; las interrupciones condicionales permiten establecer controles basados en los argumentos de las herramientas”. — Documentación de HITL de LangChain

Un flujo práctico tiene este aspecto:

  • Anotar datos sin procesar o resultados del modelo con etiquetas humanas
  • Volver a entrenar o ajustar el modelo con ejemplos corregidos
  • Implementar el modelo o agente actualizado en producción
  • Interrumpir las llamadas de herramientas de alto riesgo y derivarlas a un revisor humano
  • Decidir (aprobar / editar / rechazar / responder) y reanudar la ejecución
  • Capturar la decisión como comentarios estructurados y devolverlos al flujo de entrenamiento

La diferencia entre la gestión síncrona y asíncrona es importante aquí. Los controles síncronos (bloqueantes) detienen completamente la ejecución hasta que actúa un revisor. Los patrones asíncronos (no bloqueantes) permiten que el agente continúe con otras tareas mientras la aprobación está pendiente. Los entornos de ejecución de producción deben conservar el estado porque las aprobaciones pueden tardar minutos, horas o incluso días; por eso el estado en memoria resulta insuficiente para cualquier escenario que vaya más allá de una prueba local.

La configuración del agente puede indicar qué herramientas concretas requieren aprobación y establecer predicados para que solo determinados argumentos de llamada activen una interrupción. Este nivel de precisión mantiene las colas de revisión bajo control y evita la fatiga causada por las alertas.

Infografía que muestra los pasos del proceso de IA con intervención humana


Por qué importa la HITL: precisión, seguridad y confianza

El argumento empresarial a favor de la supervisión humana en la IA no es abstracto. En las implementaciones de producción aparecen de forma constante tres beneficios concretos.

Precisión en casos extremos. Los modelos entrenados con datos históricos pierden rendimiento cuando cambia el mundo o cuando las entradas quedan fuera de la distribución de entrenamiento. Un revisor humano detecta la anomalía; la corrección, si se captura correctamente, se convierte en datos de entrenamiento que mejoran la siguiente versión del modelo. El ciclo es lo que hace que el sistema se autocorrija en lugar de equivocarse silenciosamente.

Acciones más seguras. Un agente de IA que puede enviar correos electrónicos, actualizar registros o procesar reembolsos puede causar daños reales si actúa sobre una entrada mal clasificada. Los controles de aprobación antes de las llamadas de herramientas con efectos secundarios son la mitigación directa. La HITL resulta más eficaz cuando la revisión humana se reserva para decisiones de alto impacto, en lugar de aplicarse a cada resultado; por eso el enfoque estándar en las implementaciones maduras es el enrutamiento basado en riesgos, mediante umbrales de confianza y puntuaciones de riesgo.

Registros de auditoría y explicabilidad. Cada decisión humana en un sistema HITL bien instrumentado es un registro con fecha y hora: quién la revisó, qué decidió y qué hizo después el agente. Ese registro es lo que necesitan los reguladores, los equipos de cumplimiento y quienes revisan incidentes posteriores. Sin él, tienes una caja negra en la que una persona valida mecánicamente los resultados, y eso no es lo mismo.

También existe un beneficio acumulativo que suele infravalorarse. Los comentarios humanos adquieren el máximo valor cuando se tratan como datos operativos: se capturan, se gobiernan y se devuelven a los flujos de reentrenamiento o ajuste, en lugar de almacenarse en colas desconectadas. Los equipos que instrumentan las correcciones de los revisores observan que el rendimiento del modelo mejora con el tiempo de maneras que no consiguen los equipos que dependen de conjuntos de entrenamiento estáticos.


Dónde se aplica la HITL: ejemplos del mundo real

El patrón aparece en distintos sectores, pero el papel de la persona cambia significativamente según el ámbito.

Radiólogo revisando imágenes médicas señaladas por la IA

Imágenes médicas. Los radiólogos revisan las anomalías señaladas por la IA antes de que un hallazgo entre en el historial del paciente. La IA acota el campo; el profesional clínico toma la decisión. Ninguno de los dos es tan fiable por separado como la combinación, y los marcos normativos de Estados Unidos, incluidas las directrices de la FDA sobre dispositivos médicos basados en IA, exigen una supervisión humana documentada para muchas aplicaciones de diagnóstico.

Moderación de contenidos. Las plataformas utilizan clasificadores para señalar contenido potencialmente infractor y después derivan los casos dudosos a revisores humanos. El clasificador gestiona el volumen; las personas se encargan de los matices, el contexto y las apelaciones. El desafío aquí es que las decisiones de los revisores son también datos de entrenamiento, por lo que una moderación incoherente genera modelos incoherentes.

Agentes de atención al cliente. Aquí es donde la colaboración entre la IA y las personas en los flujos de soporte se vuelve interesante. Un agente que puede redactar una respuesta resulta útil. Un agente que además puede enviarla, actualizar un pedido o emitir un reembolso es potente, pero arriesgado. Los controles de aprobación antes de esas acciones de escritura son la diferencia entre una herramienta útil y una responsabilidad. La persona revisa la acción propuesta, la aprueba o edita, y el agente la ejecuta.

Investigación de fraude. Los modelos de fraude puntúan las transacciones y señalan las de alto riesgo. Un analista humano revisa los casos señalados, toma la decisión final y devuelve esa decisión al modelo. La experiencia del analista detecta patrones que el modelo aún no ha visto.

Flujos de etiquetado de datos. Este es el caso de uso original de la HITL: etiquetadores colectivos o expertos del sector anotan imágenes, texto o audio para crear conjuntos de entrenamiento supervisado. Servicios como Scale AI y Amazon Mechanical Turk hacen posible operativizar este proceso a escala, aunque el control de calidad de los etiquetadores supone un desafío operativo importante.

Consejo profesional: En atención al cliente, concretamente, el momento de mayor valor para la HITL no es el borrador de la respuesta, sino la aprobación previa a cualquier acción que cambie el estado de una cuenta. Deriva esas acciones siempre a una persona, independientemente de la confianza del modelo.


¿Cómo se diseña un sistema HITL para producción?

Hacer bien la HITL en producción requiere más que añadir un paso de “revisión”. La arquitectura debe tratar la conservación del estado, el enrutamiento de revisores, los tiempos de espera y la captura de comentarios como aspectos fundamentales.

Ejecución duradera y conservación del estado

La ejecución duradera es un requisito de diseño esencial para los agentes interrumpibles. Los sistemas deben conservar los grafos de ejecución y reanudarlos después de recibir la intervención humana, para no perder el contexto cuando las aprobaciones tardan horas o días. Para las pruebas, los guardadores en memoria funcionan bien. En producción, utiliza puntos de control persistentes como AsyncPostgresSaver o MongoDBSaver. Si el sistema falla o se reinicia entre la interrupción y la decisión humana, el estado del agente debe sobrevivir.

Patrones de controles de aprobación

Tipo de control Cuándo utilizarlo Compensación
Aprobación por herramienta Herramientas de alto riesgo (enviar correo, escribir en una base de datos) Control preciso; mayor esfuerzo de configuración
Indicador global Todas las llamadas de herramientas de un agente sensible Fácil de activar; puede saturar a los revisores
Predicado condicional Establecer un control según el valor de un argumento (por ejemplo, un umbral de importe) Muy preciso; requiere lógica de predicados
Cola de interrupciones ordenada Varias aprobaciones pendientes por ejecución Conserva el orden de ejecución; añade latencia

Enrutamiento y escalado

Decide de antemano quién revisa cada cosa. Los expertos del sector cuestan más y tienen menos disponibilidad que los revisores generalistas, así que realiza el enrutamiento en consecuencia. Establece SLA para el tiempo de respuesta humano y define qué ocurre cuando no se cumple el SLA: ¿el agente se pausa indefinidamente, escala el caso a un revisor sénior o adopta una acción predeterminada segura? Los tiempos de espera sin alternativas definidas son una fuente habitual de incidentes en producción.

Registros de auditoría e interfaz del revisor

Diseña la interfaz del revisor para producir decisiones de alta calidad, no solo aprobaciones. Los formularios con opciones restringidas (aprobar / editar / rechazar) generan datos de entrenamiento más limpios que los cuadros de comentarios de texto libre. Registra cada decisión con fecha y hora, el ID del revisor y el estado del agente en el momento de la interrupción. Ese registro es simultáneamente tu rastro de auditoría y tu conjunto de datos de entrenamiento.

Consejo profesional: Trata la interfaz del revisor como un instrumento de recopilación de datos. Cada campo que añadas al formulario de decisión es una característica que puedes utilizar en la siguiente versión del modelo. Diseñala antes de crear el agente, no después.

Para los equipos que crean específicamente flujos de transferencia de chatbot a una persona, se aplican los mismos principios: conserva el estado de la conversación, deriva el caso al nivel adecuado de agente y registra el motivo de la transferencia.


HITL frente a human-on-the-loop y human-over-the-loop

Estos tres términos describen modelos de supervisión realmente distintos, y confundirlos conduce a diseños mal aplicados.

Término Momento Función humana ¿Bloquea la ejecución? Más adecuado para
Human-in-the-loop (HITL) Síncrono Aprueba o edita antes de la acción Acciones de alto riesgo con efectos secundarios
Human-on-the-loop (HOTL) Asíncrono Supervisa y puede intervenir No Resultados de gran volumen y menor riesgo
Human-over-the-loop (HOverT) Estratégico Establece políticas y audita resultados No Gobernanza y sistemas regulados

La supervisión pasiva (HOTL) es fundamentalmente distinta del control síncrono (HITL). Los diseñadores deben adaptar el modelo de supervisión al nivel de riesgo y al rendimiento requerido. Los sistemas híbridos suelen combinar enfoques: HITL para acciones de escritura, HOTL para resultados de solo lectura y HOverT para las políticas y la gobernanza del modelo.

Stanford HAI y expertos del sector recomiendan tratar a las personas como responsables de las decisiones, un enfoque que a veces se denomina “humanos al mando”, en lugar de limitarse a insertar personas en el flujo de datos. Esta distinción orienta las prioridades de diseño hacia la auditabilidad y los flujos de trabajo humanos, en vez de centrarlas en minimizar los puntos de contacto humanos. Una IA que actúa como asistente mientras una persona conserva la autoridad final tiene una arquitectura de sistema distinta de aquella en la que las personas son simplemente otra fuente de datos.

Orientación para elegir un patrón:

  • Alto riesgo + acciones irreversibles: HITL, siempre
  • Gran volumen + resultados reversibles: HOTL con vías de escalado
  • Sector regulado + responsabilidad a nivel directivo: HOverT para la gobernanza, HITL para clases de decisiones específicas
  • Bajo riesgo + alta confianza: considera eliminar por completo la revisión humana, manteniendo la supervisión

¿Cuáles son los verdaderos desafíos de ejecutar HITL a escala?

Los costes de la HITL son reales y a menudo se subestiman durante la fase de diseño.

Escalabilidad. Los controles de aprobación síncronos añaden latencia y requieren disponibilidad humana. A medida que crece el volumen, la cola de revisores se convierte en el cuello de botella. La mitigación es el enrutamiento basado en riesgos: escala solo las decisiones de alto impacto, inciertas o reguladas mediante umbrales de confianza y puntuaciones de riesgo. Derivar todo a personas anula el propósito de la automatización.

Amplificación de sesgos. Este es el riesgo más sutil. Un modelo entrenado con correcciones humanas hereda los sesgos humanos. Peor aún, un modelo bien alineado puede amplificar esos sesgos a escala. La tensión entre alineación y complementariedad es importante aquí: un modelo perfectamente alineado corre el riesgo de reforzar los errores humanos, mientras que un modelo complementario que aprovecha fortalezas diferentes puede producir mejores resultados que cualquiera de los dos por separado. La diversidad de revisores, la formación de calibración y las comprobaciones de fiabilidad entre evaluadores son las medidas operativas de mitigación.

Privacidad y gobernanza de datos. Los revisores humanos ven datos reales. En atención al cliente, detección de fraude y sanidad, esos datos suelen contener información personal identificable. Establece políticas de minimización de datos: redacta o seudonimiza los campos que los revisores no necesitan ver. Define políticas de conservación para las decisiones de los revisores y los datos sobre los que se tomaron.

Fatiga e incoherencia humanas. Los revisores que toman cientos de decisiones al día modifican gradualmente sus criterios. La calidad de las decisiones se deteriora. Las medidas de mitigación incluyen:

  1. Limitar el volumen diario de revisiones por revisor a un umbral justificable basado en la complejidad de la tarea
  2. Realizar sesiones periódicas de calibración en las que los revisores puntúen los mismos casos y comparen los resultados
  3. Seguir la fiabilidad entre evaluadores (kappa de Cohen o una métrica similar) como indicador operativo
  4. Rotar a los revisores entre tipos de tareas para evitar una visión excesivamente limitada
  5. Incorporar descansos obligatorios y señalar a los revisores cuyas tasas de aprobación se desvíen significativamente de la línea de referencia

Coste. La revisión humana es cara. El argumento empresarial a favor de la HITL depende de comparar el coste de los errores evitados con el coste del tiempo de los revisores. Haz ese cálculo explícitamente antes de comprometerte con un control síncrono para cada acción.


Lista de comprobación práctica para implementar sistemas HITL

Antes de poner en marcha un sistema HITL, sigue estos pasos en orden.

  1. Evaluación de riesgos. Mapea todas las acciones que puede realizar el agente. Clasifica cada una según su reversibilidad e impacto. Establece controles solo para las de alto impacto y difíciles de revertir.
  2. Definición de revisores. Identifica quién revisa cada cosa. ¿Experto del sector, generalista o escalado por niveles? Define su acceso, su SLA y su alternativa.
  3. Diseño de la interfaz. Crea formularios de decisión restringidos antes de crear el agente. Decide qué tipos de respuesta estructurada necesitas (aprobar / editar / rechazar / responder) y qué metadatos debes capturar.
  4. Estrategia de persistencia. Elige un punto de control duradero para producción. Prueba explícitamente la recuperación del estado antes del lanzamiento.
  5. Captura de comentarios. Conecta desde el primer día las decisiones de los revisores a un flujo de datos gobernado. Las colas desconectadas significan que pagas por la revisión humana sin obtener el beneficio de mejorar el modelo.
  6. Gobernanza. Define quién es responsable del equipo de revisores, quién audita los registros de decisiones y quién tiene autoridad para cambiar las reglas de enrutamiento.

Métricas clave que debes seguir una vez que el sistema esté activo:

  • Tasa de revisión: porcentaje de acciones del agente que activan una interrupción humana
  • Tiempo hasta la decisión: latencia mediana y del percentil 95 desde la interrupción hasta la decisión humana
  • Proporción de aprobaciones: fracción de acciones interrumpidas que se aprueban tal cual frente a las que se editan o rechazan
  • Tasa de mejora del modelo: cómo modifican las correcciones de los revisores el rendimiento del modelo con el tiempo
  • Fiabilidad entre evaluadores: coherencia de las decisiones de distintos revisores ante las mismas entradas

Cuándo reducir la revisión humana: realiza experimentos controlados utilizando umbrales de confianza. Si las acciones que superan una puntuación de confianza determinada tienen una tasa casi nula de edición o rechazo durante un periodo prolongado, ese umbral puede ser candidato para la automatización. Redúcelo gradualmente y vigila la deriva.


¿Qué dice la investigación actual sobre el futuro de la HITL?

El trabajo más interesante que se realiza ahora mismo no consiste en añadir más personas al ciclo. Consiste en hacer más inteligentes los puntos de contacto humanos.

La investigación sobre conjuntos adaptativos muestra que el enrutamiento entre modelos alineados y complementarios según el contexto puede mejorar los resultados de los equipos humanos-IA más allá de lo que cualquiera de los modelos logra por separado. La idea es que no siempre quieres que la IA esté de acuerdo con la persona. A veces quieres que detecte lo que la persona pasa por alto, y eso requiere una arquitectura de modelo distinta de la alineación pura.

El enfoque de los humanos al mando de Stanford HAI está ganando terreno tanto en los círculos de políticas públicas como en los equipos de ingeniería. Reformula la pregunta de diseño: en lugar de “¿cómo minimizamos la participación humana?”, plantea “¿cómo hacemos que la autoridad humana sea significativa y auditable?”. Ese cambio tiene consecuencias arquitectónicas reales: prioriza el registro de decisiones, los flujos de trabajo de los revisores y las vías de escalado por encima de la optimización del rendimiento.

Entre los patrones prácticos de ejecución que se están consolidando en 2025 y 2026 se incluyen:

  • Controles de aprobación basados en interrupciones con ejecución duradera como arquitectura predeterminada para cualquier agente capaz de realizar acciones con efectos secundarios
  • Formularios estructurados de respuesta humana que limitan las opciones de los revisores y producen datos de entrenamiento limpios
  • Enrutamiento basado en la confianza que ajusta dinámicamente qué acciones requieren revisión humana según la certeza del modelo y las tasas históricas de aprobación
  • Conjuntos conscientes de la complementariedad que derivan los casos a distintas variantes del modelo dependiendo de si la tarea se beneficia de la alineación o del criterio independiente

Un experimento que merece la pena realizar: toma tu cola de aprobaciones actual y analiza la tasa de edición y rechazo por tipo de herramienta y rango de confianza. El patrón casi siempre revela que un pequeño subconjunto de llamadas de herramientas genera la mayoría de las ediciones. Ahí es donde tu inversión en HITL realmente está dando resultados, y normalmente no es donde esperabas.

Consejo profesional: Haz un seguimiento de la proporción de aprobaciones por decil de confianza. Si el nivel de confianza superior tiene una tasa de aprobación cercana al 100 %, estás pagando por una revisión humana que no necesitas. Si el nivel inferior tiene una tasa de rechazo cercana al 100 %, tu modelo necesita reentrenamiento, no más revisores.

Puedes explorar cómo Interval AI combina el criterio humano con entornos de ejecución de agentes para equipos que crean flujos de trabajo HITL en producción.


Conclusiones clave

La IA con intervención humana ofrece su mayor valor cuando el criterio humano se integra en controles de aprobación durante la ejecución para acciones con efectos secundarios, no solo en los flujos de entrenamiento, y cuando las decisiones de los revisores se capturan como datos gobernados que alimentan la mejora del modelo.

Punto Detalles
La HITL es un patrón de ejecución, no solo una técnica de entrenamiento Los controles de aprobación antes de las acciones de los agentes con efectos secundarios son ahora un requisito básico para las implementaciones en producción.
El enrutamiento basado en riesgos mantiene la escalabilidad de la HITL Reserva la revisión humana síncrona para decisiones de alto impacto, inciertas o reguladas mediante umbrales de confianza.
La ejecución duradera no es negociable Los sistemas de producción deben conservar el estado del agente entre interrupciones; los guardadores en memoria fallan cuando las aprobaciones tardan horas o días.
Los humanos al mando superan a los humanos en el flujo de datos Diseñar pensando en la autoridad humana y la auditabilidad produce mejores resultados que minimizar los puntos de contacto humanos.
Deskhero implementa la HITL de forma nativa La IA de Deskhero redacta respuestas y transfiere los casos a personas cuando no está segura, y cada acción automatizada queda etiquetada y registrada.

El aspecto de la HITL que la mayoría de los equipos entiende mal

Existe una versión de la adopción de HITL que desde fuera parece correcta, pero falla silenciosamente por dentro. Un equipo añade un paso de revisión, los revisores hacen clic en aprobar para el 95 % de los resultados sin leerlos con atención y la organización declara que el sistema está “supervisado por personas”. El registro de auditoría existe. La casilla de gobernanza está marcada. El modelo nunca mejora porque los comentarios son ruido.

El error consiste en tratar la HITL como un escudo frente a responsabilidades, en lugar de como un mecanismo de aprendizaje. El control de aprobación está ahí para detectar errores, sí, pero su propósito más profundo es generar datos estructurados y gobernados sobre dónde se equivoca el modelo y por qué. Los equipos que entienden esto crean interfaces de revisores que capturan por qué se editó una acción, no solo que se editó. Hacen un seguimiento de la fiabilidad entre evaluadores. Organizan sesiones de calibración. Tratan al equipo de revisores como un problema de calidad de datos, no como un problema de número de empleados.

El otro aspecto que se subestima es el enfoque de los “humanos al mando”. La mayoría de las implementaciones HITL están diseñadas para reducir con el tiempo la participación humana, un objetivo razonable desde el punto de vista de la eficiencia. Sin embargo, en ámbitos de alto riesgo, el objetivo debería ser que la autoridad humana sea más significativa a medida que madura el sistema, no que esté menos presente. Eso implica mejores herramientas para los revisores, vías de escalado más claras y estructuras de gobernanza que otorguen a las personas poder real para cambiar el comportamiento del modelo, no solo para aprobar resultados individuales.

Los equipos que más provecho obtienen de la HITL son los que la tratan como una capacidad organizativa, no como una función técnica. La tecnología es la parte fácil.


Deskhero coloca la supervisión humana en el centro del soporte basado en IA

Si la lista de comprobación de este artículo describe cómo es una buena HITL, Deskhero está construido en torno exactamente a esos principios para los equipos de atención al cliente. La IA redacta respuestas y lee archivos adjuntos, pero nada se envía automáticamente a menos que lo autorices. Cada acción automatizada está etiquetada y registrada. La IA transfiere el caso a una persona en cuanto no está segura, por lo que nunca inventa una respuesta.

Deskhero

La base de conocimientos solo crece a partir del contenido que tu equipo ha aprobado: los tickets resueltos y las páginas de tu propio sitio web se convierten en entradas de preguntas frecuentes que la IA puede utilizar, pero únicamente después de que un agente las apruebe. Ese control de aprobación es HITL en la práctica, no solo en teoría. Para los equipos de comercio electrónico, la integración de soporte de IA para Shopify mantiene a las personas al mando de los cambios en cuentas y pedidos precisamente porque esas son las acciones con efectos secundarios que más importan.

Deskhero funciona dentro de Gmail, Google Workspace o Microsoft 365 sin necesidad de migración. Comienza una prueba gratuita de 30 días sin necesidad de tarjeta de crédito y comprueba cómo funciona en la práctica un servicio de asistencia basado primero en HITL.


Fuentes útiles

Las fuentes que aparecen a continuación están ordenadas primero por utilidad práctica y después por profundidad investigadora. Empieza por la documentación y las publicaciones del sector si estás creando un sistema; pasa a los artículos académicos para conocer los fundamentos teóricos.

Fuente Qué abarca
Documentación de HITL de LangChain Mecánica de las interrupciones, tipos de decisión, patrones de persistencia y configuración de aprobaciones por herramienta
Documentación del entorno de ejecución HITL de inference.sh Configuración de controles de aprobación con un indicador, ejecución duradera y requisitos de persistencia en producción
Blog de Databricks sobre HITL Enrutamiento basado en riesgos, comentarios como datos operativos y compensaciones entre HITL y HOTL
IBM: ¿Qué es human-in-the-loop? Enfoque empresarial, riesgos de los agentes con efectos secundarios y patrones de adopción
Stanford HAI: ¿Qué es human-in-the-loop? Mentalidad de los humanos al mando, enfoque normativo y principios de diseño de la supervisión
Stanford HAI: Humans in the Loop — Design of Interactive AI Systems Estudio de investigación sobre el diseño de sistemas interactivos de IA y los patrones de colaboración entre personas e IA
AAAI: Align When They Want, Complement When They Need Investigación sobre complementariedad frente a alineación, enrutamiento de conjuntos adaptativos y rendimiento de equipos humanos-IA
MIT HDSR: Data Science and Engineering With Human in the Loop Tratamiento académico de la HITL en flujos de datos, calidad de la anotación y ciclos de comentarios
NCBI/PMC: HITL in clinical AI Aplicaciones de la supervisión HITL en imágenes médicas y apoyo a las decisiones clínicas

Preguntas frecuentes

¿Qué significa human-in-the-loop en IA?

La IA con intervención humana es un diseño de sistema en el que una persona se integra en el ciclo de decisión o ejecución de la IA, ya sea para etiquetar datos de entrenamiento, evaluar resultados o aprobar acciones de los agentes antes de que surtan efecto. La característica definitoria es que el sistema espera la intervención humana o la incorpora en un punto de control definido, en lugar de actuar de forma completamente autónoma.

¿Cuál es la diferencia entre human-in-the-loop y human-on-the-loop?

Human-in-the-loop (HITL) utiliza controles de aprobación síncronos que bloquean la ejecución del agente hasta que una persona decide; human-on-the-loop (HOTL) permite que el sistema actúe de forma autónoma mientras una persona supervisa y puede intervenir de manera asíncrona. HITL es adecuada para acciones de alto riesgo e irreversibles; HOTL es apropiada para resultados de gran volumen y menor riesgo, en los que el bloqueo en tiempo real no sería práctico.

¿Qué significa human-in-the-loop para los agentes de IA?

En el caso de los agentes de IA que pueden realizar acciones con efectos secundarios (enviar correos, actualizar registros o procesar transacciones), HITL significa insertar un control de aprobación antes de ejecutar esas acciones. El agente se pausa, muestra la acción propuesta a un revisor humano y solo reanuda la ejecución después de recibir una decisión de aprobar, editar o rechazar, conservando el estado del agente durante todo el proceso.

¿Qué significa human-on-the-loop en IA?

Human-on-the-loop es un modelo de supervisión en el que el sistema de IA funciona de forma autónoma y una persona supervisa los resultados o registros, interviniendo para corregir o anular algo cuando sale mal. A diferencia de HITL, no bloquea la ejecución, por lo que se adapta mejor a escenarios de gran rendimiento en los que la revisión síncrona generaría una latencia inaceptable.

¿Cómo implementa Deskhero la IA con intervención humana para los equipos de soporte?

La IA de Deskhero redacta respuestas y opera el chat-bot, pero transfiere el caso a una persona siempre que no está segura y nunca envía nada automáticamente a menos que el equipo lo autorice. Cada acción automatizada está etiquetada y registrada, y la base de conocimientos solo utiliza contenido que un agente ha aprobado explícitamente, de modo que las personas mantienen la autoridad sobre lo que la IA puede decir.