Son pruebas automatizadas que corren cientos de conversaciones contra el flujo y las puntúan según criterios definidos, utilizando conversaciones generadas por IA o tráfico real de tu operación.
⚖️ Los dos orígenes
Puedes correr evaluaciones utilizando dos fuentes distintas. Ambas comparten exactamente la misma vista de resultados y los mismos criterios de evaluación, pero tienen propósitos diferentes:
Característica | 🤖 Simular con IA | 👥 Tráfico en vivo |
Qué evalúa | Conversaciones sintéticas generadas contra el flujo. | Conversaciones reales ya cerradas. |
Cuándo usarlo | Antes de publicar, para validar cambios. | En producción, para detectar problemas de calidad. |
Control sobre los casos | Alto: Defines el comportamiento a evaluar y los perfiles de cliente. | Ninguno: Son las conversaciones reales que hubo. |
📍 ¿Dónde están y cómo es la tabla?
Para acceder a este módulo, la ruta es:
Canvas → barra superior → ícono de Evaluaciones.
Al hacer clic, se abre un panel lateral derecho con la tabla de todas las evaluaciones del flujo. Este panel se puede cerrar sin que pierdas el contexto de tu trabajo en el canvas.
Detalle de la tabla
La tabla se actualiza en tiempo real cuando hay evaluaciones en curso y muestra las siguientes columnas:
Columna | Contenido |
Nombre | El que le asignaste al crearla. |
Origen | Simulado o En vivo. |
Casos | Cantidad total de conversaciones evaluadas. |
Estado | Completado, Evaluando, Error o Cancelado. |
Puntaje | Global sobre 100. (Aparece vacío mientras evalúa). |
Fecha de realización | Ordenadas por más reciente primero. |
Acciones por fila y Permisos
Desde la tabla puedes: Ver resultados, Duplicar configuración (abre el formulario con los parámetros ya precargados), Cancelar (si está corriendo) y Eliminar (si ya terminó). Ten en cuenta que las evaluaciones eliminadas no se pueden recuperar.
Permisos: Cualquier usuario con acceso de lectura puede ver los resultados. Solo los editores pueden crear, cancelar y eliminar evaluaciones.
🤖 Crear una evaluación con IA
Haz clic en + Nueva evaluación.
Elige la opción Simular con IA.
Completa el formulario con los siguientes campos.
Haz clic en Ejecutar evaluación.
Campo | Obligatorio | Descripción |
Nombre | Sí | Mínimo 3 caracteres, único dentro del flujo. |
Qué comportamiento querés evaluar | Sí | (Mínimo 20 caracteres). Describe el caso de uso exacto; la IA generará conversaciones que pongan a prueba ese comportamiento. |
Cantidad de conversaciones | Sí | 10, 20, 50, 100 u otro valor entre 1 y 500 (por defecto 50). |
Personalidades | Al menos una | Perfiles de cliente simulado (ver sección 7.5). |
Criterios | Al menos uno | Dimensiones de calidad a medir (ver sección 7.5). |
(Las personalidades y criterios vienen premarcados con un conjunto recomendado, pero puedes desmarcarlos y agregar los tuyos).
👥 Crear una evaluación sobre tráfico real
El recorrido es el mismo, pero eligiendo Tráfico en vivo.
Campo | Obligatorio | Descripción |
Nombre | Sí | Mínimo 3 caracteres, único dentro del flujo. |
Máximo de conversaciones | Sí | 10, 20, 50, 100 u otro valor entre 1 y 1000 (por defecto 50). |
Máximo de tiempo | Sí | 1 día, 3 días, 1 semana, 2 semanas o 1 mes (por defecto 1 semana). |
Criterios | Al menos uno | Los mismos que en la evaluación simulada. |
(Nota: Aquí no hay "personalidades" ni "comportamiento a evaluar", ya que las conversaciones provienen de clientes reales y ya existen).
Cómo se seleccionan las conversaciones
Se toman conversaciones ya cerradas que hayan ocurrido dentro de la ventana temporal configurada, hasta alcanzar el máximo indicado.
El muestreo es completamente aleatorio dentro de esa ventana (no cronológico) para evitar sesgos hacia las primeras conversaciones del día. Si no hay suficientes conversaciones para llegar al máximo, la evaluación corre con las que haya disponibles y te lo informa en los resultados.
⚡ Ejecución
Al presionar Ejecutar, el modal se cierra y aparece un aviso de que la evaluación arrancó. La fila nueva aparecerá en estado "Evaluando".
La evaluación corre siempre en segundo plano. Puedes seguir trabajando en el canvas, simular el flujo o navegar a otra parte del producto sin interrumpirla.
Qué pasa con cada conversación simulada
Por cada conversación se inicia una simulación independiente:
Un LLM con el perfil de la personalidad asignada actúa como cliente.
El flujo real —en su versión borrador— le responde utilizando todas sus herramientas y su base de conocimiento.
La conversación termina cuando se cumple una condición de cierre.
Cada interacción se guarda con su timestamp, rol, contenido, invocaciones a herramientas y latencia.
(Una vez completadas todas las conversaciones, se ejecutan los criterios de calidad sobre cada una. Las conversaciones se reparten de forma uniforme; ej. si pides 50 conversaciones y 5 personalidades, se asignarán 10 por personalidad).
Cómo terminan las conversaciones simuladas
Después de cada interacción del cliente simulado, el motor evalúa cinco condiciones en orden. La primera que se cumple, cierra la conversación:
Condición | Cuándo se dispara | Motivo de Cierre |
Error de runtime | Timeout (+40 seg), error de herramienta no manejado, error de modelo. | Error |
Cliente satisfecho | Señales explícitas de cierre por satisfacción. | Resuelta |
Cliente abandona | Señales de frustración terminal o pérdida de interés. | Abandono |
Máximo de turnos | Se llega a 10 turnos del cliente sin que se cumpla nada anterior. | Abandono |
Nota: En las evaluaciones sobre tráfico real no se aplica ninguna condición artificial; el cierre se toma directamente de la rama de finalización con la que terminó la conversación original en producción).
🔔 Estados, Notificaciones y Versiones
Notificaciones: Cuando la evaluación termina, aparece una notificación con el puntaje final y un enlace directo a los resultados.
Manejo de errores: Si una conversación individual falla durante la simulación, queda registrada con cierre de "error", pero no rompe la evaluación completa (la tasa de error se expone como métrica en los resultados).
Cancelación: Al cancelar una evaluación en curso, las conversaciones que ya se habían completado se conservan y quedan disponibles para revisión.
¿Qué versión se evalúa exactamente?
Al presionar Ejecutar, el motor toma una copia inmutable de tu versión borrador en ese exacto segundo (prompt, conexiones, herramientas, base de conocimiento, configuración global y modelo). Si después modificas el flujo, la evaluación en curso no se ve afectada, ya que sigue corriendo contra la copia guardada.
💡 Tip de Análisis: Esta copia inmutable es lo que te permite comparar resultados de forma precisa entre distintas versiones. Cada evaluación queda atada a la configuración exacta con la que se corrió, haciendo que un resultado viejo siga siendo 100% interpretable meses después.
¡Mide, ajusta y mejora continuamente! 🚀
Las evaluaciones automatizadas son el paso definitivo para garantizar que tu agente funcione con excelencia a escala. Ya sea probando casos límite con IA antes de salir a producción o auditando tu tráfico real para detectar áreas de mejora, esta herramienta te da la visibilidad necesaria para perfeccionar tus flujos conversacionales. ✅


