Ir al contenido principal

🧪 Evaluaciones: crear y ejecutar - Cortex

Asegura la calidad de tu flujo con métricas reales. Descubre cómo crear y ejecutar evaluaciones automatizadas en Cortex para poner a prueba tu agente, ya sea generando conversaciones con Inteligencia Artificial o analizando tu tráfico real de producción.

Son pruebas automatizadas que corren cientos de conversaciones contra el flujo y las puntúan según criterios definidos, utilizando conversaciones generadas por IA o tráfico real de tu operación.

⚖️ Los dos orígenes

Puedes correr evaluaciones utilizando dos fuentes distintas. Ambas comparten exactamente la misma vista de resultados y los mismos criterios de evaluación, pero tienen propósitos diferentes:

Característica

🤖 Simular con IA

👥 Tráfico en vivo

Qué evalúa

Conversaciones sintéticas generadas contra el flujo.

Conversaciones reales ya cerradas.

Cuándo usarlo

Antes de publicar, para validar cambios.

En producción, para detectar problemas de calidad.

Control sobre los casos

Alto: Defines el comportamiento a evaluar y los perfiles de cliente.

Ninguno: Son las conversaciones reales que hubo.


📍 ¿Dónde están y cómo es la tabla?

Para acceder a este módulo, la ruta es:

Canvas → barra superior → ícono de Evaluaciones.

Al hacer clic, se abre un panel lateral derecho con la tabla de todas las evaluaciones del flujo. Este panel se puede cerrar sin que pierdas el contexto de tu trabajo en el canvas.


Detalle de la tabla

La tabla se actualiza en tiempo real cuando hay evaluaciones en curso y muestra las siguientes columnas:

Columna

Contenido

Nombre

El que le asignaste al crearla.

Origen

Simulado o En vivo.

Casos

Cantidad total de conversaciones evaluadas.

Estado

Completado, Evaluando, Error o Cancelado.

Puntaje

Global sobre 100. (Aparece vacío mientras evalúa).

Fecha de realización

Ordenadas por más reciente primero.


Acciones por fila y Permisos

Desde la tabla puedes: Ver resultados, Duplicar configuración (abre el formulario con los parámetros ya precargados), Cancelar (si está corriendo) y Eliminar (si ya terminó). Ten en cuenta que las evaluaciones eliminadas no se pueden recuperar.

  • Permisos: Cualquier usuario con acceso de lectura puede ver los resultados. Solo los editores pueden crear, cancelar y eliminar evaluaciones.

🤖 Crear una evaluación con IA

  1. Haz clic en + Nueva evaluación.

  2. Elige la opción Simular con IA.

  3. Completa el formulario con los siguientes campos.

  4. Haz clic en Ejecutar evaluación.

Campo

Obligatorio

Descripción

Nombre

Mínimo 3 caracteres, único dentro del flujo.

Qué comportamiento querés evaluar

(Mínimo 20 caracteres). Describe el caso de uso exacto; la IA generará conversaciones que pongan a prueba ese comportamiento.

Cantidad de conversaciones

10, 20, 50, 100 u otro valor entre 1 y 500 (por defecto 50).

Personalidades

Al menos una

Perfiles de cliente simulado (ver sección 7.5).

Criterios

Al menos uno

Dimensiones de calidad a medir (ver sección 7.5).

(Las personalidades y criterios vienen premarcados con un conjunto recomendado, pero puedes desmarcarlos y agregar los tuyos).


👥 Crear una evaluación sobre tráfico real

El recorrido es el mismo, pero eligiendo Tráfico en vivo.

Campo

Obligatorio

Descripción

Nombre

Mínimo 3 caracteres, único dentro del flujo.

Máximo de conversaciones

10, 20, 50, 100 u otro valor entre 1 y 1000 (por defecto 50).

Máximo de tiempo

1 día, 3 días, 1 semana, 2 semanas o 1 mes (por defecto 1 semana).

Criterios

Al menos uno

Los mismos que en la evaluación simulada.

(Nota: Aquí no hay "personalidades" ni "comportamiento a evaluar", ya que las conversaciones provienen de clientes reales y ya existen).

Cómo se seleccionan las conversaciones

Se toman conversaciones ya cerradas que hayan ocurrido dentro de la ventana temporal configurada, hasta alcanzar el máximo indicado.

El muestreo es completamente aleatorio dentro de esa ventana (no cronológico) para evitar sesgos hacia las primeras conversaciones del día. Si no hay suficientes conversaciones para llegar al máximo, la evaluación corre con las que haya disponibles y te lo informa en los resultados.


⚡ Ejecución

Al presionar Ejecutar, el modal se cierra y aparece un aviso de que la evaluación arrancó. La fila nueva aparecerá en estado "Evaluando".

La evaluación corre siempre en segundo plano. Puedes seguir trabajando en el canvas, simular el flujo o navegar a otra parte del producto sin interrumpirla.

Qué pasa con cada conversación simulada

Por cada conversación se inicia una simulación independiente:

  • Un LLM con el perfil de la personalidad asignada actúa como cliente.

  • El flujo real —en su versión borrador— le responde utilizando todas sus herramientas y su base de conocimiento.

  • La conversación termina cuando se cumple una condición de cierre.

  • Cada interacción se guarda con su timestamp, rol, contenido, invocaciones a herramientas y latencia.

(Una vez completadas todas las conversaciones, se ejecutan los criterios de calidad sobre cada una. Las conversaciones se reparten de forma uniforme; ej. si pides 50 conversaciones y 5 personalidades, se asignarán 10 por personalidad).


Cómo terminan las conversaciones simuladas

Después de cada interacción del cliente simulado, el motor evalúa cinco condiciones en orden. La primera que se cumple, cierra la conversación:

Condición

Cuándo se dispara

Motivo de Cierre

Error de runtime

Timeout (+40 seg), error de herramienta no manejado, error de modelo.

Error

Cliente satisfecho

Señales explícitas de cierre por satisfacción.

Resuelta

Cliente abandona

Señales de frustración terminal o pérdida de interés.

Abandono

Máximo de turnos

Se llega a 10 turnos del cliente sin que se cumpla nada anterior.

Abandono

Nota: En las evaluaciones sobre tráfico real no se aplica ninguna condición artificial; el cierre se toma directamente de la rama de finalización con la que terminó la conversación original en producción).


🔔 Estados, Notificaciones y Versiones

  • Notificaciones: Cuando la evaluación termina, aparece una notificación con el puntaje final y un enlace directo a los resultados.

  • Manejo de errores: Si una conversación individual falla durante la simulación, queda registrada con cierre de "error", pero no rompe la evaluación completa (la tasa de error se expone como métrica en los resultados).

  • Cancelación: Al cancelar una evaluación en curso, las conversaciones que ya se habían completado se conservan y quedan disponibles para revisión.


¿Qué versión se evalúa exactamente?

Al presionar Ejecutar, el motor toma una copia inmutable de tu versión borrador en ese exacto segundo (prompt, conexiones, herramientas, base de conocimiento, configuración global y modelo). Si después modificas el flujo, la evaluación en curso no se ve afectada, ya que sigue corriendo contra la copia guardada.

💡 Tip de Análisis: Esta copia inmutable es lo que te permite comparar resultados de forma precisa entre distintas versiones. Cada evaluación queda atada a la configuración exacta con la que se corrió, haciendo que un resultado viejo siga siendo 100% interpretable meses después.


¡Mide, ajusta y mejora continuamente! 🚀

Las evaluaciones automatizadas son el paso definitivo para garantizar que tu agente funcione con excelencia a escala. Ya sea probando casos límite con IA antes de salir a producción o auditando tu tráfico real para detectar áreas de mejora, esta herramienta te da la visibilidad necesaria para perfeccionar tus flujos conversacionales. ✅

¿Ha quedado contestada tu pregunta?