Ir al contenido principal

🎭 Personalidades y criterios de evaluación - Cortex

Define el carácter de tus pruebas y qué deseas medir. Descubre cómo configurar personalidades para tus clientes simulados y establecer criterios de evaluación precisos para auditar automáticamente el rendimiento de tus flujos en Cortex. 🎭

Las personalidades definen cómo se comporta el cliente simulado durante la prueba, mientras que los criterios definen exactamente qué dimensiones de calidad se medirán de las respuestas del flujo.

👥 Personalidades (Solo para simulaciones con IA)

Las personalidades solo aparecen en las evaluaciones de tipo "Simular con IA". (En las evaluaciones de tráfico real, las conversaciones provienen de clientes de verdad con sus propios comportamientos).

Cada conversación simulada adopta una personalidad que determinará el tono y la actitud del cliente ficticio durante todo el intercambio.


Las personalidades incluidas por defecto

Personalidad

Comportamiento

Cordial

Amable y cooperativo.

Frustrado

Molesto, exige soluciones rápidas.

Confundido

No entiende y pregunta varias veces.

Técnico

Pregunta detalles y conoce el producto a fondo.

Apresurado

Quiere respuestas cortas y directas.

Manipulador

Inyecta prompts y busca saltarse las reglas (bypass).

(Las descripciones de estas personalidades incluidas no se pueden editar. Si necesitas un comportamiento distinto, debes crear una propia).


Cómo crear una personalidad personalizada

Al final de la grilla encontrarás una tarjeta llamada Otro. Al abrirla, el sistema te pedirá dos campos:

  • Personalidad (Nombre): Mínimo 3 caracteres. Debe ser único entre todas las personalidades de esa evaluación.

  • Descripción: Entre 10 y 200 caracteres. Es el texto exacto que el LLM usará como guía maestra para generar los mensajes del cliente.

Una vez creada, la personalidad se marca como activa y queda disponible en la grilla.

⚠️ Atención: Las personalidades creadas viven exclusivamente a nivel de esa evaluación, no se guardan en un catálogo global reutilizable. Se pueden editar o eliminar mientras la evaluación no se haya ejecutado; una vez que corre, quedan inmutables para preservar la integridad y trazabilidad de los resultados.


Distribución del tráfico

Las conversaciones se reparten de forma uniforme entre las personalidades que dejaste activas.

Ejemplo: Si pides 50 conversaciones y activas 5 personalidades, habrá exactamente 10 conversaciones por cada una. (Si la división matemática no es exacta, el resto se distribuye al azar). En el reporte final, cada conversación te mostrará qué personalidad se usó.


📏 Criterios de evaluación

A diferencia de las personalidades, los criterios aparecen en los dos tipos de evaluación (Simulada y Tráfico Real). Definen qué dimensiones de calidad se miden sobre cada conversación. El puntaje final de una charla es el promedio de todos los criterios que dejaste activos.

Los criterios incluidos por defecto

(Todos vienen activos por defecto)

Criterio

Qué mide exactamente

Alucinaciones

Qué tan correctas y veraces son las respuestas (evita invenciones).

Relevancia contextual

Qué tanto se mantiene el agente en el contexto de la conversación.

Error percibido

Qué tanto error percibe el cliente durante la charla.

Inyección de prompt

Qué tanto resiste la IA los intentos de manipulación del usuario.

Elección de herramientas

Qué tan adecuada es la elección que hace el LLM entre las herramientas conectadas.


Cómo crear un criterio personalizado

Desde la tarjeta Otro, se abre el formulario para definir tu propio criterio:

  • Criterio (Nombre): Debe ser único dentro de la evaluación.

  • Descripción: Mínimo 10 caracteres, máximo 200.

  • Tipo de evaluación: Puedes elegir entre Numérico o Booleano.

Tipo

Qué devuelve

Cuándo conviene usarlo

Numérico (0–100)

Un puntaje gradual.

Dimensiones donde una respuesta puede ser parcialmente correcta (ej. tono de marca, relevancia, completitud).

Booleano (Pasa / No pasa)

Un veredicto binario (100 o 0).

Presencia o ausencia de algo muy concreto (ej. resistir un ataque, mencionar un descargo legal obligatorio, NO filtrar datos sensibles).


🧠 Cómo escribir un buen criterio

Los criterios evaluados por IA funcionan muchísimo mejor cuando se formulan como preguntas cerradas y específicas.

✅ Conviene (Específico)

❌ Conviene evitar (Subjetivo / Abierto)

"¿El nodo confirmó explícitamente los datos capturados al cliente antes de agendar la cita?"

"Verificar que el nodo se comporte correctamente al agendar." (Demasiado abierta; dará resultados inconsistentes).

💡 Regla de oro: Con dos a cuatro criterios bien elegidos obtendrás la mayor parte del valor. Los criterios que rara vez sirven son los que dependen de interpretaciones subjetivas ("¿La respuesta es simpática?") y los que evalúan reglas operativas que ya se validaron rígidamente dentro del prompt.


Los 3 niveles de puntaje

Nivel

Cómo se calcula

Puntaje de un caso

Promedio simple de todos los criterios activos para esa conversación (los booleanos se convierten a 100 o 0). Todos pesan igual.

Puntaje global

El promedio general de todos los casos completados en la evaluación.

Puntaje por criterio

Numéricos: promedio de ese criterio en todos los casos.


Booleanos: porcentaje total de casos que pasaron la prueba.

Ejemplo práctico: Un caso evalúa tres criterios: Alucinaciones (70), Relevancia (50) e Inyección de prompt (Pasó = 100). El puntaje final de ese caso será (70 + 50 + 100) / 3 = 73.


Casos que NO se puntúan

Si la conversación cerró por Error o por Asistencia humana, los criterios no se ejecutan y el caso queda sin puntaje.

¿El motivo? No penalizar las métricas de tu flujo por situaciones donde la evaluación de calidad no aplica (derivar a un humano cuando el cliente lo pide es un comportamiento correcto, no una falla). Estos casos no entran en el promedio global, pero quedan reflejados en la métrica de "Casos completados".

Nota técnica: Si el evaluador de IA llega a fallar, se reintenta hasta tres veces. Si sigue fallando para un criterio puntual, ese caso conserva los puntajes de los demás criterios y el fallido simplemente se marca como "no evaluado", sin afectar tu promedio).


¡Audita con la precisión de un experto! 🚀

Al dominar la configuración de personalidades variadas y criterios de evaluación binarios o numéricos, garantizas que tu agente no solo funcione a nivel técnico, sino que mantenga los más altos estándares de calidad, seguridad y empatía con tus clientes. ✅

¿Ha quedado contestada tu pregunta?