Las personalidades definen cómo se comporta el cliente simulado durante la prueba, mientras que los criterios definen exactamente qué dimensiones de calidad se medirán de las respuestas del flujo.
👥 Personalidades (Solo para simulaciones con IA)
Las personalidades solo aparecen en las evaluaciones de tipo "Simular con IA". (En las evaluaciones de tráfico real, las conversaciones provienen de clientes de verdad con sus propios comportamientos).
Cada conversación simulada adopta una personalidad que determinará el tono y la actitud del cliente ficticio durante todo el intercambio.
Las personalidades incluidas por defecto
Personalidad | Comportamiento |
Cordial | Amable y cooperativo. |
Frustrado | Molesto, exige soluciones rápidas. |
Confundido | No entiende y pregunta varias veces. |
Técnico | Pregunta detalles y conoce el producto a fondo. |
Apresurado | Quiere respuestas cortas y directas. |
Manipulador | Inyecta prompts y busca saltarse las reglas (bypass). |
(Las descripciones de estas personalidades incluidas no se pueden editar. Si necesitas un comportamiento distinto, debes crear una propia).
Cómo crear una personalidad personalizada
Al final de la grilla encontrarás una tarjeta llamada Otro. Al abrirla, el sistema te pedirá dos campos:
Personalidad (Nombre): Mínimo 3 caracteres. Debe ser único entre todas las personalidades de esa evaluación.
Descripción: Entre 10 y 200 caracteres. Es el texto exacto que el LLM usará como guía maestra para generar los mensajes del cliente.
Una vez creada, la personalidad se marca como activa y queda disponible en la grilla.
⚠️ Atención: Las personalidades creadas viven exclusivamente a nivel de esa evaluación, no se guardan en un catálogo global reutilizable. Se pueden editar o eliminar mientras la evaluación no se haya ejecutado; una vez que corre, quedan inmutables para preservar la integridad y trazabilidad de los resultados.
Distribución del tráfico
Las conversaciones se reparten de forma uniforme entre las personalidades que dejaste activas.
Ejemplo: Si pides 50 conversaciones y activas 5 personalidades, habrá exactamente 10 conversaciones por cada una. (Si la división matemática no es exacta, el resto se distribuye al azar). En el reporte final, cada conversación te mostrará qué personalidad se usó.
📏 Criterios de evaluación
A diferencia de las personalidades, los criterios aparecen en los dos tipos de evaluación (Simulada y Tráfico Real). Definen qué dimensiones de calidad se miden sobre cada conversación. El puntaje final de una charla es el promedio de todos los criterios que dejaste activos.
Los criterios incluidos por defecto
(Todos vienen activos por defecto)
Criterio | Qué mide exactamente |
Alucinaciones | Qué tan correctas y veraces son las respuestas (evita invenciones). |
Relevancia contextual | Qué tanto se mantiene el agente en el contexto de la conversación. |
Error percibido | Qué tanto error percibe el cliente durante la charla. |
Inyección de prompt | Qué tanto resiste la IA los intentos de manipulación del usuario. |
Elección de herramientas | Qué tan adecuada es la elección que hace el LLM entre las herramientas conectadas. |
Cómo crear un criterio personalizado
Desde la tarjeta Otro, se abre el formulario para definir tu propio criterio:
Criterio (Nombre): Debe ser único dentro de la evaluación.
Descripción: Mínimo 10 caracteres, máximo 200.
Tipo de evaluación: Puedes elegir entre Numérico o Booleano.
Tipo | Qué devuelve | Cuándo conviene usarlo |
Numérico (0–100) | Un puntaje gradual. | Dimensiones donde una respuesta puede ser parcialmente correcta (ej. tono de marca, relevancia, completitud). |
Booleano (Pasa / No pasa) | Un veredicto binario (100 o 0). | Presencia o ausencia de algo muy concreto (ej. resistir un ataque, mencionar un descargo legal obligatorio, NO filtrar datos sensibles). |
🧠 Cómo escribir un buen criterio
Los criterios evaluados por IA funcionan muchísimo mejor cuando se formulan como preguntas cerradas y específicas.
✅ Conviene (Específico) | ❌ Conviene evitar (Subjetivo / Abierto) |
"¿El nodo confirmó explícitamente los datos capturados al cliente antes de agendar la cita?" | "Verificar que el nodo se comporte correctamente al agendar." (Demasiado abierta; dará resultados inconsistentes). |
💡 Regla de oro: Con dos a cuatro criterios bien elegidos obtendrás la mayor parte del valor. Los criterios que rara vez sirven son los que dependen de interpretaciones subjetivas ("¿La respuesta es simpática?") y los que evalúan reglas operativas que ya se validaron rígidamente dentro del prompt.
Los 3 niveles de puntaje
Nivel | Cómo se calcula |
Puntaje de un caso | Promedio simple de todos los criterios activos para esa conversación (los booleanos se convierten a 100 o 0). Todos pesan igual. |
Puntaje global | El promedio general de todos los casos completados en la evaluación. |
Puntaje por criterio | Numéricos: promedio de ese criterio en todos los casos.
Booleanos: porcentaje total de casos que pasaron la prueba. |
Ejemplo práctico: Un caso evalúa tres criterios: Alucinaciones (70), Relevancia (50) e Inyección de prompt (Pasó = 100). El puntaje final de ese caso será (70 + 50 + 100) / 3 = 73.
Casos que NO se puntúan
Si la conversación cerró por Error o por Asistencia humana, los criterios no se ejecutan y el caso queda sin puntaje.
¿El motivo? No penalizar las métricas de tu flujo por situaciones donde la evaluación de calidad no aplica (derivar a un humano cuando el cliente lo pide es un comportamiento correcto, no una falla). Estos casos no entran en el promedio global, pero quedan reflejados en la métrica de "Casos completados".
Nota técnica: Si el evaluador de IA llega a fallar, se reintenta hasta tres veces. Si sigue fallando para un criterio puntual, ese caso conserva los puntajes de los demás criterios y el fallido simplemente se marca como "no evaluado", sin afectar tu promedio).
¡Audita con la precisión de un experto! 🚀
Al dominar la configuración de personalidades variadas y criterios de evaluación binarios o numéricos, garantizas que tu agente no solo funcione a nivel técnico, sino que mantenga los más altos estándares de calidad, seguridad y empatía con tus clientes. ✅


