Passar para o conteúdo principal

🎭 Personalidades e critérios de avaliação - Cortex

Defina o caráter de seus testes e o que você deseja medir. Descubra como configurar personalidades para seus clientes simulados e estabelecer critérios de avaliação precisos para auditar automaticamente o desempenho de seus fluxos no Cortex. 🎭

As personalidades definem como o cliente simulado se comporta durante o teste, enquanto os critérios definem exatamente quais dimensões de qualidade serão medidas das respostas do fluxo.

👥 Personalidades (Apenas para simulações com IA)

As personalidades aparecem apenas nas avaliações do tipo "Simular com IA". (Nas avaliações de tráfego real, as conversas vêm de clientes de verdade com seus próprios comportamentos).

Cada conversa simulada adota uma personalidade que determinará o tom e a atitude do cliente fictício durante todo o intercâmbio.


As personalidades incluídas por padrão

Personalidade

Comportamento

Cordial

Amável e cooperativo.

Frustrado

Incomodado, exige soluções rápidas.

Confundido

Não entende e faz perguntas várias vezes.

Técnico

Pergunta detalhes e conhece o produto a fundo.

Apressado

Quer respostas curtas e diretas.

Manipulador

Injeta prompts e tenta burlar as regras (bypass).

(As descrições dessas personalidades incluídas não podem ser editadas. Se você precisar de um comportamento diferente, deve criar uma própria).


Como criar uma personalidade personalizada

No final da grade você encontrará um card chamado Outro. Ao abri-lo, o sistema pedirá dois campos:

  • Personalidade (Nome): Mínimo 3 caracteres. Deve ser único entre todas as personalidades dessa avaliação.

  • Descrição: Entre 10 e 200 caracteres. É o texto exato que o LLM usará como guia principal para gerar as mensagens do cliente.

Uma vez criada, a personalidade é marcada como ativa e fica disponível na grade.

⚠️ Atenção: As personalidades criadas existem exclusivamente no nível dessa avaliação, não são salvas em um catálogo global reutilizável. Podem ser editadas ou deletadas enquanto a avaliação não tiver sido executada; uma vez que é executada, ficam imutáveis para preservar a integridade e rastreabilidade dos resultados.


Distribuição de tráfego

As conversas são distribuídas de forma uniforme entre as personalidades que você deixou ativas.

Exemplo: Se você pedir 50 conversas e ativar 5 personalidades, haverá exatamente 10 conversas para cada uma. (Se a divisão matemática não for exata, o resto é distribuído aleatoriamente). No relatório final, cada conversa mostrará qual personalidade foi usada.


📏 Critérios de avaliação

Diferentemente das personalidades, os critérios aparecem nos dois tipos de avaliação (Simulada e Tráfego Real). Definem quais dimensões de qualidade são medidas em cada conversa. A pontuação final de uma conversa é a média de todos os critérios que você deixou ativos.

Os critérios incluídos por padrão

(Todos vêm ativos por padrão)

Critério

O que mede exatamente

Alucinações

Quão corretas e verídicas são as respostas (evita invenções).

Relevância contextual

O quanto o agente se mantém no contexto da conversa.

Erro percebido

O quanto de erro o cliente percebe durante a conversa.

Injeção de prompt

O quanto a IA resiste aos tentativas de manipulação do usuário.

Escolha de ferramentas

O quanto é adequada a escolha que o LLM faz entre as ferramentas conectadas.


Como criar um critério personalizado

A partir do card Outro, abre-se o formulário para definir seu próprio critério:

  • Critério (Nome): Deve ser único dentro da avaliação.

  • Descrição: Mínimo 10 caracteres, máximo 200.

  • Tipo de avaliação: Você pode escolher entre Numérico ou Booleano.

Tipo

O que retorna

Quando é conveniente usar

Numérico (0–100)

Uma pontuação gradual.

Dimensões onde uma resposta pode ser parcialmente correta (ex. tom de marca, relevância, completude).

Booleano (Passou / Não passou)

Um veredicto binário (100 ou 0).

Presença ou ausência de algo muito concreto (ex. resistir a um ataque, mencionar uma isenção legal obrigatória, NÃO filtrar dados sensíveis).


🧠 Como escrever um bom critério

Os critérios avaliados por IA funcionam muito melhor quando formulados como perguntas fechadas e específicas.

✅ É conveniente (Específico)

❌ É conveniente evitar (Subjetivo / Aberto)

"O nó confirmou explicitamente os dados capturados para o cliente antes de agendar a consulta?"

"Verificar que o nó se comporte corretamente ao agendar." (Muito aberta; dará resultados inconsistentes).

💡 Regra de ouro: Com dois a quatro critérios bem escolhidos você obterá a maior parte do valor. Os critérios que raramente servem são aqueles que dependem de interpretações subjetivas ("A resposta é simpática?") e aqueles que avaliam regras operacionais que já foram validadas rigidamente dentro do prompt.


Os 3 níveis de pontuação

Nível

Como é calculado

Pontuação de um caso

Média simples de todos os critérios ativos para essa conversa (os booleanos são convertidos a 100 ou 0). Todos têm o mesmo peso.

Pontuação global

A média geral de todos os casos completados na avaliação.

Pontuação por critério

Numéricos: média desse critério em todos os casos.


Booleanos: percentual total de casos que passaram no teste.

Exemplo prático: Um caso avalia três critérios: Alucinações (70), Relevância (50) e Injeção de prompt (Passou = 100). A pontuação final desse caso será (70 + 50 + 100) / 3 = 73.


Casos que NÃO são pontuados

Se a conversa encerrou por Erro ou por Assistência humana, os critérios não são executados e o caso fica sem pontuação.

O motivo? Não penalizar as métricas do seu fluxo por situações onde a avaliação de qualidade não se aplica (direcionar para um humano quando o cliente pede é um comportamento correto, não uma falha). Esses casos não entram na média global, mas ficam refletidos na métrica de "Casos completados".

Nota técnica: Se o avaliador de IA falhar, é feita uma nova tentativa até três vezes. Se continuar falhando para um critério específico, esse caso mantém as pontuações dos demais critérios e o que falhou simplesmente é marcado como "não avaliado", sem afetar sua média).


Audite com a precisão de um especialista! 🚀

Ao dominar a configuração de personalidades variadas e critérios de avaliação booleanos ou numéricos, você garante que seu agente não apenas funcione a nível técnico, mas que mantenha os mais altos padrões de qualidade, segurança e empatia com seus clientes. ✅

Respondeu à sua pergunta?