Passar para o conteúdo principal

🧪 Avaliações: criar e executar - Cortex

Garanta a qualidade do seu fluxo com métricas reais. Descubra como criar e executar avaliações automatizadas no Cortex para testar seu agente, seja gerando conversas com Inteligência Artificial ou analisando seu tráfego real de produção.

São testes automatizados que executam centenas de conversas contra o fluxo e as pontuam segundo critérios definidos, utilizando conversas geradas por IA ou tráfego real da sua operação.

⚖️ As duas origens

Você pode executar avaliações utilizando duas fontes distintas. Ambas compartilham exatamente a mesma visualização de resultados e os mesmos critérios de avaliação, mas têm propósitos diferentes:

Característica

🤖 Simular com IA

👥 Tráfego em vivo

O que avalia

Conversas sintéticas geradas contra o fluxo.

Conversas reais já encerradas.

Quando usar

Antes de publicar, para validar alterações.

Em produção, para detectar problemas de qualidade.

Controle sobre os casos

Alto: Você define o comportamento a avaliar e os perfis de cliente.

Nenhum: São as conversas reais que ocorreram.


📍 Onde estão e como é a tabela?

Para acessar este módulo, o caminho é:

Canvas → barra superior → ícone de Avaliações.

Ao clicar, abre-se um painel lateral direito com a tabela de todas as avaliações do fluxo. Este painel pode ser fechado sem que você perca o contexto do seu trabalho na canvas.


Detalhes da tabela

A tabela se atualiza em tempo real quando há avaliações em curso e mostra as seguintes colunas:

Coluna

Conteúdo

Nome

O que você atribuiu ao criá-la.

Origem

Simulado ou Em vivo.

Casos

Quantidade total de conversas avaliadas.

Status

Concluído, Avaliando, Erro ou Cancelado.

Pontuação

Global em 100. (Aparece vazio enquanto avalia).

Data de realização

Ordenadas por mais recente primeiro.


Ações por linha e Permissões

A partir da tabela você pode: Ver resultados, Duplicar configuração (abre o formulário com os parâmetros já precarregados), Cancelar (se está em execução) e Eliminar (se já terminou). Tenha em conta que as avaliações eliminadas não podem ser recuperadas.

  • Permissões: Qualquer usuário com acesso de leitura pode ver os resultados. Apenas os editores podem criar, cancelar e eliminar avaliações.

🤖 Criar uma avaliação com IA

  1. Clique em + Nova avaliação.

  2. Escolha a opção Simular com IA.

  3. Preencha o formulário com os seguintes campos.

  4. Clique em Executar avaliação.

Campo

Obrigatório

Descrição

Nome

Sim

Mínimo 3 caracteres, único dentro do fluxo.

Que comportamento você quer avaliar

Sim

(Mínimo 20 caracteres). Descreva o caso de uso exato; a IA gerará conversas que coloquem à prova esse comportamento.

Quantidade de conversas

Sim

10, 20, 50, 100 ou outro valor entre 1 e 500 (padrão 50).

Personalidades

Pelo menos uma

Perfis de cliente simulado (ver seção 7.5).

Critérios

Pelo menos um

Dimensões de qualidade a medir (ver seção 7.5).

(As personalidades e critérios vêm pré-marcados com um conjunto recomendado, mas você pode desmarcá-los e adicionar os seus).


👥 Criar uma avaliação sobre tráfego real

O percurso é o mesmo, mas escolhendo Tráfego em vivo.

Campo

Obrigatório

Descrição

Nome

Sim

Mínimo 3 caracteres, único dentro do fluxo.

Máximo de conversas

Sim

10, 20, 50, 100 ou outro valor entre 1 e 1000 (padrão 50).

Máximo de tempo

Sim

1 dia, 3 dias, 1 semana, 2 semanas ou 1 mês (padrão 1 semana).

Critérios

Pelo menos um

Os mesmos que na avaliação simulada.

(Nota: Aqui não há "personalidades" nem "comportamento a avaliar", já que as conversas provêm de clientes reais e já existem).

Como se selecionam as conversas

São tomadas conversas já encerradas que tenham ocorrido dentro da janela temporal configurada, até alcançar o máximo indicado.

A amostragem é completamente aleatória dentro dessa janela (não cronológica) para evitar vieses em relação às primeiras conversas do dia. Se não houver conversas suficientes para atingir o máximo, a avaliação executa com as que estiverem disponíveis e o informa nos resultados.


⚡ Execução

Ao pressionar Executar, a modal se fecha e aparece um aviso de que a avaliação começou. A nova linha aparecerá com status "Avaliando".

A avaliação sempre executa em segundo plano. Você pode continuar trabalhando na canvas, simular o fluxo ou navegar para outra parte do produto sem interrompê-la.

O que acontece com cada conversa simulada

Para cada conversa se inicia uma simulação independente:

  • Um LLM com o perfil da personalidade atribuída atua como cliente.

  • O fluxo real — em sua versão rascunho — lhe responde utilizando todas as suas ferramentas e sua base de conhecimento.

  • A conversa termina quando se cumpre uma condição de encerramento.

  • Cada interação é salva com seu timestamp, função, conteúdo, invocações a ferramentas e latência.

(Uma vez concluídas todas as conversas, os critérios de qualidade são executados em cada uma. As conversas são distribuídas de forma uniforme; ex. se você solicita 50 conversas e 5 personalidades, serão atribuídas 10 por personalidade).


Como terminam as conversas simuladas

Após cada interação do cliente simulado, o mecanismo avalia cinco condições em ordem. A primeira que se cumpre, encerra a conversa:

Condição

Quando se dispara

Motivo do Encerramento

Erro de runtime

Timeout (+40 seg), erro de ferramenta não tratado, erro de modelo.

Erro

Cliente satisfeito

Sinais explícitos de encerramento por satisfação.

Resolvida

Cliente abandona

Sinais de frustração terminal ou perda de interesse.

Abandono

Máximo de turnos

Se chega a 10 turnos do cliente sem que se cumpra nada anterior.

Abandono

Nota: Nas avaliações sobre tráfego real não é aplicada nenhuma condição artificial; o encerramento é tomado diretamente do ramo de finalização com o qual a conversa original foi encerrada em produção).


🔔 Estados, Notificações e Versões

  • Notificações: Quando a avaliação termina, aparece uma notificação com a pontuação final e um link direto aos resultados.

  • Tratamento de erros: Se uma conversa individual falhar durante a simulação, fica registrada com encerramento de "erro", mas não quebra a avaliação completa (a taxa de erro é exposta como métrica nos resultados).

  • Cancelamento: Ao cancelar uma avaliação em execução, as conversas que já foram concluídas são conservadas e ficam disponíveis para revisão.


Que versão é avaliada exatamente?

Ao pressionar Executar, o mecanismo toma uma cópia imutável da sua versão rascunho naquele exato segundo (prompt, conexões, ferramentas, base de conhecimento, configuração global e modelo). Se depois você modificar o fluxo, a avaliação em execução não é afetada, já que continua executando contra a cópia salva.

💡 Dica de Análise: Esta cópia imutável é o que permite comparar resultados de forma precisa entre diferentes versões. Cada avaliação fica atada à configuração exata com a qual foi executada, fazendo com que um resultado antigo continue sendo 100% interpretável meses depois.


Meça, ajuste e melhore continuamente! 🚀

As avaliações automatizadas são o passo definitivo para garantir que seu agente funcione com excelência em escala. Seja testando casos limite com IA antes de ir para a produção ou auditando seu tráfego real para detectar áreas de melhoria, esta ferramenta oferece a visibilidade necessária para aperfeiçoar seus fluxos conversacionais. ✅

Respondeu à sua pergunta?