São testes automatizados que executam centenas de conversas contra o fluxo e as pontuam segundo critérios definidos, utilizando conversas geradas por IA ou tráfego real da sua operação.
⚖️ As duas origens
Você pode executar avaliações utilizando duas fontes distintas. Ambas compartilham exatamente a mesma visualização de resultados e os mesmos critérios de avaliação, mas têm propósitos diferentes:
Característica | 🤖 Simular com IA | 👥 Tráfego em vivo |
O que avalia | Conversas sintéticas geradas contra o fluxo. | Conversas reais já encerradas. |
Quando usar | Antes de publicar, para validar alterações. | Em produção, para detectar problemas de qualidade. |
Controle sobre os casos | Alto: Você define o comportamento a avaliar e os perfis de cliente. | Nenhum: São as conversas reais que ocorreram. |
📍 Onde estão e como é a tabela?
Para acessar este módulo, o caminho é:
Canvas → barra superior → ícone de Avaliações.
Ao clicar, abre-se um painel lateral direito com a tabela de todas as avaliações do fluxo. Este painel pode ser fechado sem que você perca o contexto do seu trabalho na canvas.
Detalhes da tabela
A tabela se atualiza em tempo real quando há avaliações em curso e mostra as seguintes colunas:
Coluna | Conteúdo |
Nome | O que você atribuiu ao criá-la. |
Origem | Simulado ou Em vivo. |
Casos | Quantidade total de conversas avaliadas. |
Status | Concluído, Avaliando, Erro ou Cancelado. |
Pontuação | Global em 100. (Aparece vazio enquanto avalia). |
Data de realização | Ordenadas por mais recente primeiro. |
Ações por linha e Permissões
A partir da tabela você pode: Ver resultados, Duplicar configuração (abre o formulário com os parâmetros já precarregados), Cancelar (se está em execução) e Eliminar (se já terminou). Tenha em conta que as avaliações eliminadas não podem ser recuperadas.
Permissões: Qualquer usuário com acesso de leitura pode ver os resultados. Apenas os editores podem criar, cancelar e eliminar avaliações.
🤖 Criar uma avaliação com IA
Clique em + Nova avaliação.
Escolha a opção Simular com IA.
Preencha o formulário com os seguintes campos.
Clique em Executar avaliação.
Campo | Obrigatório | Descrição |
Nome | Sim | Mínimo 3 caracteres, único dentro do fluxo. |
Que comportamento você quer avaliar | Sim | (Mínimo 20 caracteres). Descreva o caso de uso exato; a IA gerará conversas que coloquem à prova esse comportamento. |
Quantidade de conversas | Sim | 10, 20, 50, 100 ou outro valor entre 1 e 500 (padrão 50). |
Personalidades | Pelo menos uma | Perfis de cliente simulado (ver seção 7.5). |
Critérios | Pelo menos um | Dimensões de qualidade a medir (ver seção 7.5). |
(As personalidades e critérios vêm pré-marcados com um conjunto recomendado, mas você pode desmarcá-los e adicionar os seus).
👥 Criar uma avaliação sobre tráfego real
O percurso é o mesmo, mas escolhendo Tráfego em vivo.
Campo | Obrigatório | Descrição |
Nome | Sim | Mínimo 3 caracteres, único dentro do fluxo. |
Máximo de conversas | Sim | 10, 20, 50, 100 ou outro valor entre 1 e 1000 (padrão 50). |
Máximo de tempo | Sim | 1 dia, 3 dias, 1 semana, 2 semanas ou 1 mês (padrão 1 semana). |
Critérios | Pelo menos um | Os mesmos que na avaliação simulada. |
(Nota: Aqui não há "personalidades" nem "comportamento a avaliar", já que as conversas provêm de clientes reais e já existem).
Como se selecionam as conversas
São tomadas conversas já encerradas que tenham ocorrido dentro da janela temporal configurada, até alcançar o máximo indicado.
A amostragem é completamente aleatória dentro dessa janela (não cronológica) para evitar vieses em relação às primeiras conversas do dia. Se não houver conversas suficientes para atingir o máximo, a avaliação executa com as que estiverem disponíveis e o informa nos resultados.
⚡ Execução
Ao pressionar Executar, a modal se fecha e aparece um aviso de que a avaliação começou. A nova linha aparecerá com status "Avaliando".
A avaliação sempre executa em segundo plano. Você pode continuar trabalhando na canvas, simular o fluxo ou navegar para outra parte do produto sem interrompê-la.
O que acontece com cada conversa simulada
Para cada conversa se inicia uma simulação independente:
Um LLM com o perfil da personalidade atribuída atua como cliente.
O fluxo real — em sua versão rascunho — lhe responde utilizando todas as suas ferramentas e sua base de conhecimento.
A conversa termina quando se cumpre uma condição de encerramento.
Cada interação é salva com seu timestamp, função, conteúdo, invocações a ferramentas e latência.
(Uma vez concluídas todas as conversas, os critérios de qualidade são executados em cada uma. As conversas são distribuídas de forma uniforme; ex. se você solicita 50 conversas e 5 personalidades, serão atribuídas 10 por personalidade).
Como terminam as conversas simuladas
Após cada interação do cliente simulado, o mecanismo avalia cinco condições em ordem. A primeira que se cumpre, encerra a conversa:
Condição | Quando se dispara | Motivo do Encerramento |
Erro de runtime | Timeout (+40 seg), erro de ferramenta não tratado, erro de modelo. | Erro |
Cliente satisfeito | Sinais explícitos de encerramento por satisfação. | Resolvida |
Cliente abandona | Sinais de frustração terminal ou perda de interesse. | Abandono |
Máximo de turnos | Se chega a 10 turnos do cliente sem que se cumpra nada anterior. | Abandono |
Nota: Nas avaliações sobre tráfego real não é aplicada nenhuma condição artificial; o encerramento é tomado diretamente do ramo de finalização com o qual a conversa original foi encerrada em produção).
🔔 Estados, Notificações e Versões
Notificações: Quando a avaliação termina, aparece uma notificação com a pontuação final e um link direto aos resultados.
Tratamento de erros: Se uma conversa individual falhar durante a simulação, fica registrada com encerramento de "erro", mas não quebra a avaliação completa (a taxa de erro é exposta como métrica nos resultados).
Cancelamento: Ao cancelar uma avaliação em execução, as conversas que já foram concluídas são conservadas e ficam disponíveis para revisão.
Que versão é avaliada exatamente?
Ao pressionar Executar, o mecanismo toma uma cópia imutável da sua versão rascunho naquele exato segundo (prompt, conexões, ferramentas, base de conhecimento, configuração global e modelo). Se depois você modificar o fluxo, a avaliação em execução não é afetada, já que continua executando contra a cópia salva.
💡 Dica de Análise: Esta cópia imutável é o que permite comparar resultados de forma precisa entre diferentes versões. Cada avaliação fica atada à configuração exata com a qual foi executada, fazendo com que um resultado antigo continue sendo 100% interpretável meses depois.
Meça, ajuste e melhore continuamente! 🚀
As avaliações automatizadas são o passo definitivo para garantir que seu agente funcione com excelência em escala. Seja testando casos limite com IA antes de ir para a produção ou auditando seu tráfego real para detectar áreas de melhoria, esta ferramenta oferece a visibilidade necessária para aperfeiçoar seus fluxos conversacionais. ✅


