← Blog

Como medir se um assistente de IA acerta

Um teste com perguntas reais antes de colocar o assistente na frente de alguém. O placar não mudou, e essa foi a medição mais útil do projeto.

Ensinei o meu assistente de IA a desconfiar da própria busca antes de responder. Medi, e o placar não mudou nada.

Essa medição foi a coisa mais útil que fiz no projeto.

O projeto

No meu portfólio tem um chat que responde perguntas sobre a minha carreira. Antes de responder, ele procura no meu currículo os trechos que têm a ver com a pergunta. Esse desenho tem nome: RAG.

Cada trecho ganha uma nota, que é o quanto ele se parece com a pergunta. Nota alta, trecho provavelmente certo.

O que eu mudei

Quando a nota fica no meio termo, nem boa nem ruim, o assistente passou a se perguntar: "isso que eu achei responde mesmo?". Se não responde, ele reescreve a pergunta com outras palavras e procura de novo.

Como eu testei

Separei 24 perguntas reais e rodei duas vezes, com essa desconfiança ligada e desligada. Para corrigir, usei uma segunda IA como professora, comparando cada resposta com o meu currículo.

19 acertos de 24 nas duas vezes. Empate.

O que só apareceu olhando pergunta por pergunta

A desconfiança quase nunca ligava. Eu tinha chutado a nota a partir da qual ela entrava. Na prática, ela rodava em 3 das 24 perguntas, e em nenhuma das 5 que o chat errava. Olhei as notas reais, ajustei, e ela passou a rodar em 14.

Um erro sumiu, e continua sumido toda vez que eu rodo. Uma pergunta sobre a experiência atual respondia com um trabalho de anos atrás. Passou a responder o certo.

E apareceu algo pior que o erro original. Sem achar a resposta no currículo, o assistente ia buscar na internet e escrevia, em primeira pessoa, lugares onde eu nunca trabalhei. Bloqueei esse caminho. Hoje, quando não sabe, ele diz que não sabe.

O que eu aprendi

Com 24 perguntas, o placar não prova quase nada: um acerto a mais ou a menos é sorte. O que um teste desse tamanho mostra é o jeito como o sistema erra. Foi exatamente isso que apareceu.

É o mesmo cuidado que vai em todo assistente que a Weft entrega: testar com perguntas reais antes de colocar na frente de alguém, e de novo a cada mudança.

Publicado originalmente no LinkedIn, onde a conversa continua nos comentários.

Lucas Palhares Barbosa

Fundador da Weft Systems. Sobre o fundador

  1. ROI de IA generativa
  2. RAG falha no encanamento, não no modelo
Agendar conversaServiços