Como medir se um assistente de IA acerta
Um teste com perguntas reais antes de colocar o assistente na frente de alguém. O placar não mudou, e essa foi a medição mais útil do projeto.
Ensinei o meu assistente de IA a desconfiar da própria busca antes de responder. Medi, e o placar não mudou nada.
Essa medição foi a coisa mais útil que fiz no projeto.
O projeto
No meu portfólio tem um chat que responde perguntas sobre a minha carreira. Antes de responder, ele procura no meu currículo os trechos que têm a ver com a pergunta. Esse desenho tem nome: RAG.
Cada trecho ganha uma nota, que é o quanto ele se parece com a pergunta. Nota alta, trecho provavelmente certo.
O que eu mudei
Quando a nota fica no meio termo, nem boa nem ruim, o assistente passou a se perguntar: "isso que eu achei responde mesmo?". Se não responde, ele reescreve a pergunta com outras palavras e procura de novo.
Como eu testei
Separei 24 perguntas reais e rodei duas vezes, com essa desconfiança ligada e desligada. Para corrigir, usei uma segunda IA como professora, comparando cada resposta com o meu currículo.
19 acertos de 24 nas duas vezes. Empate.
O que só apareceu olhando pergunta por pergunta
A desconfiança quase nunca ligava. Eu tinha chutado a nota a partir da qual ela entrava. Na prática, ela rodava em 3 das 24 perguntas, e em nenhuma das 5 que o chat errava. Olhei as notas reais, ajustei, e ela passou a rodar em 14.
Um erro sumiu, e continua sumido toda vez que eu rodo. Uma pergunta sobre a experiência atual respondia com um trabalho de anos atrás. Passou a responder o certo.
E apareceu algo pior que o erro original. Sem achar a resposta no currículo, o assistente ia buscar na internet e escrevia, em primeira pessoa, lugares onde eu nunca trabalhei. Bloqueei esse caminho. Hoje, quando não sabe, ele diz que não sabe.
O que eu aprendi
Com 24 perguntas, o placar não prova quase nada: um acerto a mais ou a menos é sorte. O que um teste desse tamanho mostra é o jeito como o sistema erra. Foi exatamente isso que apareceu.
É o mesmo cuidado que vai em todo assistente que a Weft entrega: testar com perguntas reais antes de colocar na frente de alguém, e de novo a cada mudança.
Publicado originalmente no LinkedIn, onde a conversa continua nos comentários.
