Ir al contenido
← Blog

Cómo medir si un asistente de IA acierta

Una prueba con preguntas reales antes de poner el asistente frente a alguien. El marcador no cambió, y esa fue la medición más útil del proyecto.

Le enseñé a mi asistente de IA a desconfiar de su propia búsqueda antes de responder. Lo medí, y el marcador no cambió en nada.

Esa medición fue lo más útil que hice en el proyecto.

El proyecto

En mi portafolio hay un chat que responde preguntas sobre mi carrera. Antes de responder, busca en mi currículum los fragmentos que tienen que ver con la pregunta. Ese diseño tiene nombre: RAG.

Cada fragmento recibe una nota, que es cuánto se parece a la pregunta. Nota alta, fragmento probablemente correcto.

Lo que cambié

Cuando la nota queda en un punto medio, ni buena ni mala, el asistente pasó a preguntarse: "¿lo que encontré responde de verdad?". Si no responde, reescribe la pregunta con otras palabras y busca de nuevo.

Cómo lo probé

Separé 24 preguntas reales y las corrí dos veces, con esa desconfianza activada y desactivada. Para corregir, usé una segunda IA como profesora, comparando cada respuesta con mi currículum.

19 aciertos de 24 las dos veces. Empate.

Lo que solo apareció mirando pregunta por pregunta

La desconfianza casi nunca se activaba. Yo había adivinado la nota a partir de la cual entraba. En la práctica, corría en 3 de las 24 preguntas, y en ninguna de las 5 en que el chat se equivocaba. Miré las notas reales, ajusté, y pasó a correr en 14.

Un error desapareció, y sigue sin aparecer cada vez que lo corro. Una pregunta sobre la experiencia actual se respondía con un trabajo de años atrás. Pasó a responder lo correcto.

Y apareció algo peor que el error original. Sin encontrar la respuesta en el currículum, el asistente iba a buscar en internet y escribía, en primera persona, lugares donde nunca trabajé. Bloqueé ese camino. Hoy, cuando no sabe, dice que no sabe.

Lo que aprendí

Con 24 preguntas, el marcador no prueba casi nada: un acierto más o menos es suerte. Lo que muestra una prueba de ese tamaño es la forma en que el sistema se equivoca. Fue exactamente eso lo que apareció.

Es el mismo cuidado que va en todo asistente que Weft entrega: probar con preguntas reales antes de ponerlo frente a alguien, y de nuevo en cada cambio.

Publicado originalmente en portugués en LinkedIn, donde la conversación sigue en los comentarios.

Lucas Palhares Barbosa

Fundador de Weft Systems. Sobre el fundador

  1. ROI de la IA generativa
  2. RAG falla en las tuberías, no en el modelo
Agendar reuniónServicios