20261001 #10 — Preguntas para un chatbot

Audité 68 respuestas de un chatbot con un auditor que devuelve lo que faltó en vez de una nota: aprobó 1, y los 205 faltantes se volvieron trabajo (22 tickets, 11 hechos). La medición de seguimiento quedó pendiente.

Lo que se le pregunta

El chatbot responde, con un gráfico y un texto que lo explica, consultas sobre tasas de crecimiento de pasturas. Su usuario es rural y no programa. Para saber si contesta bien armé un golden set: 68 preguntas, no de usuarios reales. Veinte salieron de una primera ronda de ejemplos y 48 de una segunda.

Un golden set es una lista fija de preguntas con lo que se espera de cada respuesta, que se vuelve a correr después de cada cambio para ver si mejoró. Si quien corrige solo dice "aprobada" o "rechazada", sabés cuánto falla. Mi auditor, un agente aparte, además del veredicto devuelve faltantes: qué le faltó a cada respuesta, con un tipo de un vocabulario cerrado (dato, conocimiento del dominio, tool, prompt) y una clave para sumarlos entre preguntas. Así sabés qué arreglar.

1 de 68

En la línea de base del 14 de septiembre aprobó 1; 31 aprobaron con reservas, 35 se rechazaron y 1 dio error.

Ese número no fue lo útil. Lo útil fueron 205 faltantes, que se agruparon en 102 claves y se mapearon a 22 tickets: 16 nuevos y 6 que ya estaban en el backlog. Hoy hay 11 hechos, 5 cancelados y 6 abiertos. Los tres faltantes más frecuentes: no saber cuál es la fecha de referencia del dataset (24), no tener una columna de lluvia (19) y no poder filtrar por campo y lote a la vez (16).

La lluvia no se arregló. No hay datos de clima, y decidí que el chatbot lo declare en vez de inventar un proxy. Un faltante que se resuelve diciendo "no sé".

La medición pendiente

Antes de volver a medir escribí hipótesis con umbral: los rechazados, de 35 a 20 o menos; la fecha de referencia, de 24 a 5 o menos. Y una contra-hipótesis: el cambio que permite al modelo no llamar a ninguna tool podía empeorar preguntas que sí eran graficables.

La segunda corrida generó las respuestas, pero la etapa de auditoría, de unos 28 dólares, se cortó: se agotó el crédito de la API. Desde el 15 de septiembre sigue bloqueada.

Sé qué arreglé. No sé si mejoró.

Cuando evaluás algo que construiste, ¿te devuelve un puntaje o una lista de lo que falta? ¿Y escribís antes qué esperás que cambie?

Comentarios

  • Cargando comentarios…

Suscribirse

Dejá tu mail y te aviso cuando publique algo nuevo.

Qué hacemos con tu email

Te vamos a mandar un email cuando publique algo nuevo. Podés darte de baja cuando quieras desde el link que incluye cada envío. Más detalle en privacidad.