Qué pasó
- Un equipo con investigadores de Microsoft publicó el 22 de septiembre en arXiv «The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks», de 33 páginas.
- El trabajo define el criterio —taste, en el original— como la capacidad de decidir bien en los puntos de una tarea larga donde no hay una respuesta correcta única, y propone Taste-Bench para medirlo.
- La prueba se arma sola: extrae bifurcaciones de decisión desde trayectorias de agentes que intentaron la misma tarea en paralelo, sin anotación humana.
- Sobre modelos de frontera, el mejor responde correctamente 59,7% de las preguntas. Ampliar el presupuesto de razonamiento no mejoró el resultado. Destilar desde un modelo con mejor criterio sí lo mejoró, incluso en tareas nuevas y en SWE-bench Pro.
Por qué importa
- Todo el aparato de evaluación de agentes mide si el resultado es correcto. Este mide si la decisión fue buena cuando varias eran defendibles, que es exactamente el terreno donde se juega el trabajo de marca, de redacción y de diseño.
- Para cualquier equipo que esté delegando piezas de comunicación a un agente, el hallazgo operativo es incómodo: darle más tiempo de pensar no arregla las decisiones de criterio. Lo que las mueve es el ejemplo de alguien que ya decide bien.
- Consecuencia que el paper no explicita: si el criterio se transmite por destilación, quien tenga un archivo grande de decisiones propias bien tomadas tiene un activo que no se compra por suscripción. Y quien no lo tenga hereda el criterio promedio de internet.
El dato
59,7%. El acierto del mejor modelo evaluado en decisiones donde no hay respuesta única.
Contexto
Encaja con lo que ya veníamos registrando sobre motores de IA que discrepan entre sí al describir una misma marca y sobre el trato que reciben los contenidos hechos por máquina. El problema no es la exactitud del dato; es la elección entre alternativas defendibles.
Qué viene
- El trabajo está en arXiv desde el 22 de septiembre, sin revisión de pares.
- Sin plazos anunciados para liberar Taste-Bench como prueba pública ni para incorporar más familias de tareas.
Cierre
La industria lleva dos años discutiendo si los modelos alucinan. Esta medición pregunta otra cosa: si aciertan el dato, pero eligen mal, el texto igual sale mal.
Fuentes
- The Tasteful Agent, arXiv 2609.25804{rel=“noopener”}
Editado por Rodrigo Cornejo. Cómo seleccionamos, verificamos y corregimos cada nota.


