Qué pasó
- Rahul Khedar, Mayank Malhotra y Avinash Karn describen Augur, un sistema que ensaya fuera de línea la reacción a un cambio de producto o de política antes de que salga. Lo enviaron a arXiv el 24 de septiembre de 2026.
- El procedimiento arma un grafo de conocimiento a partir de los documentos del cambio, puebla un mercado de personas simuladas, corre la interacción y devuelve un memo de decisión auditable que recomienda una de cinco acciones.
- Para medirlo construyeron Gold-50: cincuenta episodios reales de producto y política cuyo desenlace ya se conoce, contrastado contra el registro público. Sobre eso puntúan el veredicto de lanzamiento de cinco vías.
- Jueces ciegos de cuatro familias de modelos concluyeron que la reacción sintética recupera entre 67% y 90% de las preocupaciones que el público efectivamente planteó, con el mayor aporte donde la decisión era más difícil.
Por qué importa
- El hallazgo central del paper es incómodo para quien compra herramientas: la mayor parte de la diferencia medida entre modelos comerciales grandes y modelos de pesos abiertos ajustados en casa no venía de la capacidad, venía de una evaluación mal especificada. Con el mismo modelo, los mismos casos y el mismo evaluador, un sistema pasó de 0% a 73% solo por cómo estaba escrito el envoltorio del prompt.
- Definir la taxonomía de decisiones dentro del prompt, sin cambiar de modelo, subió entre 24 y 34 puntos porcentuales a todos los modelos grandes. Quien evalúe proveedores de IA con una prueba propia mal definida va a comprar por una diferencia que no existe.
- Los autores también advierten que la cadena completa amplifica un sesgo sistemático al pesimismo. Un sistema que exagera el riesgo de una campaña es tan costoso como uno que lo ignora, solo que el error no se ve.
El dato
De 0% a 73% de acierto con los mismos pesos, los mismos casos y el mismo evaluador.
Contexto
La inconsistencia de las respuestas según cómo se pregunta ya se había medido en marcas: dos motores de IA nombran la misma marca en 81% y 43% de sus respuestas. Y la pregunta por el criterio, no por la capacidad, es la misma que abrió la prueba de Microsoft donde el mejor modelo acierta 59,7%.
Qué viene
- Sin plazos anunciados. Los autores dicen que la cadena que regenera cada número y figura del paper está disponible a pedido, sin repositorio público ni fecha de publicación.
Cierre
El paper mide una herramienta para ensayar lanzamientos y termina demostrando algo más útil: que buena parte de lo que llamamos diferencia de modelo es diferencia de enunciado.
Fuentes
- Augur: A Synthetic Decision Lab for Rehearsing Reactions to Product and Policy Changes, arXiv 2609.29952, 24 de septiembre de 2026.
Editado por Rodrigo Cornejo. Cómo seleccionamos y verificamos: quiénes escriben estas notas.


