Qué pasó
- Un trabajo anunciado el 29 de septiembre evalúa si cambiar de versión de modelo mejora las estimaciones de probabilidad sobre preguntas de mercados de predicción.
- El banco reúne 3.000 preguntas binarias ya resueltas en nueve ámbitos. Se probaron seis variantes de Claude y Qwen con un protocolo de cero ejemplos y solo el enunciado.
- En el segmento posterior al corte de entrenamiento, los cuatro modelos de Claude anotan entre 0,183 y 0,192 de puntaje Brier, mejorando entre 0,024 y 0,033 sobre un predictor de tasa base. Qwen 32B no supera de forma significativa esa referencia.
- La conclusión que ordena el paper: las diferencias entre categorías de evento dentro de un mismo modelo son mayores que las diferencias entre variantes de Claude. Subir de versión o de gama no produjo mejoras significativas bajo este protocolo.
Por qué importa
- La comparación contra una tasa base es lo que casi nunca aparece en los anuncios de lanzamiento. Sin ella, una mejora de 0,03 puede leerse como un salto o como ruido, y nadie puede distinguirlo.
- Para un equipo que use estos modelos para estimar demanda, riesgo de un proveedor o probabilidad de que una campaña ande, el resultado es directo: no vale la pena pagar por la gama alta para esa tarea.
- Las diferencias entre ámbitos importan más que las diferencias entre modelos. Conviene medir en el ámbito propio y no heredar la elección de un promedio publicado.
El dato
0,024 a 0,033 de mejora sobre la tasa base, sin diferencias significativas entre versiones.
Contexto
Anthropic acaba de publicar Sonnet 5.5, con un salto declarado de 10,3% a 70,6% en una prueba de terminal, y antes había bajado 40% el costo de su modelo mayor en una rebaja que derivó la ciberseguridad a otro modelo. Las pruebas de código se mueven fuerte entre versiones. Las de probabilidad, según este trabajo, no.
Qué viene
- Sin fecha anunciada para liberar el banco de 3.000 preguntas resueltas.
- Los autores no evaluaron modelos de otras familias frontera. Sin plazos para extenderlo.
Cierre
Xiaomi liberó pesos abiertos que ganan a Opus 5 en dos pruebas y la comparación se discutió como si una prueba hablara por todas. Este trabajo muestra lo contrario desde el otro lado: hay tareas donde cambiar de modelo, en cualquier dirección, no mueve el resultado.
Fuentes
- Can LLMs Predict the Future? A Brier Score Analysis of Prediction Markets, arXiv, anunciado el 29 de septiembre de 2026.
Escrito por Mamífero. Editado por Rodrigo Cornejo. Revisa cómo seleccionamos y verificamos cada nota.


