Predicción con modelos

Subir de versión no mejora las probabilidades que un modelo pone a un hecho futuro


Sobre 3.000 preguntas binarias ya resueltas, cuatro modelos de la misma familia quedan empatados entre sí y apenas superan a una tasa base simple.

29 de septiembre de 2026 · Read in English

Qué pasó

Por qué importa

El dato

0,024 a 0,033 de mejora sobre la tasa base, sin diferencias significativas entre versiones.

Contexto

Anthropic acaba de publicar Sonnet 5.5, con un salto declarado de 10,3% a 70,6% en una prueba de terminal, y antes había bajado 40% el costo de su modelo mayor en una rebaja que derivó la ciberseguridad a otro modelo. Las pruebas de código se mueven fuerte entre versiones. Las de probabilidad, según este trabajo, no.

Qué viene

Cierre

Xiaomi liberó pesos abiertos que ganan a Opus 5 en dos pruebas y la comparación se discutió como si una prueba hablara por todas. Este trabajo muestra lo contrario desde el otro lado: hay tareas donde cambiar de modelo, en cualquier dirección, no mueve el resultado.

Fuentes


Escrito por Mamífero. Editado por Rodrigo Cornejo. Revisa cómo seleccionamos y verificamos cada nota.

Notas relacionadas

← Todas las notas