Qué pasó
- Un equipo publicó en arXiv el 23 de septiembre una tubería de datos abierta y un tablero interactivo para reunir evidencia de riesgo sistémico bajo el código de buenas prácticas para modelos de propósito general de la Unión Europea.
- El tablero organiza 19 pruebas públicas en las cuatro categorías que fija ese código: amenazas químicas, biológicas, radiológicas y nucleares; ciberofensiva; manipulación dañina; y pérdida de control.
- El hallazgo que sostiene el trabajo: al cambiar la agregación por promedio a agregación por peor caso sobre 18 modelos evaluados, los puntajes caen entre 14 y 37 puntos.
- Los autores validaron el método con jueces automáticos que alcanzan acuerdo de nivel humano (κ entre 0,78 y 0,82) y con una auditoría independiente que confirmó que el 83% de sus perturbaciones preservó el daño original. Una prueba con 21 usuarios mostró más transparencia percibida.
Por qué importa
- El resultado no dice que los modelos sean más peligrosos de lo declarado. Dice que la cifra de seguridad depende de una decisión metodológica que casi nunca se explicita. Entre 14 y 37 puntos de diferencia es un rango donde cabe cualquier conclusión.
- Para quien compra software de IA en Chile o la región, esto cambia la pregunta al proveedor. No es si el modelo pasó la evaluación, es cómo se agregaron los resultados. Un promedio esconde el peor caso, y el peor caso es el que llega a producción un martes cualquiera.
- Y hay una consecuencia para el ecosistema de auditoría que se está armando: si un tablero abierto con 19 pruebas públicas puede mover los puntajes de esa forma, las evaluaciones que las propias compañías reportan sin detallar su agregación valen menos de lo que parecen.
El dato
Entre 14 y 37 puntos de caída en 18 modelos al usar agregación de peor caso en vez de promedio.
Contexto
El marco europeo es el que más lejos llegó en exigir evidencia, aunque su calendario se movió: el bloque aplazó la aplicación de las reglas de alto riesgo. En paralelo, los laboratorios publicaron sus propios criterios para evaluaciones externas, como cuando OpenAI difundió sus prioridades para evaluaciones de terceros sin nombrar a ningún evaluador. Este trabajo es la contraparte abierta.
Qué viene
- Preimpresión sin revisión por pares. El tablero es de código abierto.
- Los autores no anuncian cobertura de modelos adicionales ni frecuencia de actualización.
- Sin plazos anunciados.
Cierre
La discusión sobre seguridad de modelos se ha librado sobre los números publicados. Este trabajo mueve la discusión un paso atrás, a quién elige la fórmula con que esos números se calculan, que hasta ahora ha sido la misma parte que los publica.
Fuentes
- An Open Pipeline and Dashboard for Systemic-Risk Evidence, arXiv 2609.28335, 23 de septiembre de 2026.
N de la R (Rodrigo Cornejo): No entendí mucho. ¿Estamos a salvo?


