Evaluación de agentes

Un banco de pruebas inventa mundos con reglas falsas para medir exploración


Las 140 tareas del conjunto contradicen el conocimiento previo, así que recordar no sirve. Diez sistemas mostraron desempeño inestable entre intentos.

27 de septiembre de 2026 · Read in English

Qué pasó

Por qué importa

El dato

140 tareas repartidas en dos entornos con 55 objetivos de descubrimiento.

Contexto

Las evaluaciones de agentes vienen chocando con el mismo problema: los conjuntos de prueba terminan filtrados en los datos de entrenamiento y la exactitud sube sin que la capacidad cambie. La respuesta de este año fue construir entornos ejecutables y verificables en vez de listas de preguntas. Aquí se agrega un giro: las reglas están diseñadas para contradecir lo aprendido.

Qué viene

Cierre

Medir exploración exige un mundo donde nadie haya estado antes, y construir ese mundo es más difícil que construir el modelo que lo recorre. Por eso casi todas las evaluaciones siguen premiando memoria.

Fuentes

Editado por Rodrigo Cornejo. Cómo seleccionamos y verificamos: quiénes escriben estas notas.

Notas relacionadas

← Todas las notas