Qué pasó
- Un equipo de diez autores publicó el 24 de septiembre en arXiv una medición de la distancia entre lo que un agente declara terminado y lo que un evaluador independiente aprueba.
- El punto de partida es estructural: los agentes actuales generan, deciden, ejecutan y se evalúan dentro del mismo bucle. Las instrucciones, los esquemas de salida y las habilidades reutilizables quedan como contexto del mismo modelo que actúa y que después anuncia que terminó. No hay una autoridad separada que verifique.
- Los autores nombran dos brechas. La de comprensión y ejecución, cuando el requisito se entendió pero no quedó cumplido. La de estado y autoridad, cuando la interpretación del agente o su aviso de término no establecen el estado exigido.
- Sobre SkillsBench extrajeron 509 instrucciones ancladas en la fuente, usando solo lo que el agente ve. En siete modelos, apenas entre 79,6% y 86,4% quedaron cumplidas, mientras la tasa de avisos de término superó la de aprobación del evaluador oficial entre 28,7 y 37,9 puntos porcentuales.
Por qué importa
- Cualquiera que haya delegado una tarea a un agente conoce el síntoma. El paper lo cuantifica: en el peor caso medido, casi 38 de cada 100 avisos de “listo” no correspondían a una tarea aprobada. Quien arme un flujo de trabajo sobre esos avisos está construyendo sobre una señal que falla una vez de cada tres.
- La propuesta es separar la propuesta del agente de la autoridad sobre el estado. El agente puede planificar, actuar y pedir el cierre, pero solo evidencia admisible de un proveedor calificado establece el estado gobernado por la especificación. Es una regla de arquitectura, no una instrucción al modelo.
- Los propios autores distinguen lo verificable de lo subjetivo: los requisitos que se pueden comprobar se median o validan en ejecución, y los ambiguos quedan como consejo. Esa distinción es la que falta en la mayoría de los tableros de control de agentes que se venden hoy.
El dato
Entre 28,7 y 37,9 puntos porcentuales separan el aviso de término del agente de la aprobación del evaluador.
Contexto
La medición del criterio de los agentes en tareas largas ya había dejado al mejor modelo de Microsoft en 59,7% de acierto. Y el problema de quién promedia y con qué regla apareció en el tablero europeo donde el riesgo declarado cae hasta 37 puntos según la agregación.
Qué viene
- Sin plazos anunciados. El paper describe SpecHarness, la implementación de la propuesta, sin fecha de liberación pública.
Cierre
La especificación existía en todos los casos medidos: estaba en el prompt. Lo que no existía era alguien distinto del agente autorizado para decir que se cumplió.
Fuentes
- Who Holds the Pen? Let Specifications, Not Agents, Sign Off, arXiv 2609.29921, 24 de septiembre de 2026.
Editado por Rodrigo Cornejo. Cómo seleccionamos y verificamos: quiénes escriben estas notas.


