Qué pasó
- Un trabajo publicado en arXiv el 24 de septiembre propone ICLR, un método para descartar el razonamiento acumulado de un agente sin degradar su desempeño. Firman Mingxuan Wang, Fei Luo, Bo Wang y seis autores más.
- El método no requiere entrenamiento y opera en línea. Evalúa cada tramo de razonamiento con una medida de entropía calculada por un modelo auxiliar congelado, y deja intactas las acciones, las llamadas a herramientas y las observaciones.
- Sobre 260 tareas de WorkBuddyBench, la recompensa promedio sube de 0,699 a 0,718 mientras caen los tokens de entrada (25,5%), los de salida (14,4%) y las lecturas de caché (33,3%).
- Los autores describen un efecto que llaman amplificación de trayectoria: borrar razonamiento en un punto produce cambios de cómputo desproporcionados en las interacciones siguientes.
- La conclusión que ofrecen: el razonamiento ya registrado se vuelve reemplazable cuando la información derivada que importa ya pasó al código, a los archivos, a las salidas de herramientas o a las respuestas del entorno.
Por qué importa
- El costo de un agente de horizonte largo está dominado por el contexto que arrastra, no por la dificultad de la tarea. Un recorte de un cuarto en tokens de entrada cambia la aritmética de cualquier proceso que corra miles de veces al mes.
- La condición que los autores identifican es la parte reutilizable: si la conclusión quedó escrita en un archivo o en la salida de una herramienta, el razonamiento que la produjo es descartable. Eso es una regla de diseño, no un truco de compresión, y se puede aplicar sin adoptar el método.
- Para equipos que facturan por consumo de inferencia, el dato de la caída en lecturas de caché es el más directo: 33,3% menos en la partida que suele quedar fuera de las estimaciones iniciales.
El dato
33,3% menos lecturas de caché, la reducción más grande de las tres medidas.
Contexto
Las estrategias de compresión de contexto venían resumiendo el historial completo, con el problema conocido de que un resumen puede introducir errores que el agente después trata como hechos. Este trabajo cambia el criterio: en vez de resumir todo, distingue qué parte del historial es estado de trabajo y qué parte es registro permanente, y descarta solo la primera.
Qué viene
- El trabajo está disponible en arXiv desde el 24 de septiembre. Sin plazos anunciados para liberar el código ni para pruebas en entornos de producción.
Cierre
Un agente que recuerda todo lo que pensó paga por recordarlo en cada paso siguiente. Este trabajo pone número a algo que ya se sospechaba: buena parte de ese archivo no sirve para nada una vez que el resultado quedó escrito en otra parte.
Fuentes
- «When Can Agents Forget Their Reasoning?», arXiv 2609.29875
- Nuestra cobertura previa: los agentes que declaran tareas incompletas como terminadas, los entornos aislados en la nube de Docker y el precio por horario de DeepSeek Flash.
Editado por Rodrigo Cornejo. Cómo seleccionamos y verificamos: quiénes escriben estas notas.


