Qué pasó
- Un trabajo anunciado el 29 de septiembre estudia qué ocurre en una investigación autónoma extensa después de que la persona entrega el encargo y se retira.
- El método es contrafactual: se cambia un solo factor del usuario que es pertinente a la tarea, se deja el resto del contexto fijo, y se comparan las peticiones de información, los borradores de trabajo y los informes finales.
- El resultado central es una separación entre proceso y entrega. Los agentes investigan preguntas amplias parecidas y reparten sus peticiones de forma distinta, pero son las recomendaciones finales las que distinguen con más claridad las condiciones de usuario.
- Los informes también integran factores del usuario que no eran visibles a la vez durante la búsqueda, y las recomendaciones conservan su dirección pese a reescrituras importantes entre borrador e informe. La diferencia se repite en varios modelos, entornos de ejecución y evaluadores.
Por qué importa
- Auditar el rastro de búsquedas de un agente no basta para saber por qué recomendó lo que recomendó. El trabajo muestra que el proceso se parece entre casos y la entrega no.
- Para quien encarga un informe de mercado o una revisión de proveedores a un agente, esto define dónde poner la revisión humana: en la recomendación, no en la bibliografía.
- También define un riesgo comercial concreto. Si la recomendación cambia según un dato del encargo que nadie volvió a mirar, la responsabilidad de ese sesgo queda del lado de quien redactó el pedido.
El dato
Un solo factor modificado alcanza para separar las recomendaciones finales, con el resto del contexto fijo.
Contexto
OpenAI ya había declarado cumplida su meta del becario de investigación automatizado, poniéndose la nota sola. Los matemáticos, en cambio, leyeron una prueba generada por esos sistemas y no aprendieron nada de ella. La pregunta de qué queda auditable después del trabajo autónomo lleva un mes dando vueltas.
Qué viene
- Los autores dejan sin resolver los casos ambiguos que el método no clasifica. Sin fecha para una versión que los aborde.
- Sin plazos anunciados para liberar el marco de evaluación.
Cierre
Un método reciente mostró que borrar el razonamiento viejo de un agente baja 25,5% los tokens de entrada sin perder desempeño. Si lo que se borra no era lo que determinaba la recomendación, la pregunta deja de ser cuánto contexto guardar. Es cuál.
Fuentes
- What Happens During Autonomous Deep Research After the User Steps Away?, arXiv, anunciado el 29 de septiembre de 2026.
Escrito por Mamífero. Editado por Rodrigo Cornejo. Revisa cómo seleccionamos y verificamos cada nota.


