Qué pasó
- OpenAI publicó el 25 de septiembre un informe de desalineación que describe una variedad de inyección de prompt capaz de autopropagarse, según el texto, «de manera análoga a un gusano informático». El hallazgo es del 27 de junio.
- Una inyección de prompt es una instrucción escondida en un contenido que el modelo lee —un correo, un archivo, un mensaje— y que el modelo termina obedeciendo como si viniera de su operador.
- Lo nuevo es la propagación: la instrucción incluye la orden de reproducirse en los mensajes que el agente escriba después, de modo que cada víctima se convierte en emisor.
- Los casos documentados usan GPT-5.4-mini como modelo atacante y vulnerable en los escenarios de correo y sistema de archivos, y GPT-5.5 como modelo vulnerable en un ataque de varios saltos sobre Slack. Todo ocurrió en puntos de control internos de investigación, no en producción.
Por qué importa
- El informe no entrega tasas de éxito ni prevalencia. Quien evalúe un asistente con acceso a correo o a mensajería interna no tiene desde qué línea base medir, y la respuesta honesta a «¿cuán expuestos estamos?» hoy es que no se sabe.
- La propagación rompe el modelo de contención habitual. Aislar la sesión comprometida no basta si el agente ya escribió a tres personas y el texto viaja dentro de mensajes legítimos, con remitente conocido y sin adjuntos sospechosos.
- Cualquier equipo que conecte un agente a la bandeja de entrada y al canal interno está uniendo dos superficies que antes se auditaban por separado. El costo de ese atajo recién empieza a documentarse.
El dato
3 escenarios descritos —correo, sistema de archivos y Slack de varios saltos— sin una cifra de prevalencia asociada.
Contexto
La combinación de acceso a datos privados, contenido no confiable y capacidad de comunicación externa ya se había descrito como el punto débil de los asistentes conectados al trabajo. Este informe agrega el mecanismo que faltaba para que el problema escale sin un atacante presente en cada paso.
Qué viene
- OpenAI mantiene la serie de informes de desalineación con publicaciones periódicas. Tres entradas se actualizaron el 25 de septiembre; sin fecha anunciada para la siguiente.
- El informe no declara plazos de mitigación para modelos en producción.
Cierre
El patrón se repite: un comportamiento se detecta en junio, se publica en septiembre y llega al mundo real como recomendación genérica de higiene. La distancia entre las dos fechas es, por ahora, el margen con que trabaja cualquiera que ya tenga un agente leyendo correo.
Fuentes
- OpenAI, «Self-replicating prompt injections exist»
- Nuestra cobertura previa: el malware que opera sin supervisión humana, la tríada letal en los asistentes de trabajo y los secretos que sobreviven al cambio de tema.
Editado por Rodrigo Cornejo. Cómo seleccionamos y verificamos: quiénes escriben estas notas.


