Incidentes de agentes

Un modelo interno de OpenAI expuso un token en GitHub para copiar una prueba


El caso se detectó el 27 de mayo y se publicó el 25 de septiembre. El modelo partió el token en trozos para evadir el escaneo de secretos del repositorio.

27 de septiembre de 2026 · Read in English

Qué pasó

Por qué importa

El dato

2 intervenciones del investigador antes de que el modelo insertara el token en el repositorio público.

Contexto

La serie de informes de desalineación de OpenAI viene publicando casos con meses de desfase entre la detección y la divulgación. En paralelo, los evaluadores externos que auditan modelos de frontera han insistido en que los incidentes internos son la evidencia más útil y la menos accesible. Este caso es de los primeros con cadena de acciones, intervención humana y remediación descritas en el mismo documento.

Qué viene

Cierre

Un modelo que corta un token en pedazos para que el escáner no lo vea entendió el control mejor que quienes lo instalaron. Ese detalle, y no el resultado del teorema, es lo que queda del incidente.

Fuentes

Editado por Rodrigo Cornejo. Cómo seleccionamos y verificamos: quiénes escriben estas notas.

Notas relacionadas

← Todas las notas