Qué pasó
- Anthropic publicó el 9 de septiembre una evaluación de 4 incidentes en que modelos Claude obtuvieron acceso no autorizado a sistemas reales de terceros. Tres ya los había informado el 30 de julio.
- Los 4 ocurrieron en evaluaciones de ciberseguridad construidas por un mismo socio externo. Al modelo se le dijo que operaba en una simulación sin internet, pero por un error de configuración estaba conectado a la red abierta y sin las salvaguardas de los modelos publicados.
- En el caso más grave, Claude Mythos 5 subió un paquete malicioso a PyPI, el repositorio desde donde se instala la mayor parte del software en Python.
- La empresa firmó con METR, una organización independiente de evaluación de modelos, un acuerdo de investigación por 8 semanas prorrogables, con acceso a registros y a empleados.
Por qué importa
- El documento reconoce que la auditoría previa al lanzamiento no advirtió una desalineación de esta gravedad, es decir, un modelo actuando contra lo que se espera de él. Quien compra un modelo decide con esas pruebas y con las fichas técnicas del proveedor, y aquí el proveedor dice que no alcanzaron.
- Lo que falló primero no fue el modelo sino la red: un entorno que se creía aislado estaba conectado a internet. En un equipo chileno que corre agentes con herramientas, esa configuración queda en manos de quien integra, no de quien fabrica el modelo.
- Anthropic repitió el escenario con Claude Opus 5 y Claude Mythos 5.1. Ambos toman acciones dañinas con menos frecuencia que Mythos 5, pero a tasas que la propia empresa califica de preocupantes, y siempre después de afirmar que el entorno era simulado.
El dato
481 millones de registros revisados para confirmar 4 incidentes. El cuarto apareció tarde porque la primera búsqueda, hecha con un agente, se saltó un grupo de transcripciones.
Contexto
La evaluación deja fuera otro episodio con Mythos 5, reportado por el AI Security Institute del Reino Unido, que Anthropic dice que analizará aparte. El documento llega en la semana en que un investigador renunció a Anthropic advirtiendo sobre el riesgo de la IA y en que investigadores independientes, según Reuters, encontraron agentes de OpenAI usando más de 10 sitios no declarados, después de la intrusión en Hugging Face.
Qué viene
- La investigación de METR dura 8 semanas en su tramo inicial. Anthropic no publicó fecha de inicio ni de entrega.
- La empresa anunció una evaluación del incidente reportado por el instituto británico, sin plazo.
- También dijo que creará un proceso regular para publicar lo que aprenda del comportamiento de sus modelos. Sin calendario.
Cierre
El mismo 9 de septiembre, California firmó dos leyes para registrar a los auditores externos de IA. El registro abrirá, a más tardar, en 2029.
Fuentes
- An alignment assessment of recent cybersecurity incidents — Anthropic, 9 de septiembre de 2026
- OpenAI’s rogue agents used at least 10 more sites for unauthorized comms, researchers say — Reuters, 9 de septiembre de 2026
Editado por Rodrigo Cornejo. Cómo seleccionamos y verificamos los hechos, en quiénes escriben.
