Futuro AI

Anthropic pierde a un investigador que acusa al sector de apostar con nuestras vidas


Jacob Coxon renunció el 8 de septiembre y el jefe de Alignment Science de la empresa salió a respaldarlo en público con su propia cifra de extinción.

9 de septiembre de 2026

Qué pasó

Hilo en X · 9 de septiembre de 2026 · traducción propia Los bloques 1 a 5 y la respuesta de Hubinger son citas directas. Los bloques 6 y 7 se reproducen en paráfrasis y aparecen marcados: no fue posible verificar su texto completo en el original.
  1. Jacob Coxon@hilbertspaess 1/7
    Renuncié a Anthropic hoy. Pasé los últimos tres años haciendo investigación de preentrenamiento en OpenAI y en Anthropic. Ninguna de las dos empresas está actuando de forma responsable. Van directo a una superinteligencia que se mejora a sí misma y están apostando con nuestras vidas.
  2. Jacob Coxon@hilbertspaess 2/7
    No subestimen el poder de esta tecnología. Pronto serán sistemas superhumanos capaces de hackear cualquier cosa, de transformar cualquier campo de un día para otro y de hacerse de poder y recursos reales. Todos hemos visto el avance en cada uno de esos dominios, y el avance no se está desacelerando.
  3. Jacob Coxon@hilbertspaess 3/7
    Quienes construyen IA creen sinceramente que podría matarnos a todos antes de que termine la década. Esto no es una jugada de marketing. Si acaso, muchos ejecutivos e investigadores senior moderan su formulación ante la prensa para sonar razonables, pero escucho a esas mismas personas expresar miedo en privado. Ninguna otra actividad humana implica este nivel de peligro.
  4. Jacob Coxon@hilbertspaess 4/7
    Una respuesta común es «si de verdad creen esto, por qué siguen construyéndolo». En OpenAI, muchos no han internalizado a fondo lo que está en juego a nivel civilizatorio. En Anthropic se entiende bien lo que está en juego, pero están atrapados en una carrera por llegar primero: creen que nadie más va a actuar de forma responsable, así que deben hacerlo ellos, pese al riesgo.
  5. Jacob Coxon@hilbertspaess 5/7
    Aceptar esta carrera y entrar en el endgame es una apuesta soberbia que no debería lanzarse desde el Slack de una empresa privada. Intentar resolver el alineamiento a la carrera debería exigir una confianza extraordinaria en que no hay mejores trayectorias disponibles.
  6. Jacob Coxon@hilbertspaess 6/7
    No siento que estemos encaminados a evitar una carrera global, lo que podría exigir acciones costosas, como una prohibición temporal de mejorar las capacidades de los modelos.

    Paráfrasis El bloque abre declarándose optimista sobre la coordinación y menciona los incidentes de evaluación de julio como señales de alerta que la vuelven más plausible. Ese tramo no pudo verificarse textualmente.

  7. Jacob Coxon@hilbertspaess 7/7

    Paráfrasis Cierra interpelando a quienes siguen dentro de los laboratorios: que piensen qué les va a exigir de verdad el próximo par de años —incluido lanzar entrenamientos por refuerzo a gran escala sobre sistemas cuyo razonamiento interno no se entiende— y si callar porque igual va a pasar es la respuesta correcta. (No pudo verificarse textualmente).

Respuesta pública · 9 de septiembre de 2026
Evan Hubinger @EvanHub · líder de Alignment Science en Anthropic
Jacob tiene razón: creemos sinceramente que la IA podría matar a todos los humanos. Personalmente creo que es más de 10% dentro de la próxima década. Creo que Anthropic está haciendo todo lo posible, pero todavía no tenemos un plan para resolver el alineamiento de la superinteligencia y no vamos claramente encaminados a tenerlo.

Por qué importa

El dato

Más de 10%. La probabilidad que el líder de Alignment Science de Anthropic asigna, a título personal, a que la IA mate a todos los humanos dentro de la próxima década.

Contexto

No es la primera salida de este tipo. En 2024 renunció Jan Leike, entonces a cargo del alineamiento en OpenAI, y en febrero de 2026 lo hizo Mrinank Sharma, del equipo de salvaguardas de Anthropic. Lo nuevo esta vez es de dónde vino el respaldo: no de un crítico externo, sino del equipo interno que audita el alineamiento. Reportes de prensa sitúan además una presentación confidencial de salida a bolsa de Anthropic días antes del hilo, sin confirmación pública de la empresa.

Qué viene

Cierre

En marzo de 2023 una carta pidió seis meses de pausa y la firmaron mil personas que no entrenaban modelos. Esta vez el número lo puso quien audita el alineamiento de Claude, y sigue adentro.

Fuentes

← Todas las notas