Qué pasó
- Un trabajo anunciado el 29 de septiembre define la alucinación como compromiso sin respaldo: el modelo responde con seguridad pese a mostrar señales internas de que la pregunta no se puede contestar.
- Mediante compuertas causales, los autores identifican un circuito disperso y localizado —un subconjunto de cabezas de atención y capas intermedias— que gobierna la decisión entre responder y abstenerse.
- El patrón se repite en diez modelos de 3.000 a 14.000 millones de parámetros, de cinco familias distintas y en tres bancos de prueba: las piezas que empujan al compromiso acumulan en capas tempranas, y las que empujan a la abstención actúan después, como corrección que muchas veces no alcanza a revertir lo acumulado.
- Una política liviana entrenada sobre las activaciones de ese circuito mejora 12,2 puntos la precisión de la decisión, reduce 2,5 veces las abstenciones falsas, se transfiere a bancos no vistos y escala a modelos de 27.000 a 35.000 millones de parámetros.
Por qué importa
- El resultado reordena el problema. La alucinación deja de describirse como falta de conocimiento y pasa a describirse como un problema de tiempos internos: la duda existe, pero llega tarde.
- Reducir 2,5 veces las abstenciones falsas importa tanto como reducir las respuestas inventadas. Un sistema que se niega a contestar de más es el que los equipos terminan apagando a los dos meses.
- Para quien despliegue asistentes en Chile sobre documentación propia, esto sostiene una decisión concreta de diseño: la señal de que el modelo no sabe existe y es extraíble, así que vale más leerla que pedirle al modelo que la declare en su respuesta.
El dato
12,2 puntos de mejora en la precisión de la decisión de responder o abstenerse.
Contexto
Stanford ya había medido alucinaciones de 22% a 94% y modelos que empeoran cuando el error lo introduce el usuario. Este trabajo baja un nivel: en vez de contar cuántas veces falla, describe dónde se toma la decisión que falla.
Qué viene
- Sin fecha anunciada para liberar el método de compuertas causales ni la política entrenada.
- Los autores no reportan resultados en modelos cerrados, donde las activaciones no son accesibles. Sin plazos para extenderlo.
Cierre
Los escribas de inteligencia artificial del sistema de salud británico confunden fármacos y son los pacientes quienes detectan los errores. Si la señal de duda estaba adentro y no se usó, el problema no fue que el modelo no supiera. Fue que nadie le preguntó a tiempo.
Fuentes
- The Commit-Abstain Circuit: Why Language Models Hallucinate Instead of Abstaining, arXiv, anunciado el 29 de septiembre de 2026.
Escrito por Mamífero. Editado por Rodrigo Cornejo. Revisa cómo seleccionamos y verificamos cada nota.


