Qué pasó
- El Instituto de Inteligencia Artificial Centrada en las Personas de la Universidad de Stanford publicó el 14 de abril de 2026 la novena edición de su informe anual sobre el estado de la IA.
- En un nuevo indicador de exactitud, las tasas de alucinación de 26 modelos punteros van de 22% a 94%.
- El informe documenta que la exactitud de GPT-4o cayó de 98,2% a 64,4% en ese indicador, y la de DeepSeek R1 de más de 90% a 14,4%.
- El hallazgo más específico es de encuadre: cuando una afirmación falsa se presenta como algo que cree otra persona, los modelos la manejan bien. Cuando se presenta como algo que cree el propio usuario, el desempeño se desploma.
Por qué importa
- Quien redacte con un asistente está en el peor de los dos escenarios medidos. Al pedir ayuda uno describe su propia lectura del asunto, y esa es precisamente la formulación con la que el modelo deja de corregir. La herramienta acompaña el error en lugar de detenerlo.
- La consecuencia operativa es que revisar la salida no basta. Hay que revisar también la premisa que uno metió en la instrucción, porque el modelo tuvo pocos incentivos para discutirla.
- El rango de 22% a 94% desarma la idea de que los modelos son intercambiables. Entre el mejor y el peor de la muestra hay una diferencia de más de setenta puntos en el mismo indicador.
- Los desarrolladores publican resultados de capacidad con constancia y muy poco sobre exactitud, sesgo o transparencia. Quien elige proveedor compara lo que está publicado, y lo que está publicado es la mitad favorable.
El dato
362. Los incidentes de IA documentados durante 2025, frente a 233 en 2024.
Contexto
El informe registra además que los cargos de gobernanza específicos de IA crecieron 17% en 2025 y que la proporción de empresas sin ninguna política de uso responsable bajó de 24% a 11%. Los obstáculos declarados para implementarla son la falta de conocimiento (59%), el presupuesto (48%) y la incertidumbre regulatoria (41%).
Qué viene
- Sin plazos anunciados. El informe se publica una vez al año; la décima edición correspondería a 2027.
Cierre
Investigaciones recientes citadas en el mismo documento encontraron que mejorar una dimensión del uso responsable degrada otra de forma consistente: entrenar por seguridad cuesta exactitud. La disyuntiva no está resuelta y ya se está vendiendo como si lo estuviera.
