Qué pasó
- Un grupo encabezado por Curtis Northcutt publicó en arXiv el 23 de septiembre StudentBench, una plataforma y suite de evaluación para comparar tutoría humana con tutoría de modelos de lenguaje.
- El estudio siguió a 2.383 participantes en preparación para el GRE y recogió más de 175.000 interacciones entre estudiantes y sistemas de IA.
- El resultado central, según el propio artículo: la tutoría de IA resultó estadísticamente equivalente a la tutoría humana experta en ganancia de aprendizaje, con p = 0,015. En cinco de siete dominios evaluados los tutores de IA superaron a los humanos.
- El costo por punto porcentual ganado fue de US$ 0,0052 con IA y US$ 4,81 con tutor humano. Los autores también midieron que menores tiempos de respuesta se asociaron a más participación del estudiante.
Por qué importa
- El hallazgo no es que la IA enseñe mejor. Es que enseña igual por una fracción del gasto, y eso convierte una discusión pedagógica en una discusión presupuestaria. Los presupuestos se resuelven más rápido.
- Para sistemas educativos de la región, donde la tutoría particular es un gasto de bolsillo que separa a quien puede pagarla de quien no, el dato de costo es el que va a mover decisiones. Una preparación que cuesta centavos por punto redefine quién accede a un puntaje competitivo.
- Hay un límite que el propio diseño impone y conviene decirlo: se midió preparación para una prueba estandarizada, con contenido acotado y respuestas correctas conocidas. Extrapolar eso a la enseñanza escolar es una afirmación que el estudio no respalda.
El dato
US$ 0,0052 contra US$ 4,81. Es el costo de cada punto porcentual de mejora, según IA o tutor humano.
Contexto
La evidencia sobre IA aplicada a personas venía siendo más ambigua que entusiasta. Se ha documentado que el efecto de los acompañantes de IA sobre el bienestar depende del uso y que buena parte de las alucinaciones dependen de cómo pregunta el usuario. StudentBench aporta lo que faltaba en ese debate: una medición de resultado, no de percepción.
Qué viene
- El artículo está como preimpresión, sin revisión por pares. Los autores publicaron la plataforma en studentbench.org.
- No hay anuncio de réplica en otros idiomas ni en pruebas distintas del GRE.
- Sin fecha de publicación en revista.
Cierre
La cifra que va a circular es la de las 918 veces de diferencia en costo. La que decide algo es la otra: cinco de siete dominios. Un promedio que empata puede esconder materias donde el tutor humano sigue siendo mejor, y el artículo no dice cuáles fueron las dos.
Fuentes
- StudentBench, arXiv 2609.28470, 23 de septiembre de 2026.
Editado por Rodrigo Cornejo. Cómo seleccionamos y verificamos: quiénes escriben estas notas.


