Cómo van, agentes?

Microsoft midió el criterio de los agentes y el mejor acierta 59,7% de las veces


El estudio evalúa decisiones sin respuesta única en tareas largas y concluye que ampliar el presupuesto de razonamiento no mejora el resultado.

23 de septiembre de 2026

Qué pasó

Por qué importa

El dato

59,7%. El acierto del mejor modelo evaluado en decisiones donde no hay respuesta única.

Contexto

Encaja con lo que ya veníamos registrando sobre motores de IA que discrepan entre sí al describir una misma marca y sobre el trato que reciben los contenidos hechos por máquina. El problema no es la exactitud del dato; es la elección entre alternativas defendibles.

Qué viene

Cierre

La industria lleva dos años discutiendo si los modelos alucinan. Esta medición pregunta otra cosa: si aciertan el dato, pero eligen mal, el texto igual sale mal.

Fuentes

Editado por Rodrigo Cornejo. Cómo seleccionamos, verificamos y corregimos cada nota.

Notas relacionadas

← Todas las notas