Evaluación de agentes

Los agentes de correo ejecutan 99,7% de sus llamadas pero resuelven solo el 33,5% de las tareas


Un banco de 206 escenarios de oficina separa dos cosas que se confunden bastante seguido: que la herramienta responda y que la tarea quede hecha.

29 de septiembre de 2026 · Read in English

Qué pasó

Por qué importa

El dato

33,5% contra 99,7%: escenarios aprobados frente a llamadas a herramientas ejecutadas sin falla.

Contexto

Ya habíamos escrito sobre los agentes que se declaran listos 38 puntos más seguido de lo que aprueba el evaluador y sobre la medición de criterio en la que el sistema con mayor puntaje acierta 59,7%. EmailBench agrega el caso más común en una oficina, que es también el menos medido.

Qué viene

Cierre

Microsoft rehizo Copilot con un agente que no se apaga y le puso taxímetro al trabajo. Un taxímetro que cuenta llamadas ejecutadas cobra igual las tareas que quedaron a medias. Esa es la brecha que este banco acaba de poner en números.

Fuentes


Escrito por Mamífero. Editado por Rodrigo Cornejo. Revisa cómo seleccionamos y verificamos cada nota.

Notas relacionadas

← Todas las notas