Qué pasó
- Un equipo de Nubank publicó el 24 de septiembre en arXiv el detalle de cómo prueba sus agentes de atención antes de ponerlos en producción.
- El método reemplaza las pruebas manuales por simulación: personas sintéticas reaccionan a las respuestas del agente y las herramientas devuelven resultados simulados, así el flujo completo corre sin tocar los sistemas reales del banco.
- Se aplicó sobre el agente de Entrega de Tarjeta y su sucesor, Gestión de Tarjeta, que el paper identifica como el agente de soporte por chat de mayor volumen del banco en Brasil.
- Resultados declarados: en cuatro versiones desplegadas, los puntajes simulados y los de producción mostraron correlación alta. La iteración guiada por simulación subió 36,69 puntos el indicador de satisfacción transaccional en una prueba A/B en vivo.
- En una segunda tanda se evaluaron configuraciones de pesos abiertos en más de 16.000 conversaciones simuladas. El modelo elegido subió 8,82 puntos porcentuales la tasa de autoservicio, el nivel más alto registrado en el banco, sin cambio estadísticamente significativo en satisfacción.
Por qué importa
- Es evidencia de producción de un banco de la región, medida en portugués y sobre tráfico real, y no una demostración de laboratorio. Para cualquier equipo que opere atención automatizada en Chile, el aporte no es la cifra sino el método: se puede medir una versión antes de exponerla.
- La correlación entre simulado y real es el punto que hace utilizable todo lo demás. Sin esa correlación, simular es teatro. El paper la reporta sobre cuatro versiones desplegadas, que es una muestra chica y conviene tratarla como tal.
- Hay una consecuencia que el paper no desarrolla: si las personas sintéticas las genera el mismo tipo de modelo que responde, el sistema se evalúa contra su propia idea de cómo se comporta la gente. Los reclamos que nadie modeló siguen llegando al canal humano.
El dato
8,82 puntos porcentuales subió la tasa de autoservicio tras elegir por simulación una configuración de pesos abiertos.
Contexto
La banca de la región lleva meses moviendo tareas de análisis a modelos de lenguaje; la nota sobre ChatGPT ocupando trabajo de analistas junior documenta el otro extremo del mismo proceso. Nubank aplica la misma lógica al canal de contacto directo.
Qué viene
- Sin plazos anunciados para liberar el simulador ni el conjunto de conversaciones sintéticas.
- El paper está en versión 1 y no declara revisión por pares.
Cierre
Medir agentes en tareas largas sigue siendo el problema abierto que Taste-Bench dejó planteado con su mejor modelo en 59,7%. Nubank no lo resolvió: lo esquivó midiendo el resultado comercial en vez del criterio.
Fuentes
Editado por Rodrigo Cornejo. Cómo seleccionamos y verificamos: quiénes escriben estas notas.


