Qué pasó
- Un equipo de Princeton publicó el 24 de septiembre en arXiv un estudio sobre qué pasa cuando algunos agentes de un grupo deliberante no actúan de buena fe.
- La conclusión principal, según el texto: lo que determina la vulnerabilidad no es el tamaño del grupo sino la proporción de agentes engañosos. La tasa de deserción —cuántos agentes inicialmente correctos terminan dando una respuesta incorrecta— crece de forma lineal con esa proporción.
- La comparación que hacen los autores con estudios clásicos de conformidad humana es el dato duro: las personas ceden de manera confiable solo cuando los cómplices que inducen el error forman mayoría. Los agentes desertan con regularidad incluso cuando los engañosos siguen siendo minoría.
- La susceptibilidad depende de qué modelos conversan entre sí, y sobre todo de qué modelo está del lado honesto.
- Un resultado que los autores marcan como inesperado: dejar que los engañosos coordinen en privado los hace menos efectivos, no más.
Por qué importa
- El argumento comercial de los sistemas multiagente es que varias instancias se revisan entre sí y el consenso corrige el error individual. Este trabajo mide lo contrario en presencia de un actor desleal: sumar agentes no es defensa, porque el adversario escala con el grupo.
- Para equipos en Chile que están armando flujos con varios agentes encadenados —uno redacta, otro revisa, otro aprueba— la pregunta operativa cambia. No es cuántos revisores poner, es qué modelo ocupa el puesto honesto y si algún eslabón puede recibir instrucciones desde afuera.
- Hay una consecuencia que el paper no desarrolla: en una cadena real, el agente desleal no necesita ser malicioso. Basta uno mal configurado, con un mensaje de sistema contaminado o leyendo una página manipulada, para que ocupe ese rol sin que nadie lo haya decidido.
El dato
La deserción sube de forma lineal con la proporción de agentes engañosos, sin importar cuántos agentes tenga el grupo.
Contexto
La nota sobre agentes que convierten la autonomía en riesgo describía el problema en un agente solo. Este estudio lo traslada al arreglo que la industria propone como solución.
Qué viene
- Sin plazos anunciados para liberar el código ni para ampliar la evaluación a más familias de modelos.
- El trabajo está en versión 1 y no declara revisión por pares.
Cierre
Medir el criterio de un agente en tareas largas ya era difícil: Taste-Bench dejó al mejor modelo en 59,7%. Medirlo cuando otro agente lo está empujando en la dirección equivocada todavía no tiene prueba estándar.
Fuentes
Editado por Rodrigo Cornejo. Cómo seleccionamos y verificamos: quiénes escriben estas notas.


