Qué pasó
- Un equipo publicó el 29 de septiembre LLMAdBench, un banco de preferencia humana para estudiar publicidad insertada en respuestas de modelos de lenguaje.
- El diseño aísla una sola decisión: dada una conversación, una respuesta y un aviso pertinente, dónde se ubica el aviso. Los pares comparados difieren solo en esa posición; la consulta, la respuesta base y la pieza publicitaria se mantienen fijas.
- Son más de 18.000 juicios humanos bajo dos condiciones de transparencia: el aviso rotulado como patrocinado, o fundido en la respuesta sin declararlo. Cada par se evalúa con seis criterios, desde la mirada de quien anuncia y de quien lee.
- Al usar ocho modelos frontera como jueces, el resultado es que no reemplazan a las personas: los más estables invierten cerca de una cuarta parte de sus decisiones cuando se cambia el orden de presentación, hay poca coincidencia entre modelos y sus preferencias de ubicación difieren de forma sistemática de las humanas.
Por qué importa
- El hallazgo que más cambia una decisión de negocio no es la ubicación óptima sino que declarar el patrocinio modifica sistemáticamente dónde la gente tolera el aviso. Transparencia y ubicación dejan de ser dos discusiones separadas.
- Cualquier equipo que quiera probar formatos publicitarios dentro de un asistente con un modelo como juez está midiendo ruido. El paper lo cuantifica: una cuarta parte de las decisiones se da vuelta sola.
- Para el mercado chileno, donde la publicidad en asistentes todavía no se vende, esto llega antes que el inventario. Es la ventana para fijar criterio propio de transparencia en vez de heredar el del proveedor.
El dato
Una de cada cuatro decisiones se invierte en los modelos más estables al cambiar el orden de presentación.
Contexto
Comscore ya había medido que la publicidad patrocinada en ChatGPT subió de 6% a 24% en tres meses, y el inventario sigue sin llegar a Chile. El formato se está estandarizando en otros mercados mientras acá todavía no hay nada que comprar.
Qué viene
- Un modelo Qwen3-8B ajustado sobre las preferencias humanas supera a los ocho jueces frontera en la tarea de predicción reservada. Sin fecha de liberación anunciada para ese ajuste.
- Sin plazos anunciados para ampliar el banco a otros idiomas ni a otros formatos publicitarios.
Cierre
Dos motores de inteligencia artificial ya nombran la misma marca en 81% y 43% de sus respuestas. Ahora se empieza a medir también dónde cae el aviso pagado dentro de esa respuesta. La superficie es la misma y las dos mediciones van a terminar en la misma planilla.
Fuentes
- LLMAdBench: A Human Preference Benchmark for Advertising in LLM Responses, arXiv, anunciado el 29 de septiembre de 2026.
Escrito por Mamífero. Editado por Rodrigo Cornejo. Revisa cómo seleccionamos y verificamos cada nota.




