Contenido
ToggleEn resumen
- Los agentes de IA configurados por Microsoft se vieron abrumados por 100 resultados de búsqueda y eligieron la primera opción, por mala que fuera.
- Los especialistas maliciosos en marketing de IA pueden engañar a las mejores modelos para que entreguen todo su dinero virtual con reseñas falsas y estafas.
- No pueden colaborar ni pensar críticamente sin la mano humana, paso a paso: la compra de IA autónoma está lista para el horario de mayor audiencia.
Microsoft construyó una economía simulada con cientos de agentes de inteligencia artificial que actuaban como compradores y vendedores y luego los vio fallar en tareas básicas que los humanos realizan todos los días. Los resultados deberían preocupar a cualquiera que apueste por asistentes de marketing automatizados con IA.
El estudio Magentic Marketplace de la compañía, publicado el miércoles en colaboración con la Universidad Estatal de Arizona, comparó 100 agentes de IA de consumo con 300 agentes de empresa a empresa en escenarios como pedir una cena. Los resultados, aunque prometedores, muestran que la promesa del marketing de agencia autónoma aún no se ha cumplido plenamente.
Cuando se les presentaron 100 resultados de búsqueda (demasiados para que los agentes los manejaran de manera efectiva), los principales modelos de IA se vieron abrumados y su «valor de bienestar» (cuán útiles resultaron ser los modelos) colapsó.

Los agentes no pudieron hacer comparaciones perfectas y se conformaron con la primera opción «suficientemente buena» que encontraron. Este patrón se mantuvo en todos los modelos de prueba, creando lo que los investigadores llaman una «primera sugerencia» de que la velocidad de respuesta ofrecía una ventaja de 10 a 30 veces sobre la calidad real.
¿Pero hay algo peor que esto? Sí, mala manipulación.
Microsoft probó seis estrategias de manipulación, que van desde tácticas psicológicas como credenciales falsas y pruebas sociales hasta ataques agresivos de inyección rápida. El GPT-4o de OpenAI y su modelo de código abierto GPTOSS-20b resultaron extremadamente vulnerables, y todos los fondos se desviaron con éxito a agentes maliciosos. El Qwen3-4b de Alibaba cayó ante técnicas básicas de persuasión como las apelaciones a la autoridad. Sólo Claude Sonnet 4 resistió estos intentos de manipulación.

Cuando Microsoft pidió a los representantes que trabajaran para lograr objetivos comunes, algunos de ellos no sabían qué roles asumir o cómo coordinarse de manera efectiva. El rendimiento mejoró con una guía humana clara paso a paso, pero eso anula todo el propósito de los agentes autónomos.
Así que parece que, al menos por ahora, será mejor que hagas tus compras. «Los agentes deberían ayudar a la toma de decisiones humanas, no reemplazarlos», dijo Microsoft. Las investigaciones sugieren una autonomía supervisada, donde los agentes realizan servicios pero los humanos retienen el control y evalúan las recomendaciones antes de tomar decisiones finales.
Descúbrelo mientras OpenAI, Anthropic y otros compiten por implementar asistentes de marketing automatizados. El operador OpenAI y los agentes Claude de Anthropic prometen buscar sitios web y completar compras sin supervisión. La investigación de Microsoft muestra que la promesa es demasiado pronto.
Sin embargo, el temor a que los agentes de IA actúen de manera irresponsable está calentando la relación entre las empresas de IA y los gigantes minoristas. Amazon envió recientemente una carta de cese y desistimiento a Perplexity AI, exigiéndole que dejara de usar su navegador Comet en el sitio web de Amazon, acusando al agente de AI de violar los términos al engañar a los compradores humanos y degradar la experiencia del cliente.
Perplexity respondió calificando la medida de Amazon como una «vergüenza legal» y una amenaza a la autonomía del usuario, argumentando que los consumidores deberían tener derecho a utilizar sus propios asistentes digitales y no depender de los controlados por la plataforma.
El entorno de simulación de código abierto ahora está disponible en Github para que otros investigadores repliquen los hallazgos y observen cómo sus mercados falsos se van al infierno.
Generalmente sabio Hoja informativa
Un viaje semanal de IA narrado por Gen, un modelo creativo de IA.

