Un agente adversario es un usuario simulado impulsado por IA que ataca a propósito a otro agente de IA dentro de una conversación aislada (sandbox). Tu equipo lo ejecuta para encontrar los fallos antes de que los encuentre un interlocutor hostil en una llamada real.
La funcionalidad Adversarial Agents de HappyRobot le da a ese usuario simulado un objetivo hostil y lo ejecuta contra el agent que estás a punto de desplegar.
Un interlocutor así puede llamar a tu línea mañana mismo, lo hayas previsto o no, y pedir un presupuesto que el agent no tiene autoridad para aprobar. Cuando el agent se niega, el interlocutor vuelve a pedirlo con otras palabras, y otra vez. El agent o mantiene la norma que escribió tu equipo o cede el presupuesto. Descubrirás cuál de las dos cosas en una llamada de producción grabada, salvo que ejecutes tú mismo el ataque antes.
La IA adversaria es cualquier intento deliberado de hacer que un sistema de IA se comporte de forma incorrecta. Este artículo cubre las cinco categorías de ataque y la diferencia entre entrenamiento adversario y pruebas adversarias.
| Attack Category | What It Targets | Example | Primary Defense |
|---|---|---|---|
| Evasion | A trained model's decision boundary | Perturbing an input so a classifier misreads it | Adversarial training (training-time) |
| Poisoning | The training data itself | Injecting corrupted examples before training | Data validation, adversarial training |
| Extraction | The model's parameters or logic | Querying a model repeatedly to reconstruct it | Rate limiting, output obfuscation |
| Inversion | The model's training data privacy | Reconstructing training examples from outputs | Differential privacy, output filtering |
| Conversational manipulation (agent-specific) | A live, deployed agent's behavior in real time | Prompt injection, topic derailing, instruction override, jailbreak attempts | Adversarial testing (runtime, pre-deployment) |
¿Qué es un agente adversario?
Un agente adversario es una segunda IA a la que le das una persona y el objetivo de romper el agent que estás probando. Normalmente se ejecuta dentro de una sesión aislada, de modo que nada de lo que haga el atacante puede llegar a un cliente real ni a un registro de producción.
Los equipos de seguridad llevan años haciendo esto a mano. Un red teamer se sienta con el agent y lo sondea turno a turno, ajustando cada mensaje en función de la última respuesta. El método funciona, pero no escala: una persona ejecuta un puñado de sesiones en una tarde.
Un agente adversario ejecuta la misma jugada unos cientos de veces de un día para otro. Redacta cada nuevo turno a partir de lo que tu agent acaba de decir, así que sigue trabajando la misma norma desde otro ángulo, y lo hace con cada persona del conjunto sin que nadie tenga que estar delante.
Agentes cooperativos frente a agentes adversarios
Los agentes cooperativos trabajan hacia un objetivo compartido, como un agent que extrae los campos de un documento y los entrega a un segundo agent que actualiza el registro.
Los agentes adversarios se ejecutan sobre la misma arquitectura y los mismos modelos. La única diferencia es el objetivo en el prompt, donde se define la meta de un agent. Construir el atacante le cuesta a tu equipo un prompt. Ejecutarlo de forma segura, puntuar lo que ha pasado y mantener el resultado comparable de un mes a otro es la parte que necesita un sistema.
Por qué "agent" cambia el modelo de amenazas
El modelo de amenazas cambia porque un clasificador de fraude o de intención recibe una entrada y devuelve una etiqueta. Ahí termina el intercambio. Un agent desplegado puede mantener una conversación y llamar a herramientas en tus sistemas mientras el interlocutor sigue hablando.
El interlocutor puede sondear pronto los límites de tu agent y ajustarse según cómo haya respondido, comprobando si ha cedido un dato de una cuenta o una tarifa que debía reservarse. Tu prueba tiene que seguir el mismo camino, puntuando al agent tanto en el turno ocho como en el turno uno.
IA adversaria para agentes de IA frente a IA adversaria para modelos de ML
La diferencia entre la IA adversaria para agentes de IA y la IA adversaria para modelos de ML es que el atacante dispone de un único envío contra un modelo entrenado y de turnos ilimitados contra un agent desplegado.
Adversarial AI: ML model vs. deployed agent
Un agent sigue funcionando mientras se produce el ataque. El atacante sigue hablando y reescribe cada mensaje según lo que el agent haya revelado en el anterior.
IA adversaria contra un modelo entrenado
La investigación en aprendizaje automático adversario cubre solo el caso de un único envío. Un atacante altera intencionadamente una entrada para que un modelo entrenado devuelva la salida equivocada, como una imagen modificada en unos pocos píxeles que un clasificador etiqueta mal.
NIST clasifica los ataques adversarios contra modelos de IA en ataques de evasión, envenenamiento y privacidad en NIST AI 100-2e2025. Cada ataque es de un solo intento y offline. El atacante construye la entrada, la envía y ahí termina el intercambio.
La definición agéntica
La IA adversaria aplicada a agentes significa manipular un sistema mientras mantiene una conversación, llama a herramientas y escribe en tus registros. El atacante suele ser otra IA en lugar de una persona construyendo una entrada a mano, lo que permite a tu equipo ejecutar un conjunto de ataques en vez de un puñado de intentos manuales.
Aquí es también donde los benchmarks dejan de ayudar. Un conjunto de datos de referencia se depura antes de que el modelo lo vea, así que tus puntuaciones miden al agent frente a entradas que alguien aprobó de antemano. Un interlocutor no aprueba nada. Las pruebas adversarias son la forma de puntuar al agent frente a entradas hostiles antes de que las aporte un cliente de pago.
El marco tradicional de IA adversaria, ampliado para agentes
El marco tradicional de IA adversaria es el conjunto de categorías de ataque que los investigadores de seguridad crearon para los modelos de aprendizaje automático. Cada categoría describe una manera de hacer que un modelo entrenado produzca el resultado equivocado, lo que ayuda a los equipos a cerrar esos ataques antes de que el modelo pase a producción.
Las cuatro categorías clásicas
MITRE ATLAS, una base de conocimiento pública sobre técnicas adversarias dirigidas a sistemas de IA, categoriza los ataques de aprendizaje automático adversario por técnica y táctica. Evasión, envenenamiento, extracción e inversión son los cuatro arquetipos fundamentales, y la tabla del inicio de este artículo expone a qué apunta cada uno y cómo se defienden los equipos.

Four classic adversarial AI attacks mapped to the machine learning pipeline
Las cuatro parten de lo mismo: una entrada, una salida y ninguna conversación.
La quinta categoría: manipulación conversacional
Esas cuatro categorías no contemplan una conversación en vivo y multiturno con un agent desplegado. Por eso la manipulación conversacional es la quinta, y un interlocutor puede intentar los cinco comportamientos siguientes en una sola llamada.
- Desvío del tema: El interlocutor lleva al agent fuera de su tarea, a un terreno que nunca autorizaste, como presionar a un agent de facturación para que opine sobre las condiciones del contrato del cliente.
- Extracción de datos mediante ingeniería social: El interlocutor recurre a la presión conversacional en lugar de a un exploit de software para que el agent revele sus propias instrucciones o el registro de la cuenta de otro cliente.
- Anulación de instrucciones: El interlocutor le dice al agent que ignore las instrucciones que redactó tu equipo y siga otras nuevas, normalmente planteadas como una corrección procedente de alguien con más autoridad.
- Inyección de prompts: El interlocutor esconde una instrucción dentro de una entrada aparentemente normal, como el texto del cuerpo de un correo que el agent lee, de modo que el agent ejecuta la instrucción oculta. Un ataque de inyección de prompts no requiere que el interlocutor diga nada sospechoso en voz alta.
- Jailbreak: El interlocutor recurre al juego de rol, a hipótesis o a una presión repetida turno tras turno hasta que el agent dice algo que sus guardarraíles prohíben. El prompting adversario en IA es el término que designa este comportamiento en un contexto agéntico.
Por qué los agentes adversarios importan en la IA conversacional y de voz
Los agentes adversarios importan en la IA conversacional y de voz porque el agent completa la tarea durante la llamada en lugar de redactar algo que una persona aprueba después. Puede reservar una cita en tu sistema de agenda o leerle el saldo de una cuenta al interlocutor mientras este sigue hablando.
Para cuando alguien abre la transcripción, la cita ya está en el calendario y el saldo ya se ha dicho en voz alta.
Los agents en directo se enfrentan a interlocutores hostiles
Cuando un agent en directo se encuentra con un interlocutor hostil, tiene que decidir en el momento si la solicitud es una que puede completar. Toma esa decisión solo, sin ningún supervisor escuchando.
Los interlocutores que más insisten son aquellos a los que una regla está bloqueando. Así que la presión recae justo sobre las reglas que más le importan a tu equipo.
Lo que hay en juego en una llamada en directo
Un interlocutor que sortea una regla puede modificar un registro en tus sistemas o escuchar información que nadie pretendía divulgar. En la transcripción parece una alucinación. El detonante fue el interlocutor, y la brecha estaba en las instrucciones del agent. En cualquier caso, el cliente es la primera persona expuesta a ello, antes que nadie de tu equipo.
Pongamos un interlocutor que reserva una visita a un emplazamiento que ninguna orden de trabajo cubre. Tu equipo de expediciones ve la cita en la agenda, la trata como trabajo aprobado y envía a un técnico a una dirección que nadie de tu empresa autorizó. Nada en esa cadena parece incorrecto hasta que alguien abre la transcripción, y por eso la prueba tiene que ejecutarse antes de que la llamada esté en producción.
Son tipos de llamada de alto volumen. Un agent que las gestiona a escala puede intentar lo mismo cientos de veces antes de que alguien revise una transcripción. Puedes ver cómo funcionan los agents de HappyRobot de principio a fin en esos tipos de llamada.
Por qué las pruebas adversarias van de la mano de las pruebas de carga
Un agent capaz de gestionar cientos de miles de llamadas al año tiene que resistir la presión adversaria igual que resiste el volumen de llamadas y los fallos de integración. Las pruebas adversarias forman parte de la infraestructura de publicación, junto con las pruebas de carga y las de integración.
HappyRobot integra las pruebas adversarias en su suite de Governance, junto a los northstars y las auditorías de producción. Encaja en el marco de gobernanza de IA que necesita un despliegue empresarial. El equipo que despliega el agent evalúa el comportamiento hostil con las mismas herramientas que ya usa para evaluar todo lo demás.
Nosotros también nos sometemos a ellas. El trust centre de HappyRobot incluye un informe AI Red Team & Pentest 2026 junto con el SOC 2 Type II, el certificado ISO 27001:2022 y una evaluación de riesgos de seguridad de LLM, todos disponibles bajo petición. Es poco habitual ver siquiera listada una evaluación específica de IA, y es el documento que pide un comité de revisión en cuanto empieza a tratar al agent como una superficie de ataque propia y no como una integración más.
Para una comparativa más amplia de la plataforma, lee cómo se compara HappyRobot con otras plataformas empresariales de agents de IA.
Entrenamiento adversario frente a pruebas adversarias
La diferencia clave entre el entrenamiento adversario y las pruebas adversarias es que el entrenamiento modifica los pesos del modelo antes del despliegue. Las pruebas no cambian nada: puntúan cómo se comporta un agent ya construido en una llamada hostil.
| Function | Adversarial training | Adversarial testing |
|---|---|---|
| What it acts on | The model's weights while the model is being trained | An agent that is already built and configured |
| When it runs | Before the model is deployed anywhere | Before the agent takes live calls, and again on sampled production calls |
| What it changes | The model learns to classify adversarial examples correctly | Nothing in the model; your team rewrites the agent's instructions and standards |
| The question it answers | Can a crafted input fool this model? | Does the agent hold its rules across a full conversation? |
| Who runs it | Whoever trained the model | The team deploying the agent |
| What you get back | A retrained model | A pass or fail for each behavioral standard, with the turn where it broke |
Entrenamiento adversario
El entrenamiento adversario es una defensa de machine learning que se aplica mientras se entrena el modelo. Tu equipo alimenta el modelo con ejemplos adversarios y sus etiquetas correctas, y el optimizador ajusta los pesos hasta que el modelo acierta. La frontera de decisión se desplaza y las entradas que antes la cruzaban dejan de hacerlo.
Todo esto ocurre antes del despliegue, y por eso la mayoría del material publicado sobre IA adversaria describe esto y se detiene aquí.
Pruebas adversarias
Las pruebas adversarias evalúan un agent ya construido. Tu equipo lo somete a conversaciones hostiles y una auditoría revisa cada transcripción frente a los estándares que tu equipo redactó. La auditoría informa de qué estándar incumplió el agent y en qué turno, para que tu equipo pueda corregir la instrucción que lo permitió. Los resultados adversarios se suman a los demás métodos de evaluación de agents de IA que tu equipo ya utiliza.
El modelo permanece exactamente igual. Lo que cambia son las instrucciones del agent, y esas pertenecen a tu equipo.
Cómo son las pruebas de IA adversaria en la práctica
Las pruebas de IA adversaria constan de tres pasos, y tu equipo configura los tres.

The three steps of an adversarial test
Paso 1: define al atacante
Un prompt adversario establece la persona, el objetivo y la estrategia de ataque del usuario simulado. Este paso determina el valor de la prueba.
«Un transportista enfadado que intenta conseguir una confirmación de tarifa no autorizada» le da al atacante algo que perseguir a lo largo de los turnos. Una instrucción genérica para romper al agent produce una conversación sobre la que nadie puede actuar.
Paso 2: ejecuta una sesión en sandbox
El agent y el agent adversario mantienen una conversación en directo entre dos agents dentro de un sandbox, sin impacto alguno en clientes reales ni en datos de producción. Ambas partes generan sus turnos a medida que avanza la conversación, de modo que tu agent debe responder a un atacante que reacciona a lo que acaba de decir, en lugar de leer una transcripción guionizada.
Paso 3: evalúa el resultado
Una auditoría de comportamiento contrasta la transcripción con cada estándar definido por tu equipo y devuelve un apto o un no apto para cada uno. HappyRobot llama a estos estándares northstars, y un northstar fallido vuelve con una sugerencia de corrección adjunta.
Cómo funciona la función Adversarial Agents de HappyRobot
HappyRobot es una plataforma de agents de IA para operaciones empresariales, y llama a sus agents de IA AI workers. Esos AI workers operan por voz, email, SMS, WhatsApp y chat, así que las pruebas deben cubrir el canal en el que esté desplegado el worker.

HappyRobot Governance with Adversarial Agents
Adversarial Agents se ejecutan dentro de la suite completa de Governance, junto con northstars, auditorías y pruebas que evalúan ejecuciones en directo. Las pruebas individuales se agrupan en una suite, de modo que una release ejecuta todos los ataques a la vez en lugar de una persona cada vez.
Cómo proteger a los agents de IA frente a ataques adversarios
Proteger a los agents de IA frente a ataques adversarios exige ejecutar el ataque antes del lanzamiento y repetirlo después contra el tráfico real. Los mismos estándares de comportamiento se aplican en las tres etapas, y eso es lo que hace comparables los resultados de un mes con los del siguiente.
Antes del despliegue
El primer interlocutor hostil de tu agent debería ser uno creado por tu equipo. Ejecuta la suite adversaria mientras el agent sigue en el sandbox y retén el lanzamiento hasta que los resultados arrojen una tasa de aprobación que tu equipo esté dispuesto a validar. Trata esa tasa como un mínimo, no como una garantía. Solo indica que el agent sobrevive a los ataques que se te ocurrieron.
- Cubre las cinco categorías de ataque, incluida la manipulación conversacional
- Convierte la ejecución en un requisito de release, igual que ya lo son las pruebas de carga y de integración
En producción
Una suite de pruebas contiene los ataques que alguien imaginó. Los interlocutores reales llegan con el resto, así que la auditoría que se ejecutó antes del lanzamiento debe seguir ejecutándose contra el tráfico real.

Run adversarial tests in the sandbox, not against production. Once live, audit instead of attack.
Una vez en directo, audita las pruebas adversarias en el sandbox en lugar de atacar.
- Muestrea conversaciones en directo y puntúalas con los mismos northstars que usaron las pruebas adversarias
- Revisa los northstars fallidos con una periodicidad fija, para que tu equipo detecte un nuevo patrón en días y no en el siguiente ciclo de pruebas
Continuo
Cada ataque que funcionó una vez es una prueba que tu equipo ya posee. Añadirlo a la suite de regresión significa que ese mismo planteamiento se comprueba en cada release sin que nadie tenga que acordarse de ejecutarlo.
- Convierte cada fallo de producción confirmado en una prueba de regresión
- Cuenta con que el conjunto de pruebas crecerá cada vez que alguien que llama encuentre una brecha
Proteger los sistemas de IA frente a ataques adversarios sigue las mismas tres fases, con una diferencia. Para un modelo, la fase previa al lanzamiento es el entrenamiento adversario. Para un agent desplegado, son las pruebas adversarias.
Limitaciones
Las pruebas adversarias reducen el riesgo de que quien llama con malas intenciones consiga lo que busca, pero no lo eliminan. Ningún conjunto de pruebas contiene todos los ataques que una persona decidida acabará probando, y un ataque que nadie incluyó en el conjunto es uno al que tu agent se enfrenta sin haber sido probado en una llamada real.
El mismo límite se nos aplica a nosotros. Un red team externo encuentra lo que un conjunto interno no pensó en buscar, y por eso el informe AI Red Team & Pentest existe junto a nuestras propias pruebas adversarias, y no en lugar de ellas.
Un agent adversario ataca solo de la forma que le indica su prompt. Un conjunto construido a partir de un puñado de personas escritas a mano devuelve una tasa de éxito que describe a esas personas y nada más, de modo que tu equipo puede dar el visto bueno a un agent que nunca se probó frente al enfoque que trae quien llama de verdad. La tasa de éxito vale lo que cubre la lista de escenarios.
Qué hacer antes de que tu agent atienda una llamada real
Ejecuta la prueba adversaria antes de que tu agent atienda su primera llamada real y trata el resultado como una puerta de publicación. Incorpora las cinco categorías de ataque a tu conjunto de pruebas, puntúa cada sesión según los estándares que definió tu equipo y añade cada fallo en producción al conjunto de regresión.
HappyRobot ejecuta esto dentro de su suite de Governance, donde los northstars puntúan cada sesión según las reglas que escribió tu equipo. El resultado te dice qué regla se incumplió y en qué turno, de modo que tu equipo sabe qué corregir antes de que lo descubra quien llama.
Envíanos la formulación que burló a tu último agent y la probaremos con el nuestro. Reserva una demo de HappyRobot para ejecutar una sesión adversaria contra tu propia configuración.



