¿Qué son los agentes adversarios? Cómo probar agentes de IA frente a ataques reales

Los agents adversarios son atacantes de IA creados para probar tu agent antes que un usuario real. Descubre los cinco tipos de ataque y cómo funcionan.

Gonzalo Ybanez
Gonzalo Ybáñez
Growth Strategist
Publicado 24 sept 202614 min de lectura
What Are Adversarial Agents
Saltar a la sección

Un agente adversario es un usuario simulado impulsado por IA que ataca a propósito a otro agente de IA dentro de una conversación aislada (sandbox). Tu equipo lo ejecuta para encontrar los fallos antes de que los encuentre un interlocutor hostil en una llamada real.

La funcionalidad Adversarial Agents de HappyRobot le da a ese usuario simulado un objetivo hostil y lo ejecuta contra el agent que estás a punto de desplegar.

Un interlocutor así puede llamar a tu línea mañana mismo, lo hayas previsto o no, y pedir un presupuesto que el agent no tiene autoridad para aprobar. Cuando el agent se niega, el interlocutor vuelve a pedirlo con otras palabras, y otra vez. El agent o mantiene la norma que escribió tu equipo o cede el presupuesto. Descubrirás cuál de las dos cosas en una llamada de producción grabada, salvo que ejecutes tú mismo el ataque antes.

La IA adversaria es cualquier intento deliberado de hacer que un sistema de IA se comporte de forma incorrecta. Este artículo cubre las cinco categorías de ataque y la diferencia entre entrenamiento adversario y pruebas adversarias.

Attack CategoryWhat It TargetsExamplePrimary Defense
EvasionA trained model's decision boundaryPerturbing an input so a classifier misreads itAdversarial training (training-time)
PoisoningThe training data itselfInjecting corrupted examples before trainingData validation, adversarial training
ExtractionThe model's parameters or logicQuerying a model repeatedly to reconstruct itRate limiting, output obfuscation
InversionThe model's training data privacyReconstructing training examples from outputsDifferential privacy, output filtering
Conversational manipulation (agent-specific)A live, deployed agent's behavior in real timePrompt injection, topic derailing, instruction override, jailbreak attemptsAdversarial testing (runtime, pre-deployment)
Adversarial AI Attack Categories

¿Qué es un agente adversario?

Un agente adversario es una segunda IA a la que le das una persona y el objetivo de romper el agent que estás probando. Normalmente se ejecuta dentro de una sesión aislada, de modo que nada de lo que haga el atacante puede llegar a un cliente real ni a un registro de producción.

Los equipos de seguridad llevan años haciendo esto a mano. Un red teamer se sienta con el agent y lo sondea turno a turno, ajustando cada mensaje en función de la última respuesta. El método funciona, pero no escala: una persona ejecuta un puñado de sesiones en una tarde.

Un agente adversario ejecuta la misma jugada unos cientos de veces de un día para otro. Redacta cada nuevo turno a partir de lo que tu agent acaba de decir, así que sigue trabajando la misma norma desde otro ángulo, y lo hace con cada persona del conjunto sin que nadie tenga que estar delante.

Agentes cooperativos frente a agentes adversarios

Los agentes cooperativos trabajan hacia un objetivo compartido, como un agent que extrae los campos de un documento y los entrega a un segundo agent que actualiza el registro.

Los agentes adversarios se ejecutan sobre la misma arquitectura y los mismos modelos. La única diferencia es el objetivo en el prompt, donde se define la meta de un agent. Construir el atacante le cuesta a tu equipo un prompt. Ejecutarlo de forma segura, puntuar lo que ha pasado y mantener el resultado comparable de un mes a otro es la parte que necesita un sistema.

Por qué "agent" cambia el modelo de amenazas

El modelo de amenazas cambia porque un clasificador de fraude o de intención recibe una entrada y devuelve una etiqueta. Ahí termina el intercambio. Un agent desplegado puede mantener una conversación y llamar a herramientas en tus sistemas mientras el interlocutor sigue hablando.

El interlocutor puede sondear pronto los límites de tu agent y ajustarse según cómo haya respondido, comprobando si ha cedido un dato de una cuenta o una tarifa que debía reservarse. Tu prueba tiene que seguir el mismo camino, puntuando al agent tanto en el turno ocho como en el turno uno.

IA adversaria para agentes de IA frente a IA adversaria para modelos de ML

La diferencia entre la IA adversaria para agentes de IA y la IA adversaria para modelos de ML es que el atacante dispone de un único envío contra un modelo entrenado y de turnos ilimitados contra un agent desplegado.

Adversarial AI: ML model vs. deployed agent

Adversarial AI: ML model vs. deployed agent

Un agent sigue funcionando mientras se produce el ataque. El atacante sigue hablando y reescribe cada mensaje según lo que el agent haya revelado en el anterior.

IA adversaria contra un modelo entrenado

La investigación en aprendizaje automático adversario cubre solo el caso de un único envío. Un atacante altera intencionadamente una entrada para que un modelo entrenado devuelva la salida equivocada, como una imagen modificada en unos pocos píxeles que un clasificador etiqueta mal.

NIST clasifica los ataques adversarios contra modelos de IA en ataques de evasión, envenenamiento y privacidad en NIST AI 100-2e2025. Cada ataque es de un solo intento y offline. El atacante construye la entrada, la envía y ahí termina el intercambio.

La definición agéntica

La IA adversaria aplicada a agentes significa manipular un sistema mientras mantiene una conversación, llama a herramientas y escribe en tus registros. El atacante suele ser otra IA en lugar de una persona construyendo una entrada a mano, lo que permite a tu equipo ejecutar un conjunto de ataques en vez de un puñado de intentos manuales.

Aquí es también donde los benchmarks dejan de ayudar. Un conjunto de datos de referencia se depura antes de que el modelo lo vea, así que tus puntuaciones miden al agent frente a entradas que alguien aprobó de antemano. Un interlocutor no aprueba nada. Las pruebas adversarias son la forma de puntuar al agent frente a entradas hostiles antes de que las aporte un cliente de pago.

El marco tradicional de IA adversaria, ampliado para agentes

El marco tradicional de IA adversaria es el conjunto de categorías de ataque que los investigadores de seguridad crearon para los modelos de aprendizaje automático. Cada categoría describe una manera de hacer que un modelo entrenado produzca el resultado equivocado, lo que ayuda a los equipos a cerrar esos ataques antes de que el modelo pase a producción.

Las cuatro categorías clásicas

MITRE ATLAS, una base de conocimiento pública sobre técnicas adversarias dirigidas a sistemas de IA, categoriza los ataques de aprendizaje automático adversario por técnica y táctica. Evasión, envenenamiento, extracción e inversión son los cuatro arquetipos fundamentales, y la tabla del inicio de este artículo expone a qué apunta cada uno y cómo se defienden los equipos.

Adversarial AI Attacks Framework

Four classic adversarial AI attacks mapped to the machine learning pipeline

Las cuatro parten de lo mismo: una entrada, una salida y ninguna conversación.
La quinta categoría: manipulación conversacional

Esas cuatro categorías no contemplan una conversación en vivo y multiturno con un agent desplegado. Por eso la manipulación conversacional es la quinta, y un interlocutor puede intentar los cinco comportamientos siguientes en una sola llamada.

  • Desvío del tema: El interlocutor lleva al agent fuera de su tarea, a un terreno que nunca autorizaste, como presionar a un agent de facturación para que opine sobre las condiciones del contrato del cliente.
  • Extracción de datos mediante ingeniería social: El interlocutor recurre a la presión conversacional en lugar de a un exploit de software para que el agent revele sus propias instrucciones o el registro de la cuenta de otro cliente.
  • Anulación de instrucciones: El interlocutor le dice al agent que ignore las instrucciones que redactó tu equipo y siga otras nuevas, normalmente planteadas como una corrección procedente de alguien con más autoridad.
  • Inyección de prompts: El interlocutor esconde una instrucción dentro de una entrada aparentemente normal, como el texto del cuerpo de un correo que el agent lee, de modo que el agent ejecuta la instrucción oculta. Un ataque de inyección de prompts no requiere que el interlocutor diga nada sospechoso en voz alta.
  • Jailbreak: El interlocutor recurre al juego de rol, a hipótesis o a una presión repetida turno tras turno hasta que el agent dice algo que sus guardarraíles prohíben. El prompting adversario en IA es el término que designa este comportamiento en un contexto agéntico.

Por qué los agentes adversarios importan en la IA conversacional y de voz

Los agentes adversarios importan en la IA conversacional y de voz porque el agent completa la tarea durante la llamada en lugar de redactar algo que una persona aprueba después. Puede reservar una cita en tu sistema de agenda o leerle el saldo de una cuenta al interlocutor mientras este sigue hablando.

Para cuando alguien abre la transcripción, la cita ya está en el calendario y el saldo ya se ha dicho en voz alta.

Los agents en directo se enfrentan a interlocutores hostiles

Cuando un agent en directo se encuentra con un interlocutor hostil, tiene que decidir en el momento si la solicitud es una que puede completar. Toma esa decisión solo, sin ningún supervisor escuchando.

Los interlocutores que más insisten son aquellos a los que una regla está bloqueando. Así que la presión recae justo sobre las reglas que más le importan a tu equipo.

Lo que hay en juego en una llamada en directo

Un interlocutor que sortea una regla puede modificar un registro en tus sistemas o escuchar información que nadie pretendía divulgar. En la transcripción parece una alucinación. El detonante fue el interlocutor, y la brecha estaba en las instrucciones del agent. En cualquier caso, el cliente es la primera persona expuesta a ello, antes que nadie de tu equipo.

Pongamos un interlocutor que reserva una visita a un emplazamiento que ninguna orden de trabajo cubre. Tu equipo de expediciones ve la cita en la agenda, la trata como trabajo aprobado y envía a un técnico a una dirección que nadie de tu empresa autorizó. Nada en esa cadena parece incorrecto hasta que alguien abre la transcripción, y por eso la prueba tiene que ejecutarse antes de que la llamada esté en producción.

Son tipos de llamada de alto volumen. Un agent que las gestiona a escala puede intentar lo mismo cientos de veces antes de que alguien revise una transcripción. Puedes ver cómo funcionan los agents de HappyRobot de principio a fin en esos tipos de llamada.

Por qué las pruebas adversarias van de la mano de las pruebas de carga

Un agent capaz de gestionar cientos de miles de llamadas al año tiene que resistir la presión adversaria igual que resiste el volumen de llamadas y los fallos de integración. Las pruebas adversarias forman parte de la infraestructura de publicación, junto con las pruebas de carga y las de integración.

HappyRobot integra las pruebas adversarias en su suite de Governance, junto a los northstars y las auditorías de producción. Encaja en el marco de gobernanza de IA que necesita un despliegue empresarial. El equipo que despliega el agent evalúa el comportamiento hostil con las mismas herramientas que ya usa para evaluar todo lo demás.

Nosotros también nos sometemos a ellas. El trust centre de HappyRobot incluye un informe AI Red Team & Pentest 2026 junto con el SOC 2 Type II, el certificado ISO 27001:2022 y una evaluación de riesgos de seguridad de LLM, todos disponibles bajo petición. Es poco habitual ver siquiera listada una evaluación específica de IA, y es el documento que pide un comité de revisión en cuanto empieza a tratar al agent como una superficie de ataque propia y no como una integración más.

Para una comparativa más amplia de la plataforma, lee cómo se compara HappyRobot con otras plataformas empresariales de agents de IA.

Entrenamiento adversario frente a pruebas adversarias

La diferencia clave entre el entrenamiento adversario y las pruebas adversarias es que el entrenamiento modifica los pesos del modelo antes del despliegue. Las pruebas no cambian nada: puntúan cómo se comporta un agent ya construido en una llamada hostil.

FunctionAdversarial trainingAdversarial testing
What it acts onThe model's weights while the model is being trainedAn agent that is already built and configured
When it runsBefore the model is deployed anywhereBefore the agent takes live calls, and again on sampled production calls
What it changesThe model learns to classify adversarial examples correctlyNothing in the model; your team rewrites the agent's instructions and standards
The question it answersCan a crafted input fool this model?Does the agent hold its rules across a full conversation?
Who runs itWhoever trained the modelThe team deploying the agent
What you get backA retrained modelA pass or fail for each behavioral standard, with the turn where it broke
Adversarial Training vs. Adversarial Testing

Entrenamiento adversario

El entrenamiento adversario es una defensa de machine learning que se aplica mientras se entrena el modelo. Tu equipo alimenta el modelo con ejemplos adversarios y sus etiquetas correctas, y el optimizador ajusta los pesos hasta que el modelo acierta. La frontera de decisión se desplaza y las entradas que antes la cruzaban dejan de hacerlo.

Todo esto ocurre antes del despliegue, y por eso la mayoría del material publicado sobre IA adversaria describe esto y se detiene aquí.

Pruebas adversarias

Las pruebas adversarias evalúan un agent ya construido. Tu equipo lo somete a conversaciones hostiles y una auditoría revisa cada transcripción frente a los estándares que tu equipo redactó. La auditoría informa de qué estándar incumplió el agent y en qué turno, para que tu equipo pueda corregir la instrucción que lo permitió. Los resultados adversarios se suman a los demás métodos de evaluación de agents de IA que tu equipo ya utiliza.

El modelo permanece exactamente igual. Lo que cambia son las instrucciones del agent, y esas pertenecen a tu equipo.

Cómo son las pruebas de IA adversaria en la práctica

Las pruebas de IA adversaria constan de tres pasos, y tu equipo configura los tres.

Adversarial AI Testing

The three steps of an adversarial test

Paso 1: define al atacante

Un prompt adversario establece la persona, el objetivo y la estrategia de ataque del usuario simulado. Este paso determina el valor de la prueba.

«Un transportista enfadado que intenta conseguir una confirmación de tarifa no autorizada» le da al atacante algo que perseguir a lo largo de los turnos. Una instrucción genérica para romper al agent produce una conversación sobre la que nadie puede actuar.

Paso 2: ejecuta una sesión en sandbox

El agent y el agent adversario mantienen una conversación en directo entre dos agents dentro de un sandbox, sin impacto alguno en clientes reales ni en datos de producción. Ambas partes generan sus turnos a medida que avanza la conversación, de modo que tu agent debe responder a un atacante que reacciona a lo que acaba de decir, en lugar de leer una transcripción guionizada.

Paso 3: evalúa el resultado

Una auditoría de comportamiento contrasta la transcripción con cada estándar definido por tu equipo y devuelve un apto o un no apto para cada uno. HappyRobot llama a estos estándares northstars, y un northstar fallido vuelve con una sugerencia de corrección adjunta.

Cómo funciona la función Adversarial Agents de HappyRobot

HappyRobot es una plataforma de agents de IA para operaciones empresariales, y llama a sus agents de IA AI workers. Esos AI workers operan por voz, email, SMS, WhatsApp y chat, así que las pruebas deben cubrir el canal en el que esté desplegado el worker.

Adversarial Agents HappyRobot

HappyRobot Governance with Adversarial Agents


Adversarial Agents se ejecutan dentro de la suite completa de Governance, junto con northstars, auditorías y pruebas que evalúan ejecuciones en directo. Las pruebas individuales se agrupan en una suite, de modo que una release ejecuta todos los ataques a la vez en lugar de una persona cada vez.

Cómo proteger a los agents de IA frente a ataques adversarios

Proteger a los agents de IA frente a ataques adversarios exige ejecutar el ataque antes del lanzamiento y repetirlo después contra el tráfico real. Los mismos estándares de comportamiento se aplican en las tres etapas, y eso es lo que hace comparables los resultados de un mes con los del siguiente.

Antes del despliegue

El primer interlocutor hostil de tu agent debería ser uno creado por tu equipo. Ejecuta la suite adversaria mientras el agent sigue en el sandbox y retén el lanzamiento hasta que los resultados arrojen una tasa de aprobación que tu equipo esté dispuesto a validar. Trata esa tasa como un mínimo, no como una garantía. Solo indica que el agent sobrevive a los ataques que se te ocurrieron.

  • Cubre las cinco categorías de ataque, incluida la manipulación conversacional
  • Convierte la ejecución en un requisito de release, igual que ya lo son las pruebas de carga y de integración

En producción

Una suite de pruebas contiene los ataques que alguien imaginó. Los interlocutores reales llegan con el resto, así que la auditoría que se ejecutó antes del lanzamiento debe seguir ejecutándose contra el tráfico real.

Run adversarial tests in the sandbox

Run adversarial tests in the sandbox, not against production. Once live, audit instead of attack.

Una vez en directo, audita las pruebas adversarias en el sandbox en lugar de atacar.

  • Muestrea conversaciones en directo y puntúalas con los mismos northstars que usaron las pruebas adversarias
  • Revisa los northstars fallidos con una periodicidad fija, para que tu equipo detecte un nuevo patrón en días y no en el siguiente ciclo de pruebas

Continuo

Cada ataque que funcionó una vez es una prueba que tu equipo ya posee. Añadirlo a la suite de regresión significa que ese mismo planteamiento se comprueba en cada release sin que nadie tenga que acordarse de ejecutarlo.

  • Convierte cada fallo de producción confirmado en una prueba de regresión
  • Cuenta con que el conjunto de pruebas crecerá cada vez que alguien que llama encuentre una brecha

Proteger los sistemas de IA frente a ataques adversarios sigue las mismas tres fases, con una diferencia. Para un modelo, la fase previa al lanzamiento es el entrenamiento adversario. Para un agent desplegado, son las pruebas adversarias.

Limitaciones

Las pruebas adversarias reducen el riesgo de que quien llama con malas intenciones consiga lo que busca, pero no lo eliminan. Ningún conjunto de pruebas contiene todos los ataques que una persona decidida acabará probando, y un ataque que nadie incluyó en el conjunto es uno al que tu agent se enfrenta sin haber sido probado en una llamada real.

El mismo límite se nos aplica a nosotros. Un red team externo encuentra lo que un conjunto interno no pensó en buscar, y por eso el informe AI Red Team & Pentest existe junto a nuestras propias pruebas adversarias, y no en lugar de ellas.

Un agent adversario ataca solo de la forma que le indica su prompt. Un conjunto construido a partir de un puñado de personas escritas a mano devuelve una tasa de éxito que describe a esas personas y nada más, de modo que tu equipo puede dar el visto bueno a un agent que nunca se probó frente al enfoque que trae quien llama de verdad. La tasa de éxito vale lo que cubre la lista de escenarios.

Qué hacer antes de que tu agent atienda una llamada real

Ejecuta la prueba adversaria antes de que tu agent atienda su primera llamada real y trata el resultado como una puerta de publicación. Incorpora las cinco categorías de ataque a tu conjunto de pruebas, puntúa cada sesión según los estándares que definió tu equipo y añade cada fallo en producción al conjunto de regresión.

HappyRobot ejecuta esto dentro de su suite de Governance, donde los northstars puntúan cada sesión según las reglas que escribió tu equipo. El resultado te dice qué regla se incumplió y en qué turno, de modo que tu equipo sabe qué corregir antes de que lo descubra quien llama.

Envíanos la formulación que burló a tu último agent y la probaremos con el nuestro. Reserva una demo de HappyRobot para ejecutar una sesión adversaria contra tu propia configuración.






Preguntas frecuentes

  • ¿Qué es la IA adversaria?
    La IA adversaria abarca cualquier intento deliberado de hacer que un sistema de IA se comporte de forma incorrecta. Eso incluye una entrada diseñada para engañar a un modelo entrenado y una conversación que lleva a un agent desplegado más allá de sus reglas.
  • ¿Cuál es la diferencia entre entrenamiento adversario y pruebas adversarias?
    El entrenamiento adversario modifica los pesos de un modelo antes del despliegue. Las pruebas adversarias evalúan el comportamiento de un agent ya construido y no cambian nada dentro del modelo.
  • ¿Qué es el prompting adversario en IA?
    El prompting adversario es una entrada conversacional diseñada, que incluye intentos de jailbreak y presión mediante juegos de rol, con el fin de lograr que un agent en activo ignore sus instrucciones.
  • ¿Qué es un ataque de inyección de prompts a un agent de IA?
    Un ataque de inyección de prompts oculta una instrucción dentro de una entrada que el agent lee como contenido ordinario, como el cuerpo de un correo o el campo de un documento, de modo que el agent ejecuta la instrucción oculta sin que quien llama tenga que pedirlo directamente.
  • ¿Cómo se protegen los agents de IA frente a ataques adversarios?
    Ejecuta conjuntos de pruebas adversarias en las cinco categorías de ataque antes del despliegue. Después, audita las conversaciones en directo con los mismos estándares y convierte cada fallo real en una prueba de regresión.
  • ¿Es seguro ejecutar pruebas adversarias contra un agent en activo?
    Ejecútalas en un sandbox, no contra producción. El agent objetivo y el agent adversario conversan en una sesión aislada, de modo que nada llega a un cliente real ni a un registro de producción. Una vez que el agent está en activo, el equivalente es auditar una muestra de conversaciones reales con los mismos estándares, lo que puntúa el comportamiento sin provocarlo.
  • ¿Los despliegues de IA empresariales necesitan pruebas adversarias?
    Cualquier agent que gestione grandes volúmenes o conversaciones reguladas debería probarse frente a comportamientos hostiles y fuera de guion antes de salir en directo, igual que se prueba su escalabilidad y la fiabilidad de sus integraciones.