---
title: "Seguridad de agentes de IA: OWASP Top 10, incidentes y defensas · DotsAgent"
description: "Referencia sobre seguridad de agentes: las dos listas OWASP Top 10 de 2026, 17 incidentes reales de MCP a OpenClaw, 15 defensas y una lista de verificación para equipos que ponen agentes de IA en producción."
url: https://dotsagent.io/es/security
---

Seguridad · referencia

# Seguridad de agentes

Los agentes leen texto escrito por desconocidos y luego actúan con tus credenciales. Esta página presenta la regla fundamental, las dos listas OWASP de 2026, los incidentes ocurridos hasta ahora y las defensas que los habrían evitado.

## La tríada letal

1. **Acceso a datos privados** Correo electrónico, repositorios, bases de datos, archivos o cualquier otro recurso protegido por tus credenciales.
2. **Exposición a contenido no confiable** Páginas web, incidencias, tickets de soporte, correos entrantes y descripciones de herramientas: cualquier texto que pueda escribir un atacante.
3. **Capacidad de comunicarse con el exterior** Enviar correo, abrir pull requests, obtener URL o cargar imágenes remotas. Simon Willison dio nombre a esta combinación de tres elementos en junio de 2025.

Si un agente reúne los tres elementos, da por hecho que una inyección de prompt puede hacer que entregue tus datos a un atacante. No confíes en que el modelo se niegue: elimina al menos uno de los elementos de cada agente y sesión.

- [Lista de verificación de seguridad](https://dotsagent.io/es/security/checklist): 22 comprobaciones sobre entradas, herramientas, entorno de ejecución, MCP, CI y operaciones. Márcalas a medida que avances y exporta el resultado como archivo Markdown.

- [Registro de incidentes](https://dotsagent.io/es/security/incidents): Para cada incidente público de seguridad de agentes desde abril de 2025: qué ocurrió, por qué funcionó el ataque y qué debes cambiar en tu propia configuración.

## Incidentes recientes

- 5 jun 2026 [Secuestro de sesiones y acceso a tareas de otras sesiones en el MCP Python SDK](https://dotsagent.io/es/security/incidents/2026-06-mcp-python-sdk-session-hijack)
- jun 2026 [La aprobación automática de WebFetch en Claude Code permitió exfiltrar datos a través de huggingface.co](https://dotsagent.io/es/security/incidents/2026-06-claude-code-webfetch-exfiltration)
- 15 abr 2026 [Comment and Control: el texto de los PR roba secretos de agentes de CI](https://dotsagent.io/es/security/incidents/2026-04-comment-and-control-ci-secrets)
- 4 feb 2026 [El MCP TypeScript SDK filtró respuestas entre clientes](https://dotsagent.io/es/security/incidents/2026-02-mcp-typescript-sdk-response-leak)
- 1 feb 2026 [ClawHavoc: cientos de skills maliciosas de ClawHub distribuyen AMOS](https://dotsagent.io/es/security/incidents/2026-02-clawhavoc-malicious-skills)

## OWASP Top 10 para aplicaciones agénticas 2026

El OWASP GenAI Security Project publicó esta lista el 9 de diciembre de 2025. Abarca los riesgos que surgen cuando un modelo planifica, conserva memoria, usa herramientas y trabaja junto con otros agentes.

1. `ASI01` **Secuestro del objetivo del agente** Un atacante cambia el objetivo que persigue el agente, normalmente mediante instrucciones ocultas en el contenido que lee. El agente acaba persiguiendo el objetivo del atacante con las herramientas y los permisos del usuario.
2. `ASI02` **Uso indebido y explotación de herramientas** El agente usa herramientas legítimas de forma dañina, por ejemplo, para borrar registros, enviar mensajes o encadenar llamadas, porque ha sido manipulado o porque dispone de herramientas con más permisos de los necesarios para la tarea.
3. `ASI03` **Abuso de identidad y privilegios** Los agentes actúan mediante credenciales, tokens delegados y permisos heredados. Los atacantes aprovechan esas identidades, o las brechas entre ellas, para escalar privilegios o actuar en nombre de otra persona.
4. `ASI04` **Vulnerabilidades en la cadena de suministro agéntica** Las herramientas, los servidores MCP, las skills, los plugins, los modelos y los prompts que se cargan durante la compilación o en tiempo de ejecución pueden ser maliciosos o estar comprometidos. Como los agentes cargan muchos de estos componentes de forma dinámica, un solo componente malicioso afecta a todas las sesiones que lo usan.
5. `ASI05` **Ejecución de código inesperada (RCE)** Los agentes que escriben y ejecutan código, o que envían la salida del modelo a shells e intérpretes, pueden ser inducidos a ejecutar en el host los comandos elegidos por el atacante.
6. `ASI06` **Envenenamiento de memoria y contexto** Los atacantes introducen datos falsos o instrucciones en la memoria del agente, en documentos recuperados o en el contexto guardado. El envenenamiento persiste y condiciona sesiones posteriores mucho después de que desaparezca la entrada original.
7. `ASI07` **Comunicación insegura entre agentes** Los mensajes entre agentes circulan sin la autenticación, las comprobaciones de integridad o la validación adecuadas, por lo que pueden suplantarse, reproducirse o modificarse para engañar al agente que los recibe.
8. `ASI08` **Fallos en cascada** Un fallo, como una entrada envenenada, un resultado incorrecto de una herramienta o un agente comprometido, se propaga por los agentes conectados y los pasos automatizados más rápido de lo que las personas pueden detectarlo.
9. `ASI09` **Explotación de la confianza en los agentes** Los agentes parecen seguros de sí mismos y serviciales, por lo que las personas tienden a aprobar sus propuestas. Los atacantes aprovechan esa confianza para conseguir que alguien confirme una acción dañina o revele información.
10. `ASI10` **Agentes fuera de control** Un agente comprometido o que se ha desviado de su comportamiento previsto sigue actuando por su cuenta, fuera del alcance y la supervisión que se le habían asignado.

## OWASP Top 10 para aplicaciones con LLM 2026

Esta edición se publicó el 4 de agosto de 2026 y sustituye a la lista de 2025. Excessive Agency pasó del sexto al tercer puesto y System Prompt Leakage cambió de nombre a Hidden Context Exposure.

1. `LLM01` **Inyección de prompts** Una entrada altera el comportamiento del modelo de formas que el desarrollador no pretendía. Puede proceder directamente del usuario o, de forma indirecta, de documentos, páginas web y resultados de herramientas que el modelo consulta.
2. `LLM02` **Divulgación de información confidencial** El modelo o la aplicación revela datos personales, credenciales, secretos comerciales u otro material confidencial en sus respuestas, procedente de los datos de entrenamiento, el contexto o los sistemas conectados.
3. `LLM03` **Exceso de agencia** La aplicación concede al modelo más funciones, permisos o autonomía de los que requiere la tarea, de modo que una respuesta manipulada o errónea causa daños reales. Pasó del sexto puesto en 2025 al tercero en 2026.
4. `LLM04` **Cadena de suministro** Los modelos, conjuntos de datos, adaptadores, paquetes y plugins de terceros pueden estar manipulados o ser vulnerables, y trasladan ese riesgo a tu aplicación.
5. `LLM05` **Envenenamiento de datos y modelos** Los atacantes manipulan los datos de preentrenamiento, ajuste fino o embeddings para introducir puertas traseras, sesgos o comportamientos defectuosos que solo se manifiestan más adelante en producción.
6. `LLM06` **Consumo ilimitado** Sin límites para las solicitudes, el tamaño de las entradas o la capacidad de cómputo, los atacantes pueden disparar los costes, agotar los recursos o copiar un modelo mediante consultas de gran volumen.
7. `LLM07` **Desinformación** El modelo genera resultados falsos o engañosos que parecen creíbles, y los usuarios o los sistemas posteriores actúan basándose en ellos sin verificarlos.
8. `LLM08` **Exposición del contexto oculto** Antes: filtración del prompt del sistema. Se pueden extraer los prompts del sistema, las instrucciones ocultas y otros datos de contexto que el usuario no debería ver, exponiendo las reglas, la lógica o los secretos incluidos en ellos.
9. `LLM09` **Debilidades en vectores y embeddings** Los fallos en la generación, el almacenamiento y la recuperación de embeddings permiten a los atacantes inyectar contenido, filtrar datos entre tenants o recuperar el texto original. Los sistemas RAG son los más afectados.
10. `LLM10` **Gestión inadecuada de las salidas** Los resultados del modelo llegan a navegadores, shells, bases de datos u otros componentes sin validación ni codificación, lo que abre la puerta a XSS, inyección SQL, ejecución de código y exfiltración de datos.

## Defensas

Quince defensas documentadas, cada una con un enlace a su fuente. Combina varias, porque ninguna detiene por sí sola todos los ataques.

### Rompe la trifecta letal

La regla de Simon Willison: cualquier texto que lea un agente capaz de leer datos privados, consultar contenido no confiable y enviar datos al exterior puede volverse en tu contra. Elimina al menos una de estas tres capacidades de cada agente o sesión. Por ejemplo, el agente que clasifica incidencias públicas no debe tener acceso a secretos, y el que los maneja no debe disponer de un canal de salida.

[simonwillison.net](https://simonwillison.net/2025/jun/16/the-lethal-trifecta/)

### Limita al agente tras recibir entradas no confiables

La investigación sobre patrones de diseño para la seguridad de agentes establece una regla: una vez que un agente ha procesado una entrada no confiable, esa entrada no debe poder desencadenar acciones con consecuencias. Entre los patrones se incluyen el selector de acciones, planificar y luego ejecutar, el uso de dos LLM y la minimización del contexto. Elige uno por flujo de trabajo; por ejemplo, fija el plan antes de que el agente lea datos no confiables.

[arxiv.org](https://arxiv.org/abs/2506.08837)

### Rastrea el flujo de datos con CaMeL

CaMeL divide el agente en dos: un planificador con privilegios escribe código a partir de la solicitud del usuario, y un modelo aislado procesa los datos no confiables. Los valores del modelo aislado llevan etiquetas de capacidades, y las políticas comprueban esas etiquetas antes de ejecutar cualquier herramienta. En el artículo, resolvió el 77% de las tareas de AgentDojo con seguridad demostrable, frente al 84% de un agente sin defensas.

[arxiv.org](https://arxiv.org/abs/2503.18813)

### Usa credenciales con privilegios mínimos

De forma predeterminada, concede a los agentes acceso de solo lectura y limitado al proyecto. Nunca les des una clave de administrador ni una clave service_role, que en Supabase omite la seguridad a nivel de fila. Limita los tokens de CI y del repositorio al único trabajo que deben realizar. El incidente de Amazon Q Developer se debió a un token de GitHub con permisos excesivos en CodeBuild.

[supabase.com](https://supabase.com/blog/defense-in-depth-mcp)[aws.amazon.com](https://aws.amazon.com/security/security-bulletins/AWS-2025-015/)

### Exige aprobación para las acciones con consecuencias

Haz que una persona confirme las llamadas a herramientas que escriban, eliminen, envíen o gasten dinero, y deniega la acción si nadie responde. Supabase recomienda aprobar manualmente las llamadas a herramientas MCP. En OpenClaw, configura tools.exec.ask como always y deja askFallback en deny. Muestra todos los argumentos para que quien revise la solicitud vea exactamente qué se va a ejecutar.

[supabase.com](https://supabase.com/blog/defense-in-depth-mcp)[docs.openclaw.ai](https://docs.openclaw.ai/tools/exec-approvals)

### Aísla en un sandbox la ejecución de código y herramientas

Ejecuta los comandos de shell y el código generado en un contenedor o una VM sin credenciales y con acceso únicamente al espacio de trabajo. OpenClaw incluye el aislamiento en sandbox desactivado y tools.exec.security en full en los hosts del gateway. Por tanto, activa el aislamiento en sandbox, configura la seguridad de exec como deny o allowlist, establece fs.workspaceOnly en true y mantén desactivado el modo elevado. Comprueba el resultado con openclaw sandbox explain.

[docs.openclaw.ai](https://docs.openclaw.ai/gateway/sandboxing)[docs.openclaw.ai](https://docs.openclaw.ai/gateway/security/hardened-baseline)

### Restringe el tráfico de red saliente

Deniega de forma predeterminada el tráfico saliente de los agentes y servidores MCP, y luego permite solo los hosts que necesite cada uno. No apruebes automáticamente solicitudes a hosts multiusuario donde cualquiera pueda publicar contenido: así fue como CVE-2026-54316 convirtió huggingface.co en un canal de exfiltración. Un servidor de correo debería poder conectarse a su API de correo y a nada más, como demostró postmark-mcp.

[nvd.nist.gov](https://nvd.nist.gov/vuln/detail/CVE-2026-54316)[koi.ai](https://www.koi.ai/blog/postmark-mcp-npm-malicious-backdoor-email-theft)

### Mantén los planos de control fuera de Internet

Vincula los gateways de agentes, los paneles y los proxies de depuración a loopback, y exige un token de al menos 24 caracteres, por ejemplo, generado con openssl rand -hex 32. Accede a ellos de forma remota mediante un túnel SSH o Tailscale Serve, y usa Tailscale Funnel solo con autenticación por contraseña. Ejecuta openclaw security audit --deep de forma periódica.

[docs.openclaw.ai](https://docs.openclaw.ai/gateway/security/network-exposure)[docs.openclaw.ai](https://docs.openclaw.ai/gateway/tailscale)[docs.openclaw.ai](https://docs.openclaw.ai/gateway/security/running-the-audit)

### Valida la audiencia de los tokens MCP

La especificación de autorización de MCP exige que el servidor rechace los tokens de acceso que no se hayan emitido para él, y prohíbe reenviar el token de un cliente a una API upstream. Los clientes envían indicadores de recurso RFC 8707 para vincular cada token a un único servidor. Un servidor proxy necesita el consentimiento de cada cliente; de lo contrario, se convierte en un confused deputy.

[modelcontextprotocol.io](https://modelcontextprotocol.io/specification/2026-07-28/basic/authorization/security-considerations)[modelcontextprotocol.io](https://modelcontextprotocol.io/docs/tutorials/security/security_best_practices)

### Aísla las sesiones y los tenants de MCP

Crea una instancia independiente del servidor y del transporte para cada sesión, en lugar de compartir una entre clientes. Vincula cada sesión y tarea a la identidad autenticada que la creó, y comprueba esa vinculación en cada solicitud. Los dos avisos de seguridad de los SDK de MCP de 2026 se debieron a estados compartidos o sin vincular.

[github.com](https://github.com/advisories/GHSA-345p-7cg4-v4c7)[github.com](https://github.com/advisories/GHSA-JPW9-PFVF-9F58)

### Verifica skills, plugins y servidores MCP

Fija versiones exactas, revisa el diff antes de cada actualización y comprueba los resultados de escáneres como VirusTotal y el estado de la auditoría de seguridad de ClawHub. Guarda un hash de las descripciones de las herramientas cuando apruebes un servidor y genera una alerta si cambian; así podrás detectar rug pulls. OpenClaw no bloquea nada de forma integrada durante la instalación, así que configura security.installPolicy por tu cuenta.

[openclaw.ai](https://openclaw.ai/blog/virustotal-partnership)[docs.openclaw.ai](https://docs.openclaw.ai/clawhub/security-audits)[invariantlabs.ai](https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks)[docs.openclaw.ai](https://docs.openclaw.ai/help/faq/security-and-access-control)

### Controla quién puede enviar mensajes al agente

Limita el acceso por mensaje directo al emparejamiento o a una lista de permitidos, exige una mención antes de que el agente actúe en chats grupales y configura session.dmScope como per-channel-peer para que los remitentes nunca compartan el contexto. Cualquiera que pueda enviar mensajes al agente puede intentar darle instrucciones, así que la lista de remitentes forma parte de tu superficie de ataque.

[docs.openclaw.ai](https://docs.openclaw.ai/gateway/security/access-control)[docs.openclaw.ai](https://docs.openclaw.ai/gateway/security/hardened-baseline)

### Mantén los secretos fuera de las ejecuciones de CI no confiables

No ejecutes un agente con secretos del repositorio en flujos de trabajo que personas ajenas puedan activar mediante un pull request, un issue o un comentario. Trata como hostiles los títulos, las descripciones y los comentarios de esos eventos. Si un paso realmente necesita secretos, ejecútalo solo después de que una persona mantenedora haya aprobado la ejecución.

[oddguan.com](https://oddguan.com/blog/comment-and-control-prompt-injection-credential-theft-claude-code-gemini-cli-github-copilot/)

### Trata la salida del modelo como no confiable

Codifica o sanea la salida del modelo antes de mostrarla, y nunca la pases sin comprobar a un shell, una consulta SQL o un navegador. Bloquea la carga automática de imágenes Markdown y de enlaces a dominios externos, y establece una Content Security Policy estricta. EchoLeak exfiltró datos mediante URL que se cargaban por sí solas.

[genai.owasp.org](https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/)[nvd.nist.gov](https://nvd.nist.gov/vuln/detail/cve-2025-32711)

### Verifica las firmas del agente y luego autorízalo

Para identificar a un agente que accede a tu sitio o API, verifica su firma Web Bot Auth con las claves que publica el operador en /.well-known/http-message-signatures-directory. ChatGPT agent firma como Signature-Agent https://chatgpt.com. Una firma válida te indica quién opera el agente, no qué usuario lo ha enviado ni qué puede hacer ese usuario. Por tanto, autoriza cada solicitud por separado.

[datatracker.ietf.org](https://datatracker.ietf.org/doc/draft-ietf-webbotauth-httpsig-protocol/)[help.openai.com](https://help.openai.com/en/articles/11845367-chatgpt-agent-allowlisting)

## Preguntas sobre la seguridad de agentes

### ¿Qué es la inyección de prompt en los agentes de IA?

El prompt injection es texto que el modelo interpreta como instrucciones aunque haya llegado como dato, por ejemplo, en una página web, un correo electrónico o la descripción de una herramienta. En un agente, esas instrucciones pueden provocar llamadas a herramientas que se ejecuten con tus credenciales. OWASP lo incluye como LLM01:2026, y Agent Goal Hijack (ASI01) abarca su forma agéntica.

### ¿Qué es la tríada letal de los agentes de IA?

Es el nombre que Simon Willison da a un agente que combina acceso a datos privados, exposición a contenido no confiable y una forma de comunicarse con el exterior. Si se dan las tres condiciones, un prompt injection puede leer tus datos y enviarlos fuera. La filtración del token de Supabase MCP de 2025 es un caso de manual.

### ¿Cómo protejo un servidor MCP?

Rechaza los tokens de acceso que no se hayan emitido para tu servidor y nunca reenvíes el token de un cliente a una API upstream. Crea una instancia de servidor y otra de transporte por sesión, y vincula las sesiones y las tareas al usuario autenticado. Usa el SDK de TypeScript 1.26.0 o posterior y el SDK de Python 1.27.2 o posterior, que corrigen una filtración de respuestas entre clientes y el secuestro de sesiones.

### ¿Un mejor prompt de sistema puede detener el prompt injection?

No confíes en ello. La investigación sobre patrones de diseño para agentes sostiene que, una vez que un agente ha procesado entradas no confiables, hay que limitarlo para impedir que esas entradas provoquen acciones con consecuencias. CaMeL, que lo consigue mediante el seguimiento de capacidades, resolvió el 77% de las tareas de AgentDojo con seguridad demostrable, frente al 84% de un agente sin protección.

### ¿Qué diferencia hay entre OWASP LLM Top 10 y Agentic Top 10?

OWASP Top 10 for LLM Applications, cuya edición de 2026 se publicó el 4 de agosto de 2026, abarca los riesgos de cualquier aplicación basada en un modelo de lenguaje. OWASP Top 10 for Agentic Applications, publicado el 9 de diciembre de 2025, aborda los cambios que se producen cuando el modelo planifica, usa herramientas, conserva memoria y se comunica con otros agentes. La mayoría de quienes desarrollan agentes necesitan tener en cuenta ambos.

### ¿Es seguro exponer un gateway de OpenClaw a Internet?

No. Deja gateway.bind con su valor predeterminado, loopback, y usa un túnel SSH o Tailscale Serve cuando necesites acceso remoto. OpenA2A contabilizó 192,492 gateways expuestos el 1 de septiembre de 2026, y CVE-2026-25253 demostró que incluso las instalaciones limitadas a loopback necesitan parches cuanto antes.

## Fuentes

1. [genai.owasp.org](https://genai.owasp.org/resource/owasp-top-10-for-agentic-applications-for-2026/)/resource/owasp-top-10-for-agentic-applications-for-2026/
2. [genai.owasp.org](https://genai.owasp.org/download/52117)/download/52117
3. [genai.owasp.org](https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/)/resource/owasp-genai-llm-top-10-2026/
4. [github.com](https://github.com/GenAI-Security-Project/GenAI-LLM-Top10)/GenAI-Security-Project/GenAI-LLM-Top10

Referencia independiente para quienes crean agentes de IA. No estamos afiliados a ninguno de los proveedores mencionados aquí.

© 2026 DotsAgent · Datos verificados el 1 de octubre de 2026
