OWASP Top 10 2026: de tien risico’s die AI-toepassingen bedreigen

La adopción de aplicaciones basadas en modelos de lenguaje de gran tamaño, conocidos como LLM, está trasladando parte de los riesgos de seguridad tradicionales hacia una capa completamente nueva: cómo los modelos reciben información, utilizan herramientas y generan respuestas que luego pueden ejecutarse en otros sistemas. El nuevo OWASP Top 10 para aplicaciones de LLM 2026 recopila los diez riesgos más relevantes que la organización considera para este tipo de arquitecturas, desde la inyección de prompts hasta fallos en la gestión de los resultados generados por la IA.

Las claves de los riesgos de seguridad de la IA en 30 segundos

  • OWASP sitúa la inyección de prompts en la primera posición, aunque también advierte sobre problemas que surgen cuando un LLM tiene acceso a datos, herramientas y memoria.
  • La exposición de información confidencial puede ocurrir en respuestas, registros, embeddings, llamadas a herramientas y otros componentes de la aplicación.
  • El exceso de autonomía aumenta el riesgo cuando un agente puede modificar datos, enviar mensajes, ejecutar código o realizar operaciones sin supervisión.
  • La cadena de suministro, el envenenamiento de datos y el consumo ilimitado introducen riesgos que afectan tanto a la seguridad como a los costes.
  • Los cuatro últimos riesgos abarcan desinformación, exposición de contexto oculto, vulnerabilidades en embeddings y un manejo inseguro de las respuestas del modelo.

Este documento destaca una diferencia importante respecto a muchas aplicaciones de software convencionales. En un sistema tradicional, las fronteras entre datos, instrucciones y permisos suelen estar claramente delimitadas mediante código. En una aplicación basada en LLM, buena parte de esas fronteras pasan por un modelo que procesa texto, imágenes, documentos, memoria y resultados de herramientas dentro de un mismo flujo de contexto.

Esto significa que la seguridad no puede depender únicamente de detectar entradas maliciosas antes de que lleguen al modelo. OWASP propone controles que abarcan toda la arquitectura: permisos, herramientas, datos, almacenamiento, proveedores, validación de resultados y supervisión humana.

1. Inyección de prompts: el modelo no distingue qué es una instrucción y qué es un dato

La inyección de prompts ocupa la primera posición en la clasificación. El problema surge cuando una entrada modifica el comportamiento esperado del modelo. Esa entrada puede ser un mensaje del usuario, pero también un documento recuperado mediante RAG, un correo electrónico, una página web, una imagen, una respuesta de una herramienta o información almacenada en memoria persistente.

Una de las dificultades consiste en que el LLM procesa instrucciones y datos como tokens dentro de su contexto. Si la aplicación combina el prompt del sistema, instrucciones del usuario, documentos externos y memoria sin controles adecuados, cierta información puede influir sobre el comportamiento del modelo.

OWASP distingue entre inyección directa e indirecta. La primera proviene del usuario. La segunda sucede cuando el modelo procesa contenido externo que contiene instrucciones maliciosas, quizás sin que el usuario sea consciente de ello.

El riesgo aumenta cuando el agente cuenta con herramientas. Una instrucción en un documento puede dejar de ser simple texto malicioso y desencadenar llamadas a API, modificar archivos o transmitir información.

Por ello, el informe recomienda mantener las credenciales y capacidades de alterar el estado fuera del modelo, limitar los permisos y exigir aprobación humana para acciones privilegiadas o irreversibles. También sugiere controles estrictos cuando un agente combina acceso a información sensible, contenido no confiable y comunicación externa.

2. Exposición de información confidencial: el dato puede filtrarse por múltiples canales

El segundo riesgo es la exposición de información confidencial. No se limita a que el chatbot muestre accidentalmente un secreto en una respuesta.

Los argumentos enviados a herramientas, fragmentos recuperados mediante RAG, registros, telemetría, embeddings e incluso ciertas propiedades observables del sistema pueden convertirse en canales de filtración.

OWASP identifica momentos clave de exposición: durante entrenamiento, inferencia, ajuste o destilación, y fases de monitorización y observación.

El informe también advierte sobre los almacenes vectoriales. Un respaldo que solo contiene embeddings no debe considerarse automáticamente seguro, ya que técnicas pueden permitir reconstruir información procedente de documentos originales.

Se recomienda clasificar y controlar los datos desde su origen, reducir la cantidad de información compartida con terceros, autorizar el acceso antes de recuperar cada fragmento y utilizar mecanismos de detección y filtrado.

3. Exceso de autonomía: cuando el agente puede hacer demasiado

La tercera posición corresponde al exceso de autonomía. Este término describe sistemas donde el LLM dispone de muchas herramientas, permisos o autonomía excesiva.

Por ejemplo, un asistente que lee documentos podría tener también permisos para modificarlos o eliminarlos. Una herramienta que consulta bases de datos podría tener permisos de escritura, pese a que su tarea solo requiere lectura.

La situación se vuelve más peligrosa cuando el modelo puede enviar correos, ejecutar comandos, realizar pagos o modificar sistemas sin supervisión externa.

OWASP propone limitar las herramientas y funciones, aplicar permisos mínimos y gestionar la autorización fuera del LLM. El modelo puede decidir qué acciones tomar, pero la decisión final sobre permisos debe estar fuera de él.

La aprobación humana es fundamental para acciones irreversibles o de alto impacto.

4. Cadena de suministro: también en modelos y dependencias externas

La cadena de suministro ocupa la cuarta posición. En aplicaciones de IA, el perímetro va más allá del software: incluye modelos preentrenados, conjuntos de datos, adaptadores, componentes de terceros y procesos de conversión, cuantización o integración de modelos.

Un modelo que parece legítimo puede haber sido manipulado, una dependencia puede contener código malicioso y un conjunto de datos puede estar contaminado. Además, hay riesgos relacionados con licencias y condiciones de uso de modelos y datos.

OWASP recomienda mantener un inventario actualizado, verificar origen y autenticidad, emplear firmas y controles de integridad, y someter modelos externos a evaluaciones de seguridad y red teaming.

5. Envenenamiento de datos y modelos: el aprendizaje puede ser manipulado

El envenenamiento de datos y modelos compromete la integridad del sistema. Un atacante puede introducir datos maliciosos durante entrenamiento, ajuste o generación de embeddings, así como en sistemas RAG o aprendizaje continuo.

El peligro es que el sistema siga funcionando aparentemente bien, pero con comportamientos incorrectos incorporados.

OWASP recomienda mantener la trazabilidad de datos y modelos mediante listas de materiales (SBOM y ML-BOM), verificar la procedencia y controlar cambios a lo largo de todo su ciclo de vida.

En aplicaciones RAG, también es fundamental establecer límites de confianza y filtrar contenido antes de su incorporación al contexto del modelo.

6. Consumo ilimitado: las consultas pueden generar costos inesperados

El consumo ilimitado introduce riesgos económicos que en sistemas tradicionales no siempre existen. Una aplicación que permite inferencias muy grandes o numerosas puede provocar problemas de disponibilidad, costos elevados o intentos de sobrecargar el sistema.

Modelos de razonamiento, entradas multimodales y agentes que realizan múltiples llamadas pueden multiplicar el consumo por consulta.

OWASP describe escenarios como la Denial of Wallet, donde un atacante genera suficientes operaciones para disparar una factura de IA basada en consumo.

Para mitigar estos riesgos, se recomienda establecer límites de uso, presupuestos por usuario o aplicación, controles sobre tamaño de entrada y mecanismos automáticos para frenar flujos excesivos.

7. Desinformación: respuestas convincentes pueden ser erróneas

El séptimo riesgo es la desinformación generada por el modelo. Una respuesta incorrecta puede parecer plausiblemente correcta, induciendo a errores si se utiliza para decisiones o acciones.

Causas comunes incluyen alucinaciones, información desactualizada, contexto insuficiente, datos incorrectos o resultados de herramientas no verificados.

El riesgo se agrava si esas respuestas desencadenan acciones. Un error en una conversación puede ser solo una respuesta equivocada; en un agente, puede modificar estados, generar código o tomar decisiones empresariales.

OWASP recomienda separar la generación de la ejecución, verificar afirmaciones antes de actuar y validar permisos y condiciones en llamadas a herramientas.

8. Exposición de contexto oculto: los prompts del sistema también contienen información sensible

El octavo riesgo refiere a la exposición del contexto oculto. Las aplicaciones suelen proporcionar instrucciones internas al modelo, como system prompts, reglas, políticas, esquemas o información recuperada de sistemas internos.

Extraer dicho contexto en sí no siempre constituye una vulnerabilidad, pero se vuelve problemático si contiene secretos, reglas internas, permisos o información que puede ser utilizada para atacar o entender las defensas de la aplicación.

OWASP aconseja no incluir secretos en ese contexto y mantener controles de seguridad y autorización fuera del LLM.

9. Debilidades en vectores y embeddings: el buscador también representa un vector de ataque

Los vectores y embeddings son esenciales en muchas aplicaciones RAG, pero conllevan riesgos específicos.

Una aplicación puede convertir documentos, imágenes o audio en representaciones numéricas y utilizar similitud entre vectores para recuperar información. Sin controles adecuados, un atacante podría acceder a datos de otros usuarios mediante patrones en resultados, puntuaciones o tiempos de respuesta.

OWASP advierte sobre riesgos de inversión de embeddings, inferencia de pertenencia, manipulación en recuperación, contaminación de cachés semánticas y ataques multimodales.

La solución implica gestionar permisos antes o durante la recuperación, separar datos por confianza, verificar origen y monitorizar comportamientos anómalos.

10. Manejo inapropiado de resultados: nunca confiar ciegamente en la salida del LLM

El décimo riesgo es el manejo inapropiado de los resultados. Ocurre cuando las respuestas del modelo se transmiten a otros sistemas sin validación, sanitización o codificación adecuada.

Un LLM puede generar consultas SQL sin parametrización, órdenes que terminan en shell, o contenido HTML sin escapar correctamente.

También existen riesgos menos evidentes, como secuencias enviadas a terminales, paneles administrativos o registros.

OWASP recomienda tratar la salida como potencialmente peligrosa, validarla según el contexto, aplicar controles de autorización y evitar que el LLM tenga permisos para operaciones privilegiadas.

La idea central de OWASP es que el modelo no debe ser la frontera de seguridad de la aplicación. La gestión de permisos, credenciales, validaciones y decisiones de alto impacto debe mantenerse bajo controles externos al modelo.

A medida que los LLM evolucionan de responder preguntas a leer documentos, consultar bases de datos, ejecutar código y usar herramientas, la seguridad cada vez más depende de cómo se diseña toda la arquitectura en torno a ellos. La lista de riesgos de OWASP funciona como una lista de verificación para evaluar esa arquitectura antes de permitir que un asistente de IA tenga acceso a información o sistemas que una aplicación convencional no podría tocar sin controles específicos.

Preguntas frecuentes

¿Cuál es el principal riesgo de seguridad para las aplicaciones LLM según OWASP?

El OWASP Top 10 para aplicaciones de LLM 2026 sitúa la inyección de prompts en la primera posición. El riesgo puede originarse tanto de instrucciones introducidas directamente por un usuario como de contenidos externos que el modelo procesa.

¿Por qué el exceso de agencia es peligroso en los agentes de IA?

Porque un agente puede disponer de herramientas y permisos para modificar información, ejecutar comandos o comunicarse con otros sistemas. OWASP recomienda limitar esas capacidades y mantener la autorización fuera del modelo.

¿Los embeddings también pueden presentar riesgos de seguridad?

Sí. Los embeddings son parte del control de confianza en muchas aplicaciones RAG, y pueden sufrir ataques de inversión, envenenamiento, inferencia o problemas de acceso entre usuarios.

¿Se puede confiar directamente en las respuestas del LLM?

No cuando esas respuestas se usan para ejecutar acciones o alimentar otros sistemas. OWASP aconseja validar y sanitizar los resultados antes de enviarlos a componentes posteriores.

Scroll naar boven