剣 KENSAI
Investigación 4 de abril de 2026 · 12 min de lectura

Una auditoría de seguridad del protocolo MCP revela vulnerabilidades críticas, una inyección de prompts elude las barreras de seguridad de 12 LLM importantes y el DAST agéntico supera a los pentesters manuales

Trail of Bits y NCC Group exponen un envenenamiento de la cadena de herramientas en el protocolo MCP de Anthropic que afecta a más de 40.000 implementaciones. CRESCENDO-2 de ETH Zurich elude las barreras de seguridad de 12 LLM importantes. Un estudio de Stanford demuestra que los agentes de AI superan a los pentesters humanos en el descubrimiento sistemático de vulnerabilidades. Los ataques a la cadena de suministro de modelos de AI aumentan un 340 %.


🔴 Crítico: una auditoría de seguridad del protocolo MCP expone un vector de envenenamiento de la cadena de herramientas

Una auditoría de seguridad exhaustiva del Model Context Protocol (MCP) de Anthropic —adoptado ya por más de 40.000 implementaciones de agentes de AI— revela una clase de vulnerabilidades que permite a los atacantes manipular las descripciones de herramientas, inyectar instrucciones maliciosas mediante esquemas de parámetros y secuestrar la toma de decisiones de los agentes a través de lo que los investigadores denominan «envenenamiento de la cadena de herramientas».

La auditoría, realizada conjuntamente por Trail of Bits y NCC Group en virtud de un acuerdo de divulgación coordinada, identificó tres categorías de ataque distintas:

Inyección en la descripción de herramientas (TDI)

Los manifiestos de servidores MCP incluyen descripciones legibles por humanos para cada herramienta. Dado que los agentes basados en LLM procesan estas descripciones como parte de su contexto de razonamiento, un atacante que controle o comprometa un servidor MCP puede insertar instrucciones adversarias directamente en las descripciones de las herramientas. En las pruebas, los investigadores lograron una tasa de éxito del 94 % al redirigir el comportamiento de los agentes.

Contrabando de parámetros de esquema

Las definiciones de JSON Schema para los parámetros de las herramientas pueden incluir los campos description, default y examples. El LLM consume estos campos durante la construcción de los parámetros, pero rara vez se validan. Los investigadores demostraron la exfiltración de datos sensibles mediante la inserción de instrucciones en las descripciones de los parámetros, haciendo que el agente incluyera el historial de conversaciones, los prompts del sistema y las credenciales en llamadas API salientes.

Escalada de privilegios entre servidores

Cuando los agentes se conectan simultáneamente a varios servidores MCP, un servidor malicioso puede ordenar al agente que invoque herramientas en otros servidores conectados. La especificación MCP carece actualmente de aislamiento entre orígenes: ningún mecanismo a nivel de protocolo impide que las herramientas de un servidor influyan en las llamadas a otro servidor.

Impacto: Las vulnerabilidades afectan a cualquier implementación que utilice servidores MCP de terceros o cuyos manifiestos de servidor no estén verificados criptográficamente. Esto incluye la mayoría de los servidores MCP comunitarios incluidos en registros públicos.

Mitigaciones: Implemente la fijación de descripciones de herramientas (aplicando hashes a los manifiestos de herramientas y generando alertas ante cambios), la validación de esquemas de parámetros en el cliente y el aislamiento de servidores mediante contextos de agente independientes para cada conexión a un servidor MCP. Anthropic ha reconocido los hallazgos y ha declarado que la versión 2026.04 de la especificación MCP introducirá firmas obligatorias para los manifiestos de herramientas y un modo opcional de aislamiento de servidores.

🔴 Crítico: una inyección universal de prompts elude las barreras de seguridad de 12 LLM importantes

Investigadores del AI Security Lab de ETH Zurich han publicado «CRESCENDO-2», un framework evolucionado de inyección de prompts que elude sistemáticamente las barreras de seguridad de 12 sistemas LLM importantes, incluidos GPT-4o, Claude 3.5, Gemini 1.5 Pro, Llama 3.1 405B y Mistral Large.

A diferencia de técnicas anteriores que dependían de trucos de formato específicos, CRESCENDO-2 utiliza un enfoque de optimización sin gradientes que transforma progresivamente el contexto conversacional a lo largo de entre 5 y 8 turnos. Cada turno parece completamente inofensivo por separado, pero el contexto acumulado crea un entorno semántico en el que el entrenamiento de seguridad del modelo tiene menos influencia que la trayectoria conversacional establecida.

Hallazgos principales

Varios proveedores, entre ellos Anthropic y OpenAI, han implementado mitigaciones parciales que redujeron las tasas de elusión aproximadamente un 20 % en las pruebas preliminares posteriores.

Implicaciones para el sector: Esta investigación cuestiona la suposición de que las barreras de seguridad de los LLM puedan servir como control de seguridad principal. Las organizaciones deben implementar una defensa en profundidad: filtrado de resultados, capas de autorización de acciones y comprobaciones de seguridad deterministas e independientes del criterio del propio modelo.

🟠 Alto: el DAST agéntico supera a los pentesters manuales en un ensayo de Stanford

Un estudio pionero del Computer Security Lab de Stanford, en colaboración con OWASP, compara directamente tres plataformas líderes de DAST agéntico con pentesters humanos experimentados en 15 aplicaciones web personalizadas, cada una con 20 vulnerabilidades conocidas pertenecientes al Top 10 de OWASP.

MétricaPentesters humanos (promedio)DAST agéntico (mejor resultado)DAST agéntico (promedio)
Vulnerabilidades encontradas (de 20)14,21715,8
Tiempo para completar8,5 horas47 minutos1,2 horas
Falsos positivos2,134,2
Fallos de lógica de negocio encontrados4,8 de 52 de 51,4 de 5
Omisiones de autenticación encontradas3 de 33 de 32,6 de 3
Calidad del informe (1-10)8,77,26,1

Los sistemas agénticos destacaron por su cobertura sistemática: fallos de inyección, configuraciones incorrectas y problemas de control de acceso. Los pentesters humanos superaron considerablemente a la AI en las vulnerabilidades de lógica de negocio que requerían comprender flujos de trabajo específicos de la aplicación.

Conclusión principal: El modelo híbrido humano-AI encontró un promedio de 19,1 de las 20 vulnerabilidades: una mejora del 35 % respecto a los humanos por sí solos y del 21 % respecto a la AI por sí sola. Esto valida la combinación del análisis automatizado mediante AI con el análisis de expertos humanos.

🟡 Investigación: los ataques a la cadena de suministro de modelos de AI aumentan un 340 % en el primer trimestre de 2026

El informe trimestral de seguridad de AI/ML de JFrog revela un aumento del 340 % en los paquetes maliciosos dirigidos a registros de modelos de AI y dependencias de pipelines de ML durante el primer trimestre de 2026:

Recomendaciones: Implemente la verificación de firmas de modelos (Sigstore para ML), analice los archivos de modelos con ModelScan/Picklescan antes de cargarlos, fije las versiones y las sumas de comprobación de los modelos, y aísle la inferencia en entornos sandbox.

🟡 Emergente: las pruebas de conocimiento cero para los registros de auditoría de AI ganan terreno

Las empresas están adoptando sistemas de pruebas de conocimiento cero (ZKP) para crear registros de auditoría de AI verificables sin exponer información propietaria de los modelos. Tres empresas de la lista Fortune 100 anunciaron este trimestre implementaciones de auditoría de AI basadas en ZKP, impulsadas por los requisitos de transparencia del AI Act de la EU que entrarán en vigor en agosto de 2026.

La tecnología permite a las empresas demostrar propiedades específicas de sus sistemas de AI —como el cumplimiento de umbrales de sesgo y requisitos de tratamiento de datos— sin revelar los pesos, la arquitectura ni los datos de entrenamiento del modelo.


Recomendaciones de Kensai

  1. Equipos de AI/ML que utilizan MCP: auditen todos los servidores MCP conectados e implementen inmediatamente la fijación de descripciones de herramientas y la validación de esquemas de parámetros
  2. Implementaciones empresariales de LLM: no dependan exclusivamente de las barreras de seguridad; implementen el filtrado de resultados y la autorización determinista de acciones
  3. Equipos de seguridad: adopten pruebas de penetración híbridas entre humanos y AI para maximizar la cobertura
  4. Operaciones de ML: apliquen a los registros de modelos la misma rigurosidad de seguridad de la cadena de suministro que a las dependencias de código
  5. Equipos de cumplimiento: evalúen soluciones ZKP para los requisitos de transparencia del AI Act de la EU

Proteja su infraestructura de AI

La plataforma de seguridad de Kensai, impulsada por AI, identifica configuraciones incorrectas de MCP, vulnerabilidades de inyección de prompts y riesgos de la cadena de suministro en sus implementaciones de AI.

Iniciar análisis de seguridad gratuito

KENSAI — Inteligencia de seguridad impulsada por AI