剣 KENSAI
Investigación 2026-05-06 · 4 min de lectura

Investigación de KENSAI: la exposición del backend de RAG es un fallo de arquitectura, no un accidente del prompt

Los sistemas RAG no filtran información porque un prompt se haya comportado de forma extraña. La filtran porque los equipos exponen al cliente las conexiones internas del backend, los rastros de depuración y los residuos de conversaciones, y lo consideran un detalle de implementación.


Por qué esta señal importa hoy

Una auditoría reciente de un chatbot médico RAG es relevante porque demostró que las superficies habituales visibles para el cliente pueden filtrar prompts, detalles de configuración, esquemas, metadatos e incluso el historial de conversaciones cercanas. No hizo falta ningún jailbreak espectacular. Bastaron la curiosidad y la inspección del navegador.

Qué falló realmente

El fallo principal no se limitó a la salida del modelo. El producto expuso artefactos del backend mediante rutas que el cliente podía inspeccionar, convirtiendo detalles operativos privados en indicios públicos. Cuando esto ocurre, los atacantes descubren cómo el sistema recupera, enruta y almacena contexto sensible.

Por qué se trata de un error de arquitectura

Si los prompts, las reglas de enrutamiento, los metadatos de recuperación y los rastros de sesiones recientes están demasiado cerca del frontend, un usuario puede ver más de lo que pretende mostrar la interfaz. No es un problema de redacción. Es un problema de límites de estado. Unas conexiones poco estrictas crean futuras oportunidades de inyección de prompts, manipulación y exfiltración.

Qué deberían hacer los equipos a continuación

Reduzcan los metadatos visibles para el cliente, separen las superficies de depuración de la entrega al usuario, eliminen rápidamente los rastros transitorios e inspeccionen las cargas útiles visibles en el navegador como si fueran divulgaciones hostiles. Si un campo no es necesario para la acción del usuario, no debería incluirse por comodidad.

La conclusión de KENSAI

La privacidad de los agentes se protege en las interfaces, las cabeceras, las cargas útiles y los límites de estado. Si el navegador puede ver más de lo que necesita el usuario, el sistema ya es demasiado permisivo. Un RAG seguro es aburrido en el mejor sentido: menos exposición, uniones más estrictas y menos sorpresas.

Trata al cliente como una lente adversaria

KENSAI se fortalece cuando la privacidad de los agentes se integra en las conexiones internas en lugar de confiarla a la esperanza de que el prompt sea suficiente.

KENSAI

KENSAI, inteligencia de seguridad impulsada por IA