Investigación de KENSAI: el triaje agéntico de recompensas por errores necesita una reproducción basada en pruebas
Nota de investigación del 6 de junio: los flujos de trabajo de recompensas asistidos por AGI solo resultan útiles cuando cada hallazgo candidato se limita al alcance, se reproduce con pruebas claras y se canaliza con evidencia suficiente para que los responsables del mantenimiento confíen en la señal.
La autonomía sin disciplina de alcance solo genera ruido más rápido
El trabajo de recompensas por errores premia la curiosidad, pero los programas son contratos. Un ciclo de triaje asistido por AGI debe comenzar traduciendo la política en controles operativos: hosts permitidos, clases de pruebas prohibidas, límites de frecuencia, restricciones para el tratamiento de datos y lenguaje de divulgación. KENSAI considera esa política una restricción activa, no un párrafo que el agente lee una vez antes de explorar.
La unidad útil es una afirmación reproducida
Un seguimiento de pila prometedor, una cabecera de respuesta inusual o una discrepancia de autorización son solo indicios. La unidad útil para un equipo de recompensas es una afirmación reproducida: qué solicitud se envió, qué condición previa existía, qué cambió, qué pruebas demuestran el impacto y qué debería mostrar una nueva prueba después de la corrección. Esta estructura mantiene la asistencia de AGI alineada con los responsables del mantenimiento, que necesitan hechos concisos y verificables.
El triaje debe reducir la incertidumbre de los responsables del mantenimiento
Los mejores informes no son los más largos. Separan la observación de la inferencia, incluyen comprobaciones negativas que descartan falsos positivos y explican por qué el problema importa utilizando el lenguaje del programa. Para KENSAI, aquí es donde el trabajo agéntico se gana la confianza: reduciendo el esfuerzo de revisión y conservando el detalle suficiente para que un ingeniero de seguridad independiente pueda reproducir el resultado.
Por qué esto importa para los equipos de seguridad de la era de la AGI
A medida que los modelos mejoran en la planificación de pruebas de varios pasos, el cuello de botella pasa de la generación de ideas a la calidad de las pruebas. Los equipos que instrumenten ahora comprobaciones de alcance, captura de pruebas y buenas prácticas de redacción de informes estarán preparados para agentes más capaces en el futuro, porque el marco de seguridad y el nivel de calidad ya estarán definidos explícitamente.
- Convertir el alcance de las recompensas en comprobaciones ejecutables de permisos y denegaciones antes del análisis.
- Exigir un paquete de reproducción antes de promover cualquier problema candidato.
- Almacenar únicamente las pruebas mínimas necesarias para demostrar el impacto y facilitar la corrección.
- Derivar los casos ambiguos a revisión humana en lugar de exagerar las afirmaciones de impacto.
Las pruebas superan a la autonomía plausible
KENSAI está desarrollando flujos de trabajo de seguridad agénticos basados en pruebas con alcance definido, hallazgos reproducibles y transferencias claras a los responsables del mantenimiento: los controles aburridos que hacen que la asistencia de AGI sea lo bastante segura como para resultar relevante.
KENSAI, inteligencia de seguridad impulsada por IA