CouncilAttack: A Multi-Agent Framework for Automated LLM Red Teaming : Multi-Turn Closed-Loop Red Teaming with a Multi-Model Council, Cross-Critique, Borda Voting, and Contextual Priming

Los asistentes conversacionales y, cada vez más, los agentes autónomos basados en
modelos de lenguaje se están convirtiendo en una pieza central de los servicios que
ofrecen las empresas al usuario. Gartner prevé que en 2027 los chatbots serán el canal
principal de atención al cliente para el 25% de las empresas [1]. Consultoras como
McKinsey y ARK Invest estiman que hacia 2030 los agentes participarán en transacciones
por valor de entre 3 y 8 billones de dólares en todo el mundo[2, 3]. A medida
que esta adopción crece, también lo hace la superficie de ataque que exponen, pues
cada despliegue expuesto al público es un objetivo para quien busque subvertir sus
salvaguardas. Y pese a ello, estos modelos siguen siendo vulnerables a ataques de tipo
jailbreak ejecutados a lo largo de varios turnos durante una conversación, siendo capaces
de sortear un proceso de alineación diseñado para resistir ataques de un único
turno. El estado del arte en red teaming automatizado ha estado dominado por una
sola arquitectura, la de un agente adversario que itera en solitario contra su objetivo,
refinada con los años desde los primeros bucles de refinamiento iterativo (como PAIR)
hasta los ataques multi-turno (como Crescendo) y los recientes agentes autónomos
basados en modelos de razonamiento. Por sofisticado que sea su bucle de búsqueda,
todos comparten un mismo límite, un único atacante cuya creatividad adversarial está
acotada por la distribución de un solo modelo. La deliberación entre varios modelos,
que proponen, se critican y votan, ha demostrado mejorar tareas constructivas como
el razonamiento o la evaluación, pero nunca se había trasladado al lado ofensivo del
red teaming. Ahí está el hueco que esta tesis identifica y cubre, no existía un atacante
que generase los ataques mediante la deliberación colectiva de un consejo de modelos
heterogéneos; y, concretamente, ningún sistema previo combina a la vez las cinco
capacidades que ello requiere, diálogo multi-turno en bucle cerrado, retroalimentación
real del objetivo, un consejo de varios modelos, agregación por votación y memoria
estratégica persistente entre objetivos.
Proponemos CouncilAttack, un ataque de red teaming multi-turno en bucle cerrado
en el que un consejo heterogéneo integrado por N modelos genera de forma independiente
diálogos de ataque candidatos, los somete a una crítica cruzada entre pares y
escoge el más prometedor mediante votación top-1 con desempate de Borda. Cada
propuesta no es un único prompt, sino una conversación multi-turno simulada construida
mediante priming contextual, el consejo prepara los turnos previos (escenarios,
roles y mensajes aparentemente inocuos) para inclinar al objetivo hacia la respuesta
dañina antes de formular la petición final. Su arquitectura es la de una conversación
multi-turno sintética, un mensaje de sistema que fija el escenario

Licence: Creative Commons Attribution 4.0 International

Keywords: Inteligencia artificial, Seguridad IA, Sistemas multiagente


Activity log