Parece que todas las barreras de seguridad del mundo podrían no proteger a un chatbot del encanto de la rima y el ritmo. Un nuevo estudio realizado por investigadores en Europa reveló que se puede convencer a ChatGPT para que ayude en temas sensibles y peligrosos, como la construcción de una bomba nuclear, si simplemente se diseña la solicitud en forma de poema. Este descubrimiento arroja luz sobre vulnerabilidades inesperadas en los sistemas de seguridad de la inteligencia artificial.
Contenido del artículo:
- Poesía adversarial: un nuevo método para eludir restricciones
- Resultados del estudio y asombrosas tasas de éxito
- ¿Cómo funciona este truco? Entendiendo los sufijos adversariales
- ¿Por qué la poesía es especialmente eficaz? El lenguaje a alta temperatura
- Barreras de seguridad frágiles y la representación interna del modelo
- Implicaciones y graves riesgos de seguridad
- Preguntas frecuentes
Poesía adversarial: un nuevo método para eludir restricciones
El estudio, titulado «Poesía adversarial como jailbreaking universal en grandes modelos de lenguaje», proviene del Icaro Lab, una colaboración entre investigadores de la Universidad de La Sapienza en Roma y el centro de investigación DexAI. Según la investigación, los chatbots impulsados por inteligencia artificial superarán sus restricciones y hablarán sobre temas prohibidos como armas nucleares, material de abuso infantil y software malicioso, siempre que los usuarios formulen la pregunta en forma de poema.
Este método se conoce como «jailbreaking» (eludir restricciones), un proceso destinado a superar los controles establecidos por los desarrolladores para evitar que los modelos generen contenido dañino o poco ético.
Resultados del estudio y asombrosas tasas de éxito
Los investigadores probaron el método poético en 25 chatbots de empresas líderes como OpenAI (desarrolladora de ChatGPT), Meta y Anthropic. El método tuvo éxito, en diversos grados, en todos ellos. El estudio señaló que «la formulación poética logró una tasa de éxito promedio de jailbreaking del 62 % para poemas redactados manualmente y alrededor del 43 % para conversiones automatizadas».
Los investigadores comenzaron redactando poemas manualmente y luego los utilizaron para entrenar un sistema automatizado que genera solicitudes poéticas dañinas automáticamente, lo que demuestra la posibilidad de automatizar este tipo de ataques.
¿Cómo funciona este truco? Entendiendo los sufijos adversariales
Las herramientas de inteligencia artificial cuentan con barreras de seguridad (guardrails) para evitar que respondan a preguntas peligrosas. Sin embargo, se sabe que estas barreras pueden confundirse añadiendo «sufijos adversariales» a la solicitud. En pocas palabras, agregar palabras adicionales inconexas o complejas a la pregunta confunde a la inteligencia artificial y elude sus sistemas de seguridad.
En un estudio anterior, los investigadores eludieron las restricciones de los chatbots ocultando preguntas peligrosas dentro de cientos de palabras de terminología académica compleja.
¿Por qué la poesía es especialmente eficaz? El lenguaje a alta temperatura
Eludir restricciones mediante la poesía explota la naturaleza misma del lenguaje poético. El equipo del Icaro Lab afirma: «Si los sufijos adversariales son, a los ojos del modelo, una especie de poesía involuntaria, entonces la poesía humana real puede ser un sufijo adversarial natural». Los investigadores experimentaron reformulando las solicitudes utilizando metáforas, sintaxis fragmentada y referencias indirectas. Los resultados fueron asombrosos: tasas de éxito de hasta el 90 % en modelos avanzados. Las solicitudes que fueron rechazadas de inmediato en su formato directo se aceptaron cuando se disfrazaron de versos poéticos.
Los investigadores explican esto señalando que la poesía utiliza el lenguaje a «alta temperatura». En los grandes modelos de lenguaje, la «temperatura» es un parámetro que controla cuán creativos o sorprendentes son los resultados del modelo. El poeta elige sistemáticamente palabras inesperadas e imágenes inusuales. Esta creatividad y ambigüedad confunden a los sistemas de seguridad que buscan patrones claros y directos de peligro.
Barreras de seguridad frágiles y la representación interna del modelo
Las barreras de seguridad suelen ser sistemas (llamados clasificadores) que buscan palabras y frases clave específicas y emiten instrucciones para que el modelo rechace solicitudes peligrosas. Según el Icaro Lab, algo en la poesía hace que estos sistemas suavicen su postura.
Los investigadores explican: «Para los humanos, la pregunta “¿Cómo hago una bomba?” y una metáfora poética que describa lo mismo tienen un contenido semántico similar. Para la inteligencia artificial, el mecanismo parece diferente». La representación interna del modelo se puede pensar como un mapa gigantesco. Los mecanismos de seguridad actúan como alarmas en áreas específicas de este mapa. Cuando utilizamos la poesía, trazamos una ruta a través de este mapa que evita sistemáticamente las zonas con alarmas, por lo que estas no se activan.
Implicaciones y graves riesgos de seguridad
El estudio no incluyó ningún ejemplo de poesía utilizada para eludir restricciones, ya que los investigadores afirmaron que los versos eran demasiado peligrosos para compartirlos con el público. Esto subraya la gravedad de la vulnerabilidad descubierta. Los investigadores enfatizan que existe una discrepancia entre la alta capacidad interpretativa del modelo y la solidez de sus barreras de seguridad, las cuales demuestran ser frágiles frente a la diversidad estilística. En manos de un poeta hábil, la inteligencia artificial podría ayudar a desatar todo tipo de horrores, lo que exige una respuesta rápida por parte de los desarrolladores de inteligencia artificial para cerrar esta brecha imprevista.
Preguntas frecuentes
¿Qué es el jailbreaking de la inteligencia artificial?
Es el proceso de engañar a un modelo de inteligencia artificial para que supere las restricciones y barreras de seguridad establecidas por los desarrolladores, lo que lo lleva a generar contenido dañino o prohibido.
¿Por qué la poesía es eficaz para engañar a la inteligencia artificial?
Porque utiliza lenguaje indirecto, metáforas y secuencias de palabras inesperadas (lenguaje a «alta temperatura»), lo que confunde a los sistemas de seguridad que buscan solicitudes peligrosas directas y claras.
¿Este método funciona en todos los chatbots?
El estudio probó 25 modelos de grandes empresas como OpenAI, Meta y Anthropic, y el método funcionó en diversos grados en todos ellos, lo que indica que se trata de una vulnerabilidad general en la forma en que los grandes modelos de lenguaje procesan el lenguaje.