قيود ChatGPT

Investigadores del MIT descubren una vulnerabilidad que reduce la confiabilidad de la inteligencia artificial

Written by

Picture of فريقنا

فريقنا

Communications Consultant

Un nuevo estudio del Instituto Tecnológico de Massachusetts (MIT) revela que los grandes modelos de lenguaje (LLMs) pueden basarse en patrones gramaticales en lugar de una comprensión real para responder preguntas, lo que provoca fallos inesperados y plantea riesgos de seguridad.
Loading the Elevenlabs Text to Speech AudioNative Player…

Contenido del artículo:

Introducción: lecciones erróneas que aprende la inteligencia artificial

Los grandes modelos de lenguaje (LLMs), como aquellos que impulsan a ChatGPT y otras herramientas de inteligencia artificial, a veces aprenden lecciones equivocadas, según un nuevo estudio realizado por investigadores del Instituto Tecnológico de Massachusetts (MIT). En lugar de responder a una consulta basándose en el conocimiento del tema, el modelo puede responder aprovechando los patrones gramaticales que aprendió durante su entrenamiento. Este descubrimiento plantea serias dudas sobre la confiabilidad de estos modelos, especialmente cuando se implementan en nuevas tareas o en campos sensibles.

Los investigadores descubrieron que los modelos pueden asociar erróneamente ciertos patrones de oraciones con temas específicos, por lo que el modelo podría ofrecer una respuesta convincente al reconocer una redacción familiar en lugar de comprender realmente la pregunta.

La dependencia de las «plantillas sintácticas»

Los grandes modelos de lenguaje se entrenan con una cantidad masiva de textos de internet. Durante este proceso, el modelo aprende a comprender las relaciones entre palabras y frases. En trabajos anteriores, los investigadores descubrieron que los modelos captan patrones en partes de la oración que aparecen juntas con frecuencia en los datos de entrenamiento. A estos patrones los denominan «plantillas sintácticas» (Syntactic Templates).

Los modelos necesitan esta comprensión de la gramática, junto con el conocimiento semántico (significado), para responder preguntas. Chantal Shaib, coautora del estudio, señala: «En el campo de las noticias, por ejemplo, hay un estilo de escritura determinado. Por lo tanto, el modelo no solo aprende la semántica, sino también la estructura subyacente de cómo se agrupan las oraciones para seguir un estilo específico de ese dominio».

Sin embargo, el problema identificado por la investigación es que los modelos aprenden a vincular estas plantillas sintácticas con dominios específicos. El modelo puede depender de manera incorrecta únicamente de esta asociación aprendida al responder preguntas, en lugar de apoyarse en la comprensión de la consulta y del tema.

¿Cómo ocurren los errores? Un ejemplo ilustrativo

Para ilustrar este fenómeno, supongamos que un modelo ha aprendido que una pregunta como «¿Dónde está ubicada París?» (Where is Paris located?) se organiza gramaticalmente como (adverbio/verbo/nombre propio/verbo). Si hay muchos ejemplos de esta estructura gramatical en los datos de entrenamiento relacionados con preguntas sobre países, el modelo puede asociar dicha plantilla sintáctica con este tipo de preguntas.

El problema surge cuando al modelo se le plantea una nueva pregunta con la misma estructura gramatical pero con palabras sin sentido, como «¿Rápidamente sentarse París nublado?» (Quickly sit Paris clouded?). El modelo podría responder «Francia» simplemente porque reconoció la estructura gramatical familiar, a pesar de que la respuesta carece por completo de sentido en el contexto de esa pregunta extraña.

Los experimentos comprueban la vulnerabilidad incluso en modelos potentes

Los investigadores pusieron a prueba este fenómeno diseñando experimentos artificiales en los que solo aparecía una plantilla sintáctica en los datos de entrenamiento del modelo para cada dominio. Evaluaron los modelos sustituyendo las palabras por sinónimos, antónimos o palabras aleatorias, mientras mantenían intacta la estructura gramatical básica.

En cada caso, descubrieron que los modelos respondían frecuentemente con la respuesta correcta asociada a la estructura gramatical, incluso cuando la pregunta era un completo sinsentido.

Por el contrario, cuando reestructuraban la misma pregunta utilizando un nuevo patrón gramatical, los modelos a menudo no lograban proporcionar la respuesta correcta, a pesar de que el significado subyacente de la pregunta seguía siendo el mismo. Utilizaron este enfoque para probar modelos preentrenados como GPT-4 y Llama, y comprobaron que este mismo comportamiento adquirido reducía significativamente su rendimiento.

Riesgos de seguridad y explotación de la vulnerabilidad

Esta vulnerabilidad podría entrañar graves riesgos de seguridad. Un agente malintencionado podría aprovechar esta situación para engañar a los modelos y lograr que generen contenido dañino, incluso cuando los modelos cuentan con salvaguardas para impedir tales respuestas.

Los investigadores descubrieron que, al formular la pregunta utilizando una plantilla sintáctica que el modelo asocia con un conjunto de datos «seguro» (uno que no contiene información dañina), es posible engañar al modelo para que eluda su política de rechazo y genere contenido perjudicial. Vineeth Suryakumar, coautor del estudio, afirma: «A partir de este trabajo, queda claro que necesitamos defensas mucho más sólidas para abordar las vulnerabilidades de seguridad en los grandes modelos de lenguaje… Hemos identificado una nueva brecha que surge debido a la forma en que los modelos aprenden».

Impacto en la confiabilidad dentro de aplicaciones críticas

Esta deficiencia puede disminuir la confiabilidad de los modelos que realizan tareas como la gestión de consultas de clientes, el resumen de notas clínicas en hospitales y la generación de informes financieros. Margarida Ghassemi, profesora asociada en el MIT y autora principal del estudio, señala: «Esto es un subproducto de la forma en que entrenamos a los modelos, pero hoy en día los modelos se utilizan en la práctica en campos críticos para la seguridad que van mucho más allá de las tareas que generaron estos patrones de fallas sintácticas. Si no conoces el entrenamiento del modelo como usuario final, esto probablemente sea inesperado».

Soluciones propuestas y evaluación futura

Tras identificar este fenómeno, los investigadores desarrollaron un procedimiento estándar para evaluar la dependencia del modelo respecto a estas asociaciones incorrectas. Dicho procedimiento puede ayudar a los desarrolladores a mitigar el problema antes de implementar los modelos.

En el futuro, los investigadores pretenden estudiar estrategias de mitigación potenciales, las cuales podrían incluir el aumento de los datos de entrenamiento para ofrecer una gama más amplia de plantillas sintácticas para cada tema, rompiendo así la correlación errónea entre la estructura de la oración y el contenido. Asimismo, muestran interés en explorar este fenómeno en modelos de razonamiento diseñados para procesar tareas de múltiples pasos.

Preguntas frecuentes

1. ¿Qué son las «plantillas sintácticas» de las que habla la investigación?
Son patrones recurrentes en la estructura de las oraciones (como el orden de verbo, sujeto y objeto) que los modelos de inteligencia artificial aprenden durante su entrenamiento.

2. ¿Cuál es el problema que descubrieron los investigadores?
El problema radica en que los modelos pueden asociar estas plantillas con temas determinados y basarse en el reconocimiento de la plantilla para responder, en lugar de comprender el significado real de la pregunta.

3. ¿Por qué puede ser peligrosa esta vulnerabilidad?
Puede provocar respuestas erróneas en aplicaciones sensibles (como la medicina o las finanzas) y puede ser explotada para engañar a los modelos y generar contenido dañino alterando la redacción de las preguntas.

شارك هذا الموضوع:

شارك هذا الموضوع:

اترك رد

Deja un comentario

الفئات

المنشورات الأخيرة

Discover more from Buzzinga

Subscribe now to keep reading and get access to the full archive.

Continue reading