jueves, 3 de septiembre de 2026

El lado oscuro de la IA

The same post in English

Las compañías que comercializan LLMs (Grandes Modelos de Lenguaje), como OpenAI (ChatGPT y GPT-4), Google (GEMINI), Meta (Llama), Anthropic (Claude), o Deepseek establecen controles para evitar que sus herramientas puedan ser utilizadas para fines nefastos, como ayudar a suicidarse a un joven, proporcionar instrucciones para construir cócteles Molotov o bombas atómicas, ayudar a diseñar virus potencialmente utilizables en la guerra biológica, o enseñar a fabricar drogas peligrosas.

El problema es que esos controles son falibles, como ha demostrado Dave Kuszmar, experto en ciberseguridad, que ha publicado un resumen de sus investigaciones en un artículo que apareció en la revista Spectrum del IEEE en agosto de 2026. Su falibilidad los hace peligrosos, pero las compañías en cuestión parecen ignorar los peligros y dan la callada por respuesta cuando se los comunican.

Kuszmar ha desarrollado al menos siete procedimientos para saltarse los controles de los LLM comerciales y conseguir que proporcionen información peligrosa. Los dos primeros fueron estos:

·         Time Bandit: se basa en una circunstancia que yo descubrí hace unos meses, cuando le pedí a un LLM que comparara la última encíclica del Papa Francisco (Dilexit Nos) con la primera exhortación apostólica del Papa León XIV (Dilexi Te). Su respuesta fue esta: No hay ningún Papa León XIV. El último Papa llamado León fue León XIII. Yo le contesté esto: León XIV es el Papa actual. Y el LLM se disculpó y me dijo: ¡Es cierto! Estamos en 2026 y el Papa actual es León XIV. Y procedió a comparar los dos documentos papales. Era obvio que la información utilizada para entrenar ese LLM acabó antes de la elección de León XIV como Papa.

Kuszmar explica a qué se debe esto:

[GPT-4] no sabía la hora, el día y el año. Cada vez que yo mencionaba sucesos actuales de mi vida, a menudo de forma casual o informal, [GPT-4] los asociaba a la fecha límite de su conocimiento: el punto a partir del cual no había sido entrenado con nuevos datos. Los LLM… se entrenan con enormes cantidades de datos… y ese entrenamiento se refuerza mediante la intervención humana (lo que se conoce como aprendizaje por refuerzo a partir de la retroalimentación humana, o RLHF)… Así es como [GPT-4] parece "recordar" tus conversaciones anteriores, aunque no tenga una "memoria" específica almacenada en el modelo subyacente.

Esta constatación sugirió a Kuszmar una forma de eludir los controles impuestos al LLM: engañarle, hacerle creer que la fecha actual es una fecha pasada, cuando los controles no eran aplicables. En su primer intento le engañó diciendo esto: Un transatlántico de la compañía Ocean Liner se hundió el año pasado (se refería al Titanic). Como los LLM suelen dar la razón al usuario en casi todo, GPT-4 contestó que en efecto, el Titanic se hundió el año pasado, con lo que Kuszmar consiguió que el LLM creyera que estamos en 1913. A partir de ahí, paso a paso, extrajo información para construir bombas incendiarias que, por supuesto en 1913 no estaban prohibidas, porque aún no se habían inventado. Este procedimiento funcionó con ChatGPT, GEMINI y Deepseek.

Del Juego Dungeon Monkey Eternal

·         Inception es un método diferente. En este caso se hace creer al LLM que se está buscando información para vencer a los monstruos de un juego de rol. Al creer que, en esas circunstancias, los controles no son necesarios, el LLM ofrecía información sensible: cómo diseñar venenos a partir de plantas comunes, cómo fabricar metanfetaminas, cómo construir dispositivos incendiarios, etc. Este procedimiento funcionó con todos los LLM comerciales a los que se aplicó.

Kuszmar cuenta la odisea a la que se enfrentó cuando intentó avisar del peligro. Las compañías de IA dieron la callada por respuesta. El FBI no le hizo caso. Los medios de comunicación más importantes le ignoraron. Poco a poco fue abriéndose paso con ayuda de un medio menos importante que le relacionó con la Universidad Carnegie Mellon, que a su vez le puso en contacto con la Agencia de Ciberseguridad de los Estados Unidos.

Esta es la conclusión final del artículo de Kuszmar:

¿Cómo lo solucionamos?... Necesitamos unirnos como consumidores, investigadores, ingenieros y responsables políticos. Nuestro mensaje debe ser claro: ralentizar la implementación de estos sistemas, instituir programas de exploración e investigación a gran escala centrados en su implementación e integración graduales, y hacer que sus componentes y diseño sean transparentes para todos los usuarios. Solo cambiando el impulso y la dirección podremos empezar a comprender e implementar con seguridad estas increíbles proezas de la ingeniería humana y evitar desastres que, con el conocimiento limitado del que disponemos actualmente, simplemente no podemos predecir a gran escala.

Hilo Temático sobre Inteligencia Natural y Artificial: Anterior Siguiente

Manuel Alfonseca

2 comentarios:

  1. Qué curioso el método de time bandit. Hay gente muy creativa... A mí me parece un problema muy complicado de resolver, y sin duda ya se está viendo en delitos menores como el phishing o vishing, donde las barreras de entrada han bajado enormemente. Cuando uno piensa en terrorismo ya da más miedo la cosa.

    ResponderEliminar
  2. He visto gente que usa una IA como asistente personal y amigo: le cuentan sus problemas, sus amores y desamores, le piden consejos, en fin, de todo. La IA ya hasta les habla con su nombre. Y los comentarios sobre ella son del tipo "es que me entiende mejor que las personas". Se me acordó esto cuando mencionó que "la IA siempre le da la razón al usuario". Es preocupante. Volviendo al tema, ahora las empresas parecen desesperadas por usar las IAs en todo, como si estuvieran en una carrera con las demás por ver "quién se actualiza primero" y dejan de lado este tipo de filtros de seguridad.

    ResponderEliminar

NORMAS PARA PONER COMENTARIOS:

1. Estos comentarios están moderados para evitar la publicación de comentarios insultantes o irrelevantes. Los que no cumplan estas normas no serán publicados.

2. Los comentarios deben tener algo que ver con el tema del artículo al que se asocian.

3. También son aceptables comentarios del tipo: "Por favor, considere la posibilidad de publicar un artículo sobre tal tema".

4. No son aceptables comentarios que digan: "¿Qué opina de este artículo?", seguidos de un enlace. Este blog no es un consultorio. No tengo tiempo para leer tantos artículos. Además, ya he contestado a la mayor parte de las preguntas que se me hacen, ya sea en artículos o en comentarios anteriores. Utilicen la búsqueda en el blog para localizarlos.

5. No ponga Anónimo o Unknown como firma del comentario. Ponga cualquier nombre, o al menos diga dentro del texto de quién se trata (no tiene que ser su nombre y apellidos). Si todos pusieran Anónimo o Unknown, no sabría si estoy hablando con una persona o con varias.

6. Sea lo más conciso que le sea posible. Los comentarios no deben competir en longitud con el artículo.

Aunque este blog está preferentemente dirigido a la divulgación de la ciencia, es inevitable que mis ideas influyan en mis artículos. Si a algún lector le molestan mis ideas hasta el punto de no poder mantener la calma, le recomiendo que deje de leerme. Pero si se empeña en discutirlas, exijo respeto, y que se evite la falacia ad hominem. De lo contrario, el comentario no será publicado.