Las compañías que comercializan LLMs (Grandes Modelos
de Lenguaje), como OpenAI (ChatGPT y GPT-4), Google (GEMINI), Meta (Llama),
Anthropic (Claude), o Deepseek establecen controles para evitar que sus
herramientas puedan ser utilizadas para fines nefastos, como ayudar a
suicidarse a un joven, proporcionar instrucciones para construir cócteles
Molotov o bombas atómicas, ayudar a diseñar virus potencialmente utilizables en
la guerra biológica, o enseñar a fabricar drogas peligrosas.
El problema es que esos controles son falibles,
como ha demostrado Dave Kuszmar, experto en ciberseguridad, que ha publicado un
resumen de sus investigaciones en un artículo que apareció
en la revista Spectrum del IEEE en agosto de 2026. Su falibilidad los hace
peligrosos, pero las compañías en cuestión parecen ignorar los peligros y dan
la callada por respuesta cuando se los comunican.
Kuszmar ha desarrollado al menos siete procedimientos para saltarse los controles de los LLM comerciales y conseguir que proporcionen información peligrosa. Los dos primeros fueron estos:
· Time Bandit: se basa en una circunstancia que yo descubrí hace unos meses, cuando le pedí a un LLM que comparara la última encíclica del Papa Francisco (Dilexit Nos) con la primera exhortación apostólica del Papa León XIV (Dilexi Te). Su respuesta fue esta: No hay ningún Papa León XIV. El último Papa llamado León fue León XIII. Yo le contesté esto: León XIV es el Papa actual. Y el LLM se disculpó y me dijo: ¡Es cierto! Estamos en 2026 y el Papa actual es León XIV. Y procedió a comparar los dos documentos papales. Era obvio que la información utilizada para entrenar ese LLM acabó antes de la elección de León XIV como Papa.
Kuszmar explica a qué se debe esto:
[GPT-4]
no sabía la hora, el día y el año. Cada vez que yo mencionaba sucesos actuales
de mi vida, a menudo de forma casual o informal, [GPT-4] los asociaba a la fecha
límite de su conocimiento: el punto a partir del cual no había sido entrenado
con nuevos datos. Los LLM… se entrenan con enormes cantidades de datos… y ese
entrenamiento se refuerza mediante la intervención humana (lo que se conoce
como aprendizaje por refuerzo a partir de la retroalimentación humana, o RLHF)…
Así es como [GPT-4] parece "recordar" tus conversaciones anteriores,
aunque no tenga una "memoria" específica almacenada en el modelo
subyacente.
Esta constatación sugirió a Kuszmar una forma de eludir
los controles impuestos al LLM: engañarle, hacerle creer que la fecha actual es
una fecha pasada, cuando los controles no eran aplicables. En su primer intento
le engañó diciendo esto: Un transatlántico de la compañía Ocean
Liner se hundió el año pasado (se refería al Titanic). Como los LLM suelen dar la
razón al usuario en casi todo, GPT-4 contestó que en
efecto, el Titanic se hundió el año pasado, con lo que Kuszmar consiguió
que el LLM creyera que estamos en 1913. A partir de ahí, paso a paso, extrajo
información para construir bombas incendiarias que, por supuesto en 1913 no
estaban prohibidas, porque aún no se habían inventado. Este procedimiento
funcionó con ChatGPT, GEMINI y Deepseek.
![]() |
| Del Juego Dungeon Monkey Eternal |
·
Inception es un método diferente. En
este caso se hace creer al LLM que se está buscando información para vencer a
los monstruos de un juego de rol. Al creer que, en esas circunstancias, los
controles no son necesarios, el LLM ofrecía información sensible: cómo diseñar
venenos a partir de plantas comunes, cómo fabricar metanfetaminas, cómo
construir dispositivos incendiarios, etc. Este procedimiento funcionó con todos
los LLM comerciales a los que se aplicó.
Kuszmar cuenta la odisea a la que se enfrentó
cuando intentó avisar del peligro. Las compañías de IA dieron la callada por
respuesta. El FBI no le hizo caso. Los medios de comunicación más
importantes le ignoraron. Poco a poco fue abriéndose paso con ayuda de un medio menos importante que le relacionó con la Universidad Carnegie Mellon, que a su
vez le puso en contacto con la Agencia de Ciberseguridad de los Estados Unidos.
Esta es la conclusión final del artículo de
Kuszmar:
¿Cómo
lo solucionamos?... Necesitamos unirnos como consumidores, investigadores,
ingenieros y responsables políticos. Nuestro mensaje debe ser claro: ralentizar
la implementación de estos sistemas, instituir programas de exploración e
investigación a gran escala centrados en su implementación e integración
graduales, y hacer que sus componentes y diseño sean transparentes para todos
los usuarios. Solo cambiando el impulso y la dirección podremos empezar a
comprender e implementar con seguridad estas increíbles proezas de la
ingeniería humana y evitar desastres que, con el conocimiento limitado del que
disponemos actualmente, simplemente no podemos predecir a gran escala.
Hilo Temático sobre Inteligencia Natural y Artificial: Anterior Siguiente
Manuel Alfonseca

Qué curioso el método de time bandit. Hay gente muy creativa... A mí me parece un problema muy complicado de resolver, y sin duda ya se está viendo en delitos menores como el phishing o vishing, donde las barreras de entrada han bajado enormemente. Cuando uno piensa en terrorismo ya da más miedo la cosa.
ResponderEliminarHe visto gente que usa una IA como asistente personal y amigo: le cuentan sus problemas, sus amores y desamores, le piden consejos, en fin, de todo. La IA ya hasta les habla con su nombre. Y los comentarios sobre ella son del tipo "es que me entiende mejor que las personas". Se me acordó esto cuando mencionó que "la IA siempre le da la razón al usuario". Es preocupante. Volviendo al tema, ahora las empresas parecen desesperadas por usar las IAs en todo, como si estuvieran en una carrera con las demás por ver "quién se actualiza primero" y dejan de lado este tipo de filtros de seguridad.
ResponderEliminar