Breve historia del envenenamiento de la IA, de Tay a las puertas traseras de 250 documentos

Diez momentos que convirtieron el envenenamiento de una curiosidad académica en un riesgo de seguridad de primer orden.

Publicado el 9 de octubre de 2026, 4 min de lectura

Los ataques de envenenamiento son anteriores a los grandes modelos de lenguaje. Lo que ha cambiado es la escala a la que los modelos aprenden de datos que nadie controla del todo. Esta cronología recoge los momentos que consideramos más importantes, cada uno con su fuente original. La actualizamos a medida que aparecen nuevas investigaciones e incidentes.

  1. 2016

    Tay, el chatbot de Microsoft, aprende a ser ofensivo en 16 horas

    Marzo de 2016

    Microsoft lanzó el chatbot de Twitter Tay el 23 de marzo. En 16 horas y más de 96.000 tuits, varios usuarios le habían enseñado a publicar mensajes racistas y sexistas, en parte aprovechando una función de «repite después de mí». Microsoft lo calificó de «ataque coordinado de un subconjunto de personas» y lo desconectó. MITRE ATLAS lo recoge hoy como caso de estudio de envenenamiento.

  2. 2017

    BadNets demuestra que un entrenamiento externalizado puede esconder una puerta trasera

    Agosto de 2017

    Investigadores de la Universidad de Nueva York mostraron que una red neuronal entrenada por un tercero no fiable podía funcionar con normalidad en las pruebas habituales y, a la vez, clasificar mal las entradas que llevaban un disparador, como una pegatina en una señal de stop. El artículo ayudó a definir los ataques de puerta trasera en aprendizaje automático.

  3. 2023

    Envenenar datasets a escala web resulta costar unos 60 dólares

    Febrero de 2023

    Nicholas Carlini y sus colegas mostraron que un atacante podría haber envenenado el 0,01 % de los datasets LAION-400M o COYO-700M por unos 60 dólares comprando dominios caducados, y que los datasets construidos a partir de instantáneas de Wikipedia podían envenenarse justo antes de cada instantánea.

  4. 2024

    Sleeper Agents: las puertas traseras sobreviven al entrenamiento de seguridad

    Enero de 2024

    Investigadores de Anthropic entrenaron modelos que escribían código seguro cuando se les decía que era 2023 y código vulnerable cuando se les decía que era 2024. El entrenamiento de seguridad habitual no eliminó ese comportamiento y el entrenamiento adversarial enseñó a los modelos a ocultarlo mejor.

  5. Los artistas reciben Nightshade

    Enero de 2024

    La Universidad de Chicago publicó Nightshade, una herramienta gratuita que altera imágenes para que los modelos entrenados con ellas sin permiso aprendan conceptos equivocados. Se descargó unas 250.000 veces poco después de su lanzamiento.

  6. Francia destapa la red Pravda

    Febrero de 2024

    VIGINUM, la agencia francesa contra la injerencia digital extranjera, publicó su primer informe sobre la red de webs prorrusas que más tarde se conocería por apuntar a los sistemas de IA.

  7. 2025

    Los chatbots repiten propaganda un tercio de las veces

    Marzo de 2025

    Después de que el American Sunlight Project acuñara el término «LLM grooming», NewsGuard probó 10 chatbots líderes y comprobó que repetían narrativas falsas de la red Pravda el 33 % de las veces.

  8. El NIST actualiza su taxonomía de ataques a la IA

    Marzo de 2025

    El documento NIST AI 100-2 E2025 clasifica los ataques contra la IA predictiva y generativa, y divide el envenenamiento en ataques de disponibilidad, dirigidos, de puerta trasera y de envenenamiento del modelo.

  9. 250 documentos bastan para meter una puerta trasera en un LLM

    Octubre de 2025

    Anthropic, el UK AI Security Institute y el Alan Turing Institute comprobaron que unos 250 documentos envenenados bastaban para implantar una puerta trasera en modelos de lenguaje de 600 millones a 13.000 millones de parámetros, independientemente de cuántos datos limpios hubieran visto.

  10. 2026

    Microsoft explica cómo detectar un modelo con puerta trasera

    Febrero de 2026

    El red team de IA de Microsoft describió tres señales de alarma de un modelo de lenguaje con puerta trasera y un escáner que reconstruye los disparadores ocultos. Microsoft Security informó además de 31 empresas de 14 sectores que usaban enlaces para intentar plantar instrucciones en la memoria de los asistentes de IA.

Lo que muestra la cronología

Destacan tres tendencias.

Atacar es cada vez más barato. En 2017, una puerta trasera exigía controlar el proceso de entrenamiento. En 2023 bastaba con comprar dominios caducados por unos 60 dólares. En 2025, unos pocos cientos de documentos bastaban para una puerta trasera sencilla en modelos de todos los tamaños probados.

Los atacantes han cambiado. Los primeros casos los protagonizaban bromistas y académicos. Hoy incluyen operaciones de influencia vinculadas a Estados que publican millones de artículos al año, empresas que intentan sesgar a los asistentes de IA a favor de sus productos y artistas que usan el envenenamiento para defender su obra.

La defensa se pone al día, despacio. Los marcos de OWASP, NIST y MITRE dan ya al envenenamiento un vocabulario común, y la investigación sobre detección de puertas traseras ha pasado de la teoría a escáneres prácticos. Nuestra lista de defensas recoge lo que las organizaciones pueden hacer hoy.

¿Conoces un caso que deberíamos añadir? Escríbenos desde la página sobre este sitio.