Basta una dosis muy pequeña.

El envenenamiento de modelos (model poisoning) es la manipulación de los datos o del modelo del que aprende un sistema de IA para que se comporte como quiere un atacante. Este sitio explica cómo funciona, sigue la investigación y recoge lo que pueden hacer los defensores.

Leer la explicación Ver la cronología

Cada punto representa un documento de entrenamiento; 5 de los 1.152 están envenenados. En un estudio de 2025, unos 250 documentos bastaron para plantar una puerta trasera en un modelo de 13.000 millones de parámetros. Dibujado a escala según la proporción de tokens, habría un punto violeta por cada 625.000 grises. Leer sobre el estudio

Por dónde empezar

Seis artículos con lo esencial, desde la definición básica hasta una lista práctica de defensas.

Cronología

Casos reales e hitos de investigación, cada uno con su fuente original.

Cronología completa con fuentes

  1. 2016Tay, el chatbot de Microsoft, aprende a ser ofensivo en 16 horas
  2. 2017BadNets demuestra que un entrenamiento externalizado puede esconder una puerta trasera
  3. 2023Envenenar datasets a escala web resulta costar unos 60 dólares
  4. 2024Sleeper Agents: las puertas traseras sobreviven al entrenamiento de seguridad
  5. Los artistas reciben Nightshade
  6. Francia destapa la red Pravda
  7. 2025Los chatbots repiten propaganda un tercio de las veces
  8. El NIST actualiza su taxonomía de ataques a la IA
  9. 250 documentos bastan para meter una puerta trasera en un LLM
  10. 2026Microsoft explica cómo detectar un modelo con puerta trasera

Glosario

Los términos que aparecen una y otra vez, explicados con claridad.

Los 27 términos