Basta una dosis muy pequeña.
El envenenamiento de modelos (model poisoning) es la manipulación de los datos o del modelo del que aprende un sistema de IA para que se comporte como quiere un atacante. Este sitio explica cómo funciona, sigue la investigación y recoge lo que pueden hacer los defensores.
Por dónde empezar
Seis artículos con lo esencial, desde la definición básica hasta una lista práctica de defensas.
- ¿Qué es el model poisoning?Un atacante no siempre necesita entrar en un sistema de IA. A veces le basta con cambiar aquello de lo que aprende.
- Bastan 250 documentosEl mayor experimento de envenenamiento publicado hasta ahora sugiere que lo que importa es el número de documentos maliciosos, no su proporción en los datos de entrenamiento.
- LLM grooming y la red PravdaAlgunas webs no están escritas para personas. Están escritas para las máquinas que leen la web en nombre de los sistemas de IA.
- Nightshade y GlazeNo todo envenenamiento de datos es un ataque. Para algunos artistas es la única baza que tienen frente a las empresas que recopilan su obra.
- Cómo defenderse del envenenamientoNadie puede revisar a mano miles de millones de documentos. Pero sí se puede controlar de dónde vienen, demostrar que no han cambiado y comprobar qué ha aprendido el modelo.
- Breve historia del envenenamiento de la IADiez momentos que convirtieron el envenenamiento de una curiosidad académica en un riesgo de seguridad de primer orden.
Cronología
Casos reales e hitos de investigación, cada uno con su fuente original.
- 2016Tay, el chatbot de Microsoft, aprende a ser ofensivo en 16 horas
- 2017BadNets demuestra que un entrenamiento externalizado puede esconder una puerta trasera
- 2023Envenenar datasets a escala web resulta costar unos 60 dólares
- 2024Sleeper Agents: las puertas traseras sobreviven al entrenamiento de seguridad
- Los artistas reciben Nightshade
- Francia destapa la red Pravda
- 2025Los chatbots repiten propaganda un tercio de las veces
- El NIST actualiza su taxonomía de ataques a la IA
- 250 documentos bastan para meter una puerta trasera en un LLM
- 2026Microsoft explica cómo detectar un modelo con puerta trasera