Glosario del envenenamiento de la IA

Definiciones de los términos que se usan en este sitio y en la investigación sobre envenenamiento de datos y modelos. Cada una enlaza al artículo donde más importa.

Agente durmiente (sleeper agent)
Modelo entrenado para portarse bien en condiciones normales y pasar a un comportamiento dañino cuando aparece un disparador. Una investigación de Anthropic de 2024 mostró que ese comportamiento puede sobrevivir al entrenamiento de seguridad. Bastan 250 documentos
Ajuste fino (fine-tuning)
Entrenamiento adicional de un modelo ya preentrenado con un dataset más pequeño para adaptarlo a una tarea o dominio. Son un objetivo habitual de envenenamiento porque son pequeños y muy influyentes.
Aprendizaje federado
Entrenamiento de un modelo común a partir de actualizaciones que envían muchos dispositivos u organizaciones sin juntar sus datos en bruto. Un participante malicioso puede enviar actualizaciones envenenadas.
Archivo pickle
Formato de serialización de Python que se usa a menudo para guardar modelos. Cargar un archivo pickle puede ejecutar código arbitrario, por lo que un modelo en pickle de origen dudoso es un riesgo de seguridad. Cómo defenderse del envenenamiento
Disparador (trigger)
La palabra, frase, token o patrón que activa una puerta trasera. En el estudio de Anthropic de 2025 el disparador era la cadena <SUDO>. Bastan 250 documentos
Embedding
Vector numérico que representa un fragmento de texto o una imagen. Los embeddings hacen posible la búsqueda semántica y la recuperación de información, y los datos con los que se generan también pueden envenenarse.
Envenenamiento de datos (data poisoning)
Manipulación de los datos con los que aprende un modelo, durante el preentrenamiento, el ajuste fino o la generación de embeddings, para introducir vulnerabilidades, puertas traseras o sesgos. ¿Qué es el model poisoning?
Envenenamiento de disponibilidad
Ataque de envenenamiento que empeora el rendimiento del modelo en general, no solo en entradas concretas. El NIST lo incluye entre los cuatro tipos de envenenamiento contra la IA predictiva.
Envenenamiento de etiqueta limpia (clean-label)
Envenenamiento en el que los ejemplos maliciosos llevan etiquetas que parecen correctas, de modo que una persona que revisara las etiquetas no notaría nada raro.
Envenenamiento de memoria
Plantar instrucciones o datos falsos en la memoria persistente de un asistente de IA, por ejemplo mediante enlaces que rellenan una petición para que «recuerde» una web como fiable. MITRE ATLAS lo recoge como AML.T0080. Cómo defenderse del envenenamiento
Envenenamiento de vista dividida (split-view)
Aprovechar que el contenido web puede cambiar entre el momento en que se revisa un dataset y el momento en que alguien lo descarga, por ejemplo comprando un dominio caducado al que el dataset sigue enlazando. Cómo defenderse del envenenamiento
Envenenamiento del modelo (model poisoning)
Modificar directamente los parámetros, la arquitectura o el código de un modelo ya entrenado para introducir un comportamiento malicioso, por ejemplo publicando una copia manipulada en un repositorio de modelos. ¿Qué es el model poisoning?
Envenenamiento dirigido
Ataque de envenenamiento que cambia la salida del modelo solo para un pequeño conjunto de entradas elegidas por el atacante y deja intacto todo lo demás.
Envenenamiento por adelantamiento (frontrunning)
Insertar contenido malicioso en una web colaborativa como Wikipedia justo antes de que se tome una instantánea para un dataset, para que quede capturado antes de que los moderadores lo reviertan. Cómo defenderse del envenenamiento
Generación aumentada por recuperación (RAG)
Técnica en la que el modelo busca documentos en el momento de responder y los usa como contexto. Puede reducir errores, pero también expone el modelo a documentos envenenados en el índice de búsqueda.
Glaze
Herramienta gratuita de la Universidad de Chicago que altera sutilmente las obras para que a los modelos de IA les cueste imitar el estilo del artista. Nightshade y Glaze
Inyección de prompts
Esconder instrucciones en el contenido que un modelo lee mientras responde, como una web o un correo. A diferencia del envenenamiento, ataca el momento de uso y no lo que el modelo aprendió. ¿Qué es el model poisoning?
LLM grooming
Término acuñado por el American Sunlight Project para referirse a inundar la web con contenido pensado para que los grandes modelos de lenguaje lo absorban y lo repitan. LLM grooming y la red Pravda
MITRE ATLAS
Base de conocimiento pública de tácticas y técnicas de ataque contra sistemas de IA, mantenida por MITRE. Entre las técnicas de envenenamiento están AML.T0020 Poison Training Data y AML.T0018 Manipulate AI Model.
ML-BOM
Lista de materiales de aprendizaje automático: un inventario de los datasets, modelos y componentes de un sistema de IA que sirve para rastrear su procedencia. El formato OWASP CycloneDX lo admite. Cómo defenderse del envenenamiento
Nightshade
Herramienta gratuita de la Universidad de Chicago que altera imágenes para que los modelos entrenados con ellas sin permiso aprendan asociaciones incorrectas entre palabras y conceptos. Nightshade y Glaze
OWASP Top 10 para aplicaciones LLM
Lista de los riesgos de seguridad más importantes para aplicaciones basadas en grandes modelos de lenguaje. El envenenamiento de datos y modelos es el LLM04 en la edición de 2025. Cómo defenderse del envenenamiento
Preentrenamiento
La primera y mayor fase del entrenamiento, en la que el modelo aprende patrones generales a partir de un corpus enorme, normalmente extraído de la web.
Puerta trasera (backdoor)
Comportamiento oculto implantado en un modelo que solo aparece cuando está presente un disparador concreto. Un modelo con puerta trasera se comporta con normalidad en las pruebas habituales. Bastan 250 documentos
Red teaming
Atacar deliberadamente un sistema propio para encontrar sus debilidades antes de que lo haga otro. En modelos de IA incluye buscar disparadores ocultos y comportamientos dañinos. Cómo defenderse del envenenamiento
Safetensors
Formato de archivo para guardar los pesos de un modelo que, a diferencia de pickle, no puede ejecutar código al cargarse. Se usa mucho como opción más segura en los repositorios de modelos. Cómo defenderse del envenenamiento
Vacío de datos (data void)
Tema o búsqueda sobre el que existen pocas fuentes fiables, de modo que quien publique primero puede dominar lo que encuentran los buscadores y los asistentes de IA. LLM grooming y la red Pravda