Envenenamiento de datos de IA: cómo los artistas están contraatacando a los raspadores de datos
Artistas y usuarios comunes están saboteando discretamente los modelos de IA al alimentarlos con imágenes corrompidas, y está funcionando: malas noticias para las empresas de IA que construyeron su negocio sobre datos gratuitos.
- Herramientas como Nightshade y Glaze permiten a las personas alterar sus imágenes para que los raspadores de IA aprendan algo equivocado: un concepto de "perro" envenenado puede convertirse en un gato.
- Se necesita muy poco para dañar un modelo: menos de 100 imágenes manipuladas pueden corromper un solo concepto, y el daño se extiende a ideas relacionadas como cachorros y lobos.
- Esto comenzó como una represalia por años de raspado de datos: empresas como Stability AI, OpenAI y el conjunto de datos LAION absorbieron miles de millones de imágenes sin pedir permiso ni pagar a los creadores, lo que desató demandas de artistas y de Getty Images.
- El mismo truco ahora protege las voces: herramientas como SafeSpeech alteran la huella de audio que los estafadores necesitan para clonar a alguien, luego de que voces y videos falsos ayudaran a robar 25 millones de dólares en un atraco de 2024.
- Los laboratorios de IA están respondiendo al intentar filtrar los archivos envenenados, pero su limpieza detecta solo alrededor de la mitad, es lenta y costosa, y quienes envenenan los datos se adaptan en cuestión de semanas.
Perspectiva: El costo de limpiar los datos robados está aumentando, lo que empuja a las empresas de IA hacia conjuntos de datos con licencia y de pago, como los acuerdos que ya utilizan Adobe y Shutterstock.