logo

Modelos de IA entrenados con contenidos ajenos. Copyright vs tecnología

LetsLaw / Derecho Digital  / Modelos de IA entrenados con contenidos ajenos. Copyright vs tecnología
servicios-abogados-ia-inteligencia-artificial

Modelos de IA entrenados con contenidos ajenos. Copyright vs tecnología

La inteligencia artificial generativa ha reabierto una pregunta clásica del derecho de autor con una intensidad nueva. ¿Puede una empresa entrenar un modelo con libros, imágenes, canciones, artículos o bases de datos creados por terceros sin pedir autorización individual a cada titular? En Europa y en España, la respuesta no es absoluta. Depende del contenido, de cómo se haya obtenido, de si el titular ha reservado sus derechos y del uso posterior del modelo.

¿Es legal entrenar una IA con obras protegidas? La excepción de minería de textos y datos

La normativa europea parte de una idea práctica. Para desarrollar determinadas tecnologías es necesario analizar grandes volúmenes de información. Por eso, la Directiva 2019/790 introdujo excepciones de minería de textos y datos, incorporadas en España mediante el Real Decreto-ley 24/2021. Esta norma define la minería de textos y datos como una técnica analítica automatizada destinada a analizar textos y datos digitales para extraer información, pautas, tendencias o correlaciones.

El artículo 67 del Real Decreto-ley 24/2021 permite realizar reproducciones y extracciones de obras accesibles legítimamente con fines de minería de textos y datos sin autorización del titular. Ahora bien, esta habilitación tiene límites relevantes. El contenido debe ser accesible de forma legítima, las copias deben conservarse solo durante el tiempo necesario y debe respetarse la normativa de protección de datos. Además, para usos no estrictamente científicos, el titular puede reservar expresamente sus derechos mediante medios de lectura mecánica u otros medios adecuados. En ese caso, el desarrollador deberá excluir esos contenidos o recabar una licencia.

Por tanto, entrenar una IA con obras protegidas no es automáticamente ilícito, pero tampoco queda libre de control. El punto central no es solo si la obra estaba publicada en internet, sino si el acceso era legítimo y si existía una reserva de derechos válida.

Qué están diciendo los tribunales ante las demandas de creadores contra desarrolladores de IA

Los tribunales todavía están construyendo criterio. En Estados Unidos, varios procedimientos contra OpenAI, Meta, Anthropic, Midjourney y otros desarrolladores han analizado si el entrenamiento de modelos es un uso transformador o una reproducción no autorizada. Algunas resoluciones han sido favorables a los desarrolladores cuando el entrenamiento no sustituye la obra original ni reproduce fragmentos sustanciales en los resultados. Sin embargo, también se ha marcado una línea clara frente al uso de copias piratas.

En Bartz v. Anthropic, el tribunal consideró que el entrenamiento podía quedar amparado por fair use, pero no la conservación de copias piratas. En Kadrey v. Meta, el tribunal fue más favorable a Meta respecto del entrenamiento, aunque dejó abierta la discusión sobre el daño al mercado. En Thomson Reuters v. Ross Intelligence, relativo a una herramienta jurídica basada en IA, el tribunal rechazó el fair use cuando el uso de contenidos protegidos servía para crear un producto competidor. En Reino Unido, Getty Images v. Stability AI tampoco resolvió definitivamente la licitud del entrenamiento, pero evidenció las dificultades de encajar modelos entrenados fuera del territorio en las categorías clásicas de infracción.

Cómo ejercer el opt-out sobre tus contenidos y entrenar modelos sin infringir copyright

Para los titulares de derechos, la primera medida es documentar la reserva de derechos de forma clara, expresa y técnicamente reconocible. En contenidos online, esto puede hacerse mediante avisos legales, condiciones de uso, metadatos, protocolos de exclusión o instrucciones machine-readable dirigidas a crawlers y sistemas automatizados. Conviene que esa reserva sea coherente en toda la web y que se conserve prueba de su implementación.

Para desarrolladores de IA, la recomendación es trabajar con una trazabilidad robusta del dataset. Esto implica identificar fuentes, verificar licencias, excluir contenidos con opt-out, evitar materiales procedentes de repositorios ilícitos, documentar los filtros aplicados y revisar que los resultados del modelo no reproduzcan obras protegidas de forma sustancial.

El Reglamento Europeo de IA refuerza esta lógica. Los proveedores de modelos de IA de propósito general deberán contar con políticas para cumplir la normativa europea de copyright, respetar las reservas de derechos y publicar un resumen suficientemente detallado del contenido utilizado para entrenar sus modelos. En definitiva, el futuro no pasa por enfrentar copyright y tecnología, sino por combinar innovación, transparencia y licencias cuando sean necesarias.

Contáctanos

    Al pulsar en "Enviar" aceptas nuestra Política de Privacidad - + Información, para tratar tus datos con la finalidad de tramitar las consultas que puedas plantearnos.

    Acepto recibir comunicaciones comerciales perfiladas por parte de LETSLAW, S.L. conforme a lo dispuesto en nuestra Política de Privacidad - + Información