IA y copyright: Anthropic propone usar tus contenidos por defecto salvo que digas que no

IA y copyright

Imagina que escribes un libro, compones una canción, publicas fotografías o diriges un medio digital. Durante años la lógica parecía bastante sencilla: si alguien quería utilizar tu obra, debía contar contigo. La inteligencia artificial está intentando introducir una versión bastante más moderna del asunto: usar primero y preguntar después, siempre que exista una puerta para que puedas salir.

Esa es, simplificando, una de las propuestas que Anthropic ha llevado al debate australiano sobre IA y copyright. La compañía que desarrolla Claude ha pedido al Gobierno de Australia que estudie una “aprobación condicional” que permita entrenar modelos con contenidos protegidos siempre que los propietarios puedan excluirse mediante mecanismos técnicos como robots.txt. El Gobierno todavía no ha aceptado esa fórmula. De hecho, ya ha descartado una exención general de copyright para entrenamiento de modelos.

En Sal de la Matrix llevamos tiempo siguiendo una pregunta que aparece una y otra vez alrededor de la inteligencia artificial: quién decide las reglas cuando la tecnología necesita cantidades gigantescas de datos para funcionar. El caso australiano coloca esa discusión en un terreno especialmente incómodo: libros, noticias, fotografías, música y cualquier otro contenido disponible en Internet.

Qué está pidiendo exactamente Anthropic

Anthropic reconoce que una exención amplia que permitiera a las compañías de IA utilizar libremente obras protegidas no cuenta con apoyo suficiente en Australia. Por eso propone una alternativa que denomina “conditional approval”, una autorización más limitada sometida a determinadas condiciones.

Una de esas condiciones sería permitir que los propietarios indiquen técnicamente que no quieren que sus contenidos sean utilizados para entrenar modelos. La empresa menciona señales de exclusión mediante archivos robots.txt, el sistema que desde hace décadas utilizan las páginas web para indicar a determinados rastreadores qué pueden o no pueden recorrer.

La diferencia parece pequeña, pero cambia bastante la lógica. En lugar de que la empresa de IA tenga que conseguir autorización individual para usar una obra, el contenido podría estar disponible para entrenamiento salvo que su propietario se opusiera.

Es el equivalente digital de entrar en una fiesta dando por hecho que estás invitado y preguntar únicamente si alguien quiere echarte.

Por qué Anthropic quiere este sistema

El argumento empresarial es relativamente fácil de entender. Los modelos de inteligencia artificial necesitan enormes cantidades de información para entrenarse. Negociar licencias individualmente con cada escritor, fotógrafo, investigador, editor, músico o propietario de una web puede resultar caro, lento y técnicamente complejo.

Anthropic lleva meses defendiendo que Australia necesita claridad jurídica si quiere atraer grandes inversiones en centros de datos y entrenamiento de modelos. La compañía ha hablado de inversiones multimillonarias en el país y considera que la incertidumbre sobre el copyright puede dificultar ese desarrollo.

La empresa sostiene además que un marco condicionado podría proteger a los creadores y, al mismo tiempo, permitir el desarrollo de modelos avanzados dentro de Australia. Es decir, intenta colocar la discusión entre dos extremos: ni barra libre completa ni obligación de negociar cada obra por separado.

Sobre el papel suena razonable. El problema empieza cuando preguntas quién tiene que hacer el trabajo para que se respete un derecho.

ABC y SBS responden: el problema debería ser vuestro

Las cadenas públicas australianas ABC y SBS han presentado una posición prácticamente opuesta ante la misma investigación parlamentaria. Ambas consideran que las empresas de IA deberían estar sujetas a obligaciones similares a las de otros editores y medios cuando utilizan contenidos protegidos.

ABC ha advertido de que permitir a las compañías de IA utilizar noticias sin permiso ni compensación puede acelerar la “canibalización” del periodismo tradicional. SBS, por su parte, cuestiona que mecanismos como robots.txt sean suficientes porque los propietarios tendrían que controlar continuamente qué bots existen y cómo impedirles el acceso.

Ese detalle técnico es más importante de lo que parece.

Qué es robots.txt y por qué aquí importa tanto

Robots.txt es un pequeño archivo que puede incluir una página web para indicar a los rastreadores automáticos qué zonas deberían evitar. Google, por ejemplo, utiliza este tipo de instrucciones cuando recorre Internet para construir su buscador.

Pero robots.txt no es una cerradura. Es una indicación. Un bot debe decidir respetarla.

SBS ha señalado precisamente ese problema: existen rastreadores que ignoran esas instrucciones y las compañías cambian constantemente sus bots y sistemas de recopilación. Eso obliga al propietario de la web a mantenerse actualizado y bloquear continuamente nuevos métodos de acceso.

En otras palabras, el sistema de exclusión puede convertir un derecho legal en una especie de mantenimiento técnico permanente.

Tienes copyright.

Perfecto.

Ahora aprende qué crawler utiliza cada compañía, actualiza tu servidor y comprueba cada cierto tiempo que nadie haya cambiado de nombre.

La diferencia entre opt-in y opt-out

Hay dos maneras muy distintas de diseñar este tipo de sistema.

Opt-in: primero me preguntas

En un modelo de consentimiento previo, una empresa necesita permiso antes de utilizar una obra para determinado propósito. El propietario controla la decisión desde el principio.

Opt-out: lo usas hasta que digo que pares

En el modelo que Anthropic plantea como posible solución, la obra podría utilizarse mientras el creador no haya indicado expresamente que desea quedar fuera.

El cambio parece administrativo, pero afecta directamente al equilibrio de poder. Una gran empresa tecnológica dispone de abogados, ingenieros y sistemas automáticos capaces de recopilar millones de documentos. Un fotógrafo autónomo, una pequeña editorial o un blog personal probablemente no tienen ese mismo equipo.

El problema no consiste únicamente en si existe un botón para salir. También importa quién carga con la obligación de encontrar ese botón y utilizarlo correctamente.

Los medios quieren que la IA pague por las noticias

ABC y SBS han ido más allá y han pedido que las empresas de inteligencia artificial entren también dentro del sistema australiano de negociación con grandes plataformas digitales.

Australia ya obligó anteriormente a empresas como Google y Meta a negociar acuerdos económicos con determinados medios por el uso de contenidos periodísticos. Los broadcasters consideran que la IA generativa plantea ahora una situación parecida.

Si un modelo puede responder preguntas utilizando conocimiento obtenido de artículos periodísticos, resumir noticias o sustituir parte de las visitas que antes llegaban a un medio, aparece una pregunta económica bastante evidente: quién financia la información original que alimenta esa respuesta.

El problema se vuelve todavía más interesante cuando pensamos en cómo consumiremos noticias dentro de unos años. Si en lugar de visitar diez medios preguntas a un asistente de IA “qué ha ocurrido hoy”, ese asistente puede convertirse en una nueva capa entre el lector y quien produjo la información.

En nuestro artículo sobre la burbuja de filtros hablábamos de cómo los algoritmos seleccionan qué parte de Internet termina llegando hasta nosotros. Los asistentes generativos añaden un paso más: ya no seleccionan únicamente enlaces. Pueden reconstruir y redactar directamente la respuesta.

El entrenamiento tampoco es lo mismo que copiar y pegar

Aquí conviene introducir otro matiz. Entrenar un modelo con una obra no significa necesariamente almacenar una copia exacta y mostrarla después palabra por palabra.

Los modelos aprenden patrones estadísticos a partir de grandes cantidades de datos. Las compañías de IA utilizan este argumento para sostener que el entrenamiento constituye un proceso diferente a la reproducción tradicional de una obra.

Los titulares de derechos responden que para realizar ese entrenamiento las obras deben ser copiadas y procesadas y que, además, algunos modelos pueden reproducir fragmentos reconocibles de determinados contenidos. Esa discusión está detrás de numerosas demandas en Estados Unidos y otros países.

Por tanto, el conflicto jurídico sigue abierto. No existe una única respuesta aceptada internacionalmente.

Australia se ha convertido en un campo de pruebas

El Gobierno de Anthony Albanese está intentando construir su marco de inteligencia artificial mientras recibe simultáneamente presión de empresas tecnológicas, creadores, medios y grandes inversores.

La administración ya ha descartado una excepción general de minería de textos y datos y ha prometido fuertes protecciones para los creadores australianos. Al mismo tiempo, quiere atraer centros de datos y grandes inversiones relacionadas con IA.

Eso convierte el copyright en una moneda bastante importante dentro de la negociación.

Anthropic quiere claridad para poder entrenar modelos.

Los creadores quieren conservar el control.

Los medios quieren compensación.

El Gobierno quiere inversión.

Todo perfectamente compatible hasta que alguien tiene que redactar la ley.

Cuando los datos son el combustible, quien posee los derechos molesta un poco

Buena parte de la economía de la inteligencia artificial depende de una característica bastante sencilla: los modelos mejoran cuando tienen acceso a enormes cantidades de información.

Internet fue una fuente extraordinaria para conseguirla. Millones de libros digitalizados, blogs, foros, fotografías, periódicos, artículos científicos y páginas públicas estaban disponibles a un clic.

El problema es que “públicamente accesible” y “libre de derechos” son conceptos diferentes.

Una fotografía publicada en una web puede verla cualquiera. Eso no significa que cualquiera pueda utilizarla para cualquier finalidad.

Un periódico publica una noticia en abierto. Eso tampoco elimina automáticamente sus derechos sobre ella.

La inteligencia artificial ha obligado a reabrir esa distinción a una escala que el derecho de autor nunca había tenido que manejar.

El debate también afecta a quien tiene una web pequeña

Es fácil pensar que esta discusión enfrenta únicamente a Anthropic con grandes periódicos. Pero el principio podría afectar también a millones de propietarios de páginas pequeñas.

Un blog.

Una tienda.

Un fotógrafo.

Una asociación.

Una revista especializada.

Un escritor que publica relatos.

Si el sistema se basa en exclusión voluntaria, todos ellos tendrían que saber cómo indicar que no quieren participar.

Para quienes gestionan una web, conviene revisar actualmente qué rastreadores acceden al sitio, mantener actualizado el archivo robots.txt y consultar las políticas de cada proveedor de IA. Sin embargo, bloquear un crawler no garantiza por sí solo que contenidos recopilados anteriormente desaparezcan de conjuntos de entrenamiento ya existentes.

La regulación decidirá quién tiene que levantar la mano

En nuestra pieza sobre qué es Palantir vimos cómo el poder tecnológico muchas veces no está únicamente en poseer datos, sino en tener la infraestructura capaz de procesarlos a una escala que otros actores no pueden igualar.

Con el copyright aparece una versión diferente del mismo desequilibrio.

Una empresa puede automatizar la recopilación de millones de páginas.

Un creador individual tiene que proteger una.

Por eso decidir entre opt-in y opt-out no es simplemente decidir dónde colocar una casilla en un formulario.

Es decidir quién soporta el coste de pedir permiso.

Si gana el consentimiento previo, la empresa tecnológica tendrá que encontrar una forma de conseguir autorizaciones o licencias.

Si gana la exclusión posterior, el creador tendrá que vigilar que su obra no entre en el sistema.

Australia todavía no ha decidido.

Anthropic ha puesto su propuesta encima de la mesa y ABC y SBS han colocado otra enfrente. El Parlamento seguirá escuchando a empresas y organizaciones antes de formular sus recomendaciones.

El detalle interesante es que la inteligencia artificial está convirtiendo una de las reglas más antiguas de Internet en una cuestión política bastante moderna.

Durante años robots.txt servía básicamente para hablar con Google.

Ahora puede terminar siendo una de las líneas que separen “esto es mío” de “puedes entrenar con ello”.

Para ser un archivo de texto de unas pocas líneas, empieza a cargar con bastante responsabilidad.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Scroll al inicio
Esta web utiliza cookies propias y de terceros para su correcto funcionamiento y para fines analíticos. Contiene enlaces a sitios web de terceros con políticas de privacidad ajenas que podrás aceptar o no cuando accedas a ellos. Al hacer clic en el botón Aceptar, acepta el uso de estas tecnologías y el procesamiento de tus datos para estos propósitos. Más información
Privacidad