¡Menudo culebrón se ha montado en el universo de la inteligencia artificial! Imaginad la escena: una de las empresas tecnológicas más grandes del mundo, Meta, acusada de entrenar a su flamante IA con… ¡atención!… ¡pornografía pirateada descargada por torrent! La cosa tiene su gracia, ¿verdad? Uno se imagina a los ingenieros de Meta, en sus relucientes oficinas, buscando el mejor cliente de torrent para conseguir el último éxito del cine para adultos y alimentar así a su algoritmo.
Pero, como era de esperar, Meta no ha tardado en tirar de la manta, o más bien, en negarlo todo con la mayor de las rotundidades. Desde la compañía de Mark Zuckerberg aseguran, alto y claro, que “no torreamos material pornográfico para entrenar nuestros modelos de IA”. ¡Menos mal! Ya veíamos a Llama, su modelo de lenguaje, haciendo chistes de doble sentido. Aseguran que utilizan «datos disponibles públicamente» y que tienen «políticas estrictas contra el uso de contenido ilegal o dañino». ¡Faltaría más!
Entonces, ¿de dónde viene este lío? Pues parece ser que la chispa saltó de un memo interno, un informe de un abogado de Meta que, por algún extraño giro del destino, llegó a manos del prestigioso *Financial Times*. En este documento, supuestamente, se planteaba la posibilidad de utilizar «grandes cantidades de material con derechos de autor y contenido pornográfico» para el entrenamiento de su IA. Parece ser que la falta de datos *limpios* y legalmente obtenidos para entrenar a estas bestias de la IA es un quebradero de cabeza para todos, y se habría barajado la opción del «torrenting y el uso de contenido pirateado» como una solución (muy) dudosa.
El mismo abogado habría expresado en el memo la dificultad de encontrar un equilibrio entre usar datos «que quizás no se hayan obtenido legalmente» y el «interés público en tener un modelo de lenguaje grande». ¡Vaya dilema existencial! Entre el copyright y la sed insaciable de datos de la IA, la ética se queda a menudo en la cuneta.
No es la primera vez que Meta (y otras gigantes tecnológicas) se ve en el ojo del huracán por el origen de los datos de sus IA. De hecho, ya han tenido que enfrentarse a varias demandas por infracción de derechos de autor. Así que, aunque nieguen haber montado una red de descarga de cine X en sus servidores para educar a su IA, el «riesgo reputacional» y los líos legales por el entrenamiento de sus modelos (como el famoso Llama 2) siguen siendo una espada de Damocles para la compañía. Al final, el debate sobre cómo alimentar a estas inteligencias artificiales sin caer en la ilegalidad o en terrenos pantanosos sigue más vivo que nunca. Y nosotros, aquí, con la curiosidad de saber qué más habrán considerado.



