Microsoft

Microsoft: el scraping d'IA és el major robatori laboral

Documents interns de Microsoft i OpenAI revelats en un judici contra The New York Times mostren que els seus directius eren conscients dels danys del scraping d'IA.

Microsoft: el scraping d'IA és el major robatori laboral

Microsoft: el scraping d’IA és el major robatori laboral de la història

El judici per infracció de drets d’autor que The New York Times va interposar contra Microsoft i OpenAI a finals de 2023 continua sent una de les batalles legals més importants del sector tecnològic. Ara, un nou escrit judicial presentat pel rotatiu novaiorquès ha tret a la llum documents interns que podrien capgirar completament la defensa de les dues empreses en matèria de scraping d’intel·ligència artificial.

El “major robatori laboral de la història”, en paraules d’un directiu de Microsoft

El document més explosiu és un memoràndum intern de Microsoft datat el gener de 2023, redactat per Brent Hecht, director de Ciències Aplicades de l’empresa. En aquest text, Hecht advertia que “milions de persones arreu del món aviat consideraran que els grans models ‘aspiren’ tota la seva feina com un robatori extraordinari de proporcions sense precedents”. Més contundent encara, el directiu qualificava el fenomen com “el major robatori laboral de la història de la humanitat”.

Aquest tipus d’afirmació, feta per un càrrec intern de l’empresa, resulta especialment significativa en el context d’un judici on Microsoft i OpenAI argumenten que l’ús de continguts publicats a internet per entrenar els seus models és perfectament legítim sota el principi d’ús just (fair use). Quan els teus propis directius documenten per escrit que el procés equival a un robatori massiu, defensar la bona fe davant un tribunal es complica notablement.

Un segon document intern de Microsoft aprofundeix en la mateixa línia i reconeix que “gairebé ningú tenia la intenció que el contingut que havia creat fos utilitzat d’aquesta manera, ni reben cap compensació pel seu ús”.

L’impacte econòmic: Copilot redueix els clics al Times un 93%

Més enllà de les declaracions morals, els documents revelen dades concretes sobre l’impacte econòmic del’IA generativa en els mitjans de comunicació. Les dades internes de Microsoft mostren que Copilot va reduir les visites generades des de Bing cap a The New York Times fins a un 93%. Dit d’una altra manera: quan els usuaris obtenen la resposta directament del xatbot, deixan de clicar als articles originals que han fet possible aquella resposta.

El mateix Hecht va descriure aquesta dinàmica com un “bucle fatal” (doom loop): com menys trànsit reben els editors, menys recursos tenen per produir contingut de qualitat; com menys contingut de qualitat hi ha a internet, pitjors seran els models d’IA. Una espiral descendent que, segons el directiu, “farà mal al rendiment dels nostres models i a tota la web al mateix temps”.

Hecht ho resumia amb una frase lapidària citada en l’escrit judicial: “És molt inusual que un producte final amenaci les bases econòmiques dels seus proveïdors essencials, però aquesta és la situació que hem creat per al nostre negoci de LLM respecte a la seva ‘cadena de subministrament de continguts’”.

OpenAI també reconeix internament que els xatbots perjudiquen els editors

Els documents no afecten només Microsoft. Nick Turley, responsable de ChatGPT a OpenAI, va descriure en comunicacions internes el xatbot com una “amenaça existencial” per als editors, argumentant que els assistents de IA “substitueixen” cada cop més el consum directe de continguts periodístics. Un enginyer de l’empresa va ser encara més directe en el seu testimoni: “Per molt prominentment que mostrem els enllaços, els usuaris no faran clic”.

Potser el moment més incòmode dels documents és l’intercanvi entre Nick Ryder, investigador d’OpenAI, i Greg Brockman, president de la companyia. Ryder va explicar a Brockman un “truc per saltar-se el mur de pagament del New York Times”, a la qual cosa Brockman va respondre: “Ah, interessant”.

El CEO de Microsoft, Satya Nadella, va declarar en una deposició que “qualsevol contingut darrere d’un mur de pagament hauria de ser llicenciat per qui vulgui fer-lo servir per entrenar models” i que si hagués sabut que OpenAI havia extret dades de continguts de pagament sense llicència, hauria exigit que es tornessin a entrenar els models.

Un judici que pot redefinir les regles del joc per a la IA

El debat sobre si el scraping massiu de continguts per entrenar models d’IA constitueix ús just és lluny de tancar-se. Alguns tribunals han donat la raó a les empreses tecnològiques en casos similars, però les revelacions d’aquest judici afegeixen un element nou i potencialment decisiu: la prova que els propis directius de les empreses eren perfectament conscients del dany econòmic que estaven causant als creadors de contingut.

El cas seguirà als tribunals, però independentment del seu desenllaç, ja ha aconseguit posar sobre la taula una pregunta que el sector no pot continuar ignorant: qui ha de pagar, i com, per la matèria primera que fa possible la revolució de la intel·ligència artificial generativa?

FONTS

HN — OpenAI ↗
← Tornar a l'inici