2026 m. rugsėjo vidurio neviešinti teismo dokumentai paviešino „OpenAI“, „Microsoft“ ir „Anthropic“ vidinius pranešimus. Šie įrašai, paskelbti kaip naujienų leidėjų ir autorių pateiktų didelio atgarsio sulaukusių autorių teisių ieškinių dalis, rodo, kad darbuotojai ir vadovai privačiai diskutavo apie duomenų, naudojamų dirbtinio intelekto modeliams apmokyti, etiką, teisinę riziką ir kainą.
Pagrindinės teismo dokumentų išklotinės
• Diskusijos apie knygų mokymą: Neviešinti Autorių gildijos prieš „OpenAI“ bylos dokumentai rodo, kad „OpenAI“ darbuotojai aptarė dideles knygų pavadinimų pirkimo, siekiant apmokyti ankstyvąsias „ChatGPT“ versijas, išlaidas. Vidiniuose pranešimuose buvo atskleistos diskusijos apie neleistinų šaltinių, tokių kaip knygų piratavimo saugykla „Library Genesis“, naudojimą, o viename 2019 m. vidiniame pranešime buvo teigiama: „Mes apmokėme GPT-3 su piratine medžiaga! Draudžiama tuo dalytis!“.
• „Darbo rezultatų vagystė“ – vidiniai rūpesčiai: Teisinis dokumentas, atskleistas „The New York Times“ autorių teisių byloje, parodė, kad dr. Brentas Hechtas, „Microsoft“ taikomųjų mokslų direktorius, 2023 m. privačiai perspėjo, kad masinis duomenų išgavimas visuomenėje gali būti vertinamas kaip „stebinamoji precedento neturinčio masto vagystė“ ir „didžiausia darbo rezultatų vagystė žmonijos istorijoje“.
• Pramonės išstūmimas: Nickas Turley, „OpenAI“ „ChatGPT“ vadovas, vidiniuose pranešimuose rašė, kad dirbtinis intelektas kelia „egzistencinę grėsmę“ leidėjams ir kad jų produktai yra „daugiausia pakeičiantys“. Panašiai Jackas Clarkas, buvęs „OpenAI“ politikos direktorius ir „Anthropic“ įkūrėjas, 2020 m. perspėjo, kad jų sistemos pakeis žmonių autorius tokiose platformose kaip „Amazon“ ir padarys žmones bedarbius.
• „Anthropic“ teisiniai sprendimai: Teisiniai veiksmai taip pat buvo nukreipti į „Anthropic“. Nors teismai nusprendė, kad teisėtas spausdintų knygų pirkimas siekiant jas nuskaityti ir skaitmeninti dirbtinio intelekto mokymui patenka į „sąžiningo naudojimo“ kategoriją, „Anthropic“ neseniai sumokėjo 1,5 mlrd. USD kompensaciją autoriams dėl teiginių, kad ji panaudojo milijonus piratinių knygų iš elektroninių knygų piratavimo svetainių.
Technologijų pramonės gynyba
„Microsoft“ ir „OpenAI“ nuolat tvirtino, kad viešųjų interneto duomenų ir paskelbtų darbų nuskaitymas siekiant apmokyti dirbtinio intelekto modelius yra teisiškai saugomas pagal JAV autorių teisių įstatymo „sąžiningo naudojimo“ doktriną. Jos teigia, kad mokymo procesas nekopijuoja darbo, kad jį perparduotų, o transformuoja duomenis, kad išmokytų mašiną, kaip veikia žmogaus kalba ir logika. „Microsoft“ taip pat pareiškė, kad komentarai apie „darbo vagystę“ atspindi individualaus akademiko požiūrį ir neatspindi oficialios korporacijos pozicijos.
Teisiniai ginčai federaliniame teisme tęsiasi, teisėjams svarstant sutrumpintus sprendimus, siekiant nustatyti, ar generatyvinio dirbtinio intelekto bendrovių pagrindinė duomenų rinkimo praktika yra autorių teisių pažeidimas, ar sąžiningas naudojimas.
"Esame susirūpinę dėl to, kaip ši duomenų išgavimo praktika gali paveikti mūsų pačių intelektinę nuosavybę ar komercines paslaptis. „Autoriai, įskaitant Johną Grishamą, Davidą Baldacci, Jodi Picoult ir Jonathaną Franzeną, prieš trejus metus padavė „OpenAI“ ir „Microsoft“ į teismą dėl autorių teisių pažeidimo.
Ketvirtadienį paviešintame teismo dokumente išsamiai aprašomi vidiniai pranešimai ir liudijimai, kuriuose aprašoma, kaip „OpenAI“ darbuotojai, įskaitant vadovus, kalbėjo apie bendrovės piratinių knygų naudojimą ankstyvajam „ChatGPT“ modeliui apmokyti. Dokumentas buvo pateiktas siekiant paremti autorių prašymą, kad federalinis teisėjas priimtų jiems palankų sprendimą prieš teismą.
Technologijų bendrovės teigė, kad jų veiksmai yra „sąžiningas naudojimas“, leidžiantis naudoti tam tikrą autorių teisių saugomą medžiagą be aiškaus leidimo, ir kad jų naudojamas turinys buvo transformuojantis.
Nuo 2019 m. „OpenAI“ pradėjo naudoti knygas iš failų bendrinimo svetainės „Library Genesis“ (sutrumpintai „LibGen“), kad padėtų apmokyti savo didelį kalbos modelį. Svetainė, teikianti nemokamą prieigą prie knygų ir mokslinių straipsnių, susidūrė su kaltinimais dėl autorių teisių saugomos medžiagos piratavimo.
Tuometinis „OpenAI“ generalinis patarėjas Davidas Lansky buvo vienas iš tų, kurie rekomendavo nemokamai atsisiųsti knygas iš „LibGen“ kaip galimą duomenų šaltinį, teigia pateiktas pranešimas.
Tomas Brownas, tuometinis vyriausiasis GPT-3 inžinierius, ir Benas Mannas, kitas techninio personalo narys, apibūdino „LibGen“ kaip „netikrą AF“, remiantis pateiktame pranešime ir liudijime pateiktais duomenimis. Federalinis teismas 2015 m. įpareigojo „LibGen“ užsidaryti, o akademinių leidinių leidėjas „Elsevier“ 2017 m. gavo 15 mln. dolerių vertės teismo sprendimą prieš svetainę.
„OpenAI“ darbuotojai aptarė nuorodų į „LibGen“ pašalinimą iš dokumentų, kurie vėliau galėtų būti vieši, teigiama pateiktame pranešime.
Vienu atveju Dario Amodei, tuometinis vyresnysis „OpenAI“ tyrėjas, kuris dabar yra „Anthropic“ generalinis direktorius, „Slack“ paklausė, ar „falšyvais“ vadinti mūsų korpusus „Books1“ ir „Books2“ ir nenurodyti, kas jie yra, ypač kai iš tikrųjų tai yra „Libgen“ (kuris yra šiek tiek abejotino patikimumo šaltinis).“
Atskirai M. Mannas rašė, kad duomenų rinkinių aprašymas buvo „sąmoningai nekonkretus, nes tai – „LibGen“.“
Daugelis asmenų, dalyvavusių ankstyvajame „OpenAI“ modelių mokymo procese, dabar dirba „Anthropic“.
„OpenAI“ pareiškė, kad darbuotojai, naudoję „LibGen“ ankstesniems „ChatGPT“ modeliams kurti, įmonėje nebedirba, o „LibGen“ duomenų rinkinys nebuvo naudojamas dabartiniams „ChatGPT“ modeliams kurti. „Anthropic“ atstovė spaudai komentuoti atsisakė. „Convergent Research“, kurioje dabar dirba Lanskis, į prašymą pakomentuoti neatsakė.
Galiausiai „OpenAI“ pašalino piratinius duomenų rinkinius. Bobas McGrew, tuo metu ėjęs tyrimų viceprezidento pareigas, 2022 m. birželį „Slack“ kanale rašė: „dabar pats tinkamiausias metas pašalinti „LibGen“ iš mūsų sistemų ir saugyklų“, turint omenyje didelį „OpenAI“ matomumą žiniasklaidoje.
Pasak jo, pašalinus „LibGen“ tyrėjai nebegalėtų atkartoti ankstesnių GPT-3 ar GPT-3.5 rezultatų, tačiau tai „būtų labai naudinga teisiniais sumetimais“.
„OpenAI“ pašalino duomenų rinkinius iš savo bibliotekos.
Įmonė ne kartą vertino galimas didelio knygų kiekio įsigijimo išlaidas. „OpenAI“ prezidentas Gregas Brockmanas 2022 m. pabaigoje rašė „OpenAI“ bendraįkūrėjui Iljai Sutskeveriui, kad jie galėtų įsigyti daug knygų, „tačiau jos brangios skaičiuojant vienam „tokenui“ (angl. *token*), todėl tam neteikėme prioriteto“. („Tokenai“ yra pagrindinis dirbtinio intelekto naudojimo matavimo vienetas.)
Kaip teigiama teismui pateiktuose dokumentuose, „OpenAI“ viceprezidentas žiniasklaidos partnerystės klausimais Varunas Shetty liudijo, kad jam nebuvo žinoma apie įmonės praktiką masiškai pirkti knygas ir jas skenuoti DI mokymo tikslais.
„Safe Superintelligence“ – dabartinė I. Sutskeverio dirbtinio intelekto laboratorija – į prašymą pakomentuoti neatsakė.
„Wall Street Journal“ patronuojančioji bendrovė „News Corp“ yra sudariusi turinio naudojimo sutartį su „OpenAI“.” [1]
1. Filing Details OpenAI Book Use --- Documents show employees weighed cost of buying titles to train ChatGPT. Korn, Melissa; Bruell, Alexandra. Wall Street Journal, Eastern edition; New York, N.Y.. 22 Sep 2026: B4.
Komentarų nėra:
Rašyti komentarą