Umjetna inteligencija

Bajka o knjigama


AnthropicgoogleLLMKnjigee-knjige

Ovih dana smo mogli pročitati kako AI kompanije kupuju brdo starih knjiga jer u njima nema AI generiranog sadržaja kojim je preplavljen internet. Knjige objavljene prije 2022. ne mogu imati sadržaj generiran umjetnom inteligencijom.

Međutim iza priče o kupovini i skeniranju knjiga vjerojatno je jedan od glavnih motiva za taj postupak - pravna sigurnost. Treniranje modela nije započelo s tekstovima koje inače nalazimo na web stranicama, započelo je s korpusom knjiga i stručnih časopisa. Članak What's in my AI (2022) donosi analizu skupova podataka koji su korišteni za kreiranje ranih GPT modela.

Problem s brojnim skupovima podataka je što je njihov sadržaj nabavljen iz ranih piratskih izvora (Bibliotik, Library Genesis, Z-Library). Najpoznatiji od tih skupova je Books3, dio The Pile skupa, koji sadrži oko 196.000 knjiga, uglavnom iz posljednjih 20-30 godina. Među ostalima koristili su ga Meta, Anthropic, BloombergGPT.

Google Books

Google je kroz Google Books Library Project od 2004. skenirao oko 40 milijuna knjiga i sve obrađene s OCR-om kako bi dobio tekstualnu verziju. Izdavači kažu da su im knjige, za koje još vrijede autorska prava, dali samo za pretragu i za isječke, ali ne i za AI trening. Google ima takvo knjiško blago i neće ga iskoristiti? U to nisu bili uvjereni neki izdavači koji su protiv Googlea podigli tužbu. Optužuju ga da je prekršio uvjete za korištenje njihovog materijala, ali i za kopiranje knjiga s web stranica, uključujući i piratske stranice kao i za preuzimanje sadržaja iza paywalla. Iskreno, za taj sadržaj iz paywalla krivi su i neki izdavači koji su Google botovima dopuštali da vide kompletni sadržaj koji je inače dostupan samo pretplatnicima.

Anthropic i projekt Panama

Anthropic je optužen (Bartz v. Anthropic) da je neovlašteno koristio knjige tužitelja i stotine drugih izdavača za trening svojih modela. Preuzeli su preko 7 milijuna knjiga iz piratskih biblioteka, suosnivač Benjamin Mann osobno je sudjelovao u preuzimanju milijuna datoteka. Od 2024. počeli su s kupovanjem fizičkih knjiga koje su skenirali i uništavali kako bi imali čist lanac vlasništva (first-sale doctrine). Sudac je rekao kako je uništavanje fizičkog primjerka nakon skeniranja fair use. Korištenje piratskih izvora nije fair use i na kraju je došlo do nagodbe u kojoj se Anthropic obavezao platiti 1,5 milijardi dolara. Na suđenju je Anthropic izjavio da je njihov Project Panama nastao s namjerom da skeniraju sve knjige na svijetu. Procjena je da su tim projektom obuhvatili između 500.000 i 2 milijuna knjiga što je daleko od zacrtanog cilja. Većinu tih knjiga su vjerojatno već imali u digitalnom izdanju pa je jedan od glavnih ciljeva te operacije bio pokušaj pravne zaštite.

Pranje ruku

Nisu Anthropic i Google jedini, s višestrukim tužbama suočeni su i Meta, OpenAI pa čak i Microsoft. Svi su oni bili svjesni da dio materijala za treniranje modela dolazi iz pravno problematičnih izvora, a kupovina, skeniranje i uništenje knjiga sada vide kao pravno pranje ruku.

Ovo nije prvi put da neki internet servisi započinju svoj rad s bazom nelegalnog sadržaja. Spotify je u početku koristio nelegalne MP3 datoteke svojih zaposlenika, ali i one koje su skinuli s The Pirate Baya i drugih piratskih izvora.

Užasno uništavanje starih knjiga

Ljubitelji knjiga su užasnuti činjenicom da se knjige uništavaju. Neki čak spominju i primjere da se nabavljaju posljednji primjerci knjiga i nakon skeniranja unište.

To je samo jedna od gluposti koje svakodnevno nastaju na internetu. Za te knjige, od kojih su ostali samo rijetki primjerci, već su odavno istekla autorska prava i u pravnom smislu njihovo uništenje nema nikakvog smisla. Knjige kojima su istekla autorska prava mogu se skenirati, umnožavati i preuzimati i potpuno su besplatno i legalno dostupne u digitalnim arhivama kao što su Project Gutenberg, Internet Archive i Google Books.

Vrijedne knjige se ne skeniraju koristeći linear book scanner već na pažljiviji način. Ako ste pregledali mnoštvo starih knjiga vjerojatno ste naletjeli na stranice gdje su uhvaćeni prsti u rukavicama. Za razliku od velikih AI kompanija koje su uhvaćene s prstima u pekmezu.



Ako prvi put komentirate moguće je da se vaš komentar neće isti tren pojaviti na stranici već nakon dodatne provjere. Hvala na doprinosu i strpljenju.