Тайният „Проект Панама“: Anthropic купила милиони книги, разрязала ги на страници, за да ги сканира и обучава ИИ

Автори: Аарън Шафър, Уил Оремъс и Ниташа Тику, washingtonpost.com

В началото на 2024 г. ръководители на стартъпа за изкуствен интелект Anthropic ускорили работата по амбициозен проект, който искали да запазят в тайна.

„Проект Панама е нашето усилие да сканираме по разрушителен начин всички книги в света“, се казва във вътрешен документ за планиране, разсекретен миналата седмица в рамките на съдебно производство. „Не искаме да се знае, че работим по това.“

За около година компанията е похарчила десетки милиони долари, за да придобие милиони книги и да отреже гръбчетата им, преди да сканира страниците им, за да добави повече знания към моделите с изкуствен интелект, стоящи зад продукти като популярния ѝ чатбот Claude, показват съдебните материали.

Подробности за „Проект Панама“, които досега не бяха съобщавани, излязоха наяве от над 4000 страници документи по дело за авторски права, заведено от автори на книги срещу Anthropic, оценена от инвеститорите на 183 млрд. долара. През август компанията се съгласи да плати 1,5 млрд. долара за уреждане на делото, но решението на федерален съдия миналата седмица да разсекрети множество документи по случая разкри в много по-голяма степен настойчивия стремеж на Anthropic да се сдобива с книги.

Новите документи, заедно с по-ранни съдебни материали по други дела за авторски права срещу компании за изкуствен интелект, показват докъде са стигнали технологични компании като Anthropic, Meta, Google и OpenAI, за да се сдобият с огромни масиви от данни, с които да „обучават“ софтуера си.

Делото срещу Anthropic е част от вълна съдебни искове срещу компании за изкуствен интелект, заведени от писатели, художници, фотографи и медии. Документите по тези дела показват как водещите технологични компании са участвали в трескава и понякога тайна надпревара за придобиване на събраните произведения на човечеството.

Съдебните документи показват, че компаниите са смятали книгите за особено ценна награда. В документ на Anthropic от януари 2023 г. един от съоснователите на компанията излага теорията, че обучението на модели с ИИ върху книги би могло да ги научи „как да пишат добре“, вместо да имитират „нискокачествения език в интернет“. В имейл в Meta от 2024 г. достъпът до дигитален масив от книги е описан като „жизненоважен“, за да може компанията да бъде конкурентоспособна спрямо съперниците си в областта на ИИ.

Съдебните материали обаче показват, че компаниите не са смятали за практично да получат пряко разрешение от издателите и авторите за използването на произведенията им. Вместо това Anthropic, Meta и други компании намерили начини да придобиват книги на едро без знанието на авторите, твърди се в съдебните документи, включително чрез изтегляне на пиратски копия.

На няколко пъти служители на Meta изразявали във вътрешни съобщения опасения, че изтеглянето без разрешение на колекция от милиони книги би нарушило закона за авторското право. Според документи по дело за авторски права, заведено от автори на книги срещу компанията, във вътрешен имейл от декември 2023 г. се посочва, че практиката е била одобрена след „ескалация до MZ“ – очевидно препратка към главния изпълнителен директор Марк Зукърбърг. Meta отказа коментар за тази статия.

В един от новоразсекретените съдебни документи Anthropic разкрива, че съоснователят Бен Ман лично е изтеглил голямо количество художествена и нехудожествена литература от „библиотека в сянка“ с книги и друго съдържание, нарушаващо авторски права, наречена LibGen, в продължение на 11 дни през юни 2021 г. Екранна снимка на браузъра му, включена в съдебните документи, го показва как изтегля файлове чрез софтуер за споделяне на файлове.

Година по-късно Ман приветствал появата през юли 2022 г.........

© Гласове