Тайният „Проект Панама“: Anthropic купила милиони книги, разрязала ги на страници, за да обучава ИИ

ЕС и Свят 26.08.2026 15:03 Снимка: ДНЕС+

Тайният „Проект Панама“: Anthropic купила милиони книги, разрязала ги на страници, за да обучава ИИ

Аарън Шафър, Уил Оремъс и Ниташа Тику, washingtonpost.com

В началото на 2024 г. ръководители на стартъпа за изкуствен интелект Anthropic ускорили работата по амбициозен проект, който искали да запазят в тайна.

„Проект Панама е нашето усилие да сканираме по разрушителен начин всички книги в света“, се казва във вътрешен документ за планиране, разсекретен миналата седмица в рамките на съдебно производство. „Не искаме да се знае, че работим по това.“

За около година компанията е похарчила десетки милиони долари, за да придобие милиони книги и да отреже гръбчетата им, преди да сканира страниците им, за да добави повече знания към моделите с изкуствен интелект, стоящи зад продукти като популярния ѝ чатбот Claude, показват съдебните материали.

Подробности за „Проект Панама“, които досега не бяха съобщавани, излязоха наяве от над 4000 страници документи по дело за авторски права, заведено от автори на книги срещу Anthropic, оценена от инвеститорите на 183 млрд. долара. През август компанията се съгласи да плати 1,5 млрд. долара за уреждане на делото, но решението на федерален съдия миналата седмица да разсекрети множество документи по случая разкри в много по-голяма степен настойчивия стремеж на Anthropic да се сдобива с книги.

Новите документи, заедно с по-ранни съдебни материали по други дела за авторски права срещу компании за изкуствен интелект, показват докъде са стигнали технологични компании като Anthropic, Meta, Google и OpenAI, за да се сдобият с огромни масиви от данни, с които да „обучават“ софтуера си.

Делото срещу Anthropic е част от вълна съдебни искове срещу компании за изкуствен интелект, заведени от писатели, художници, фотографи и медии. Документите по тези дела показват как водещите технологични компании са участвали в трескава и понякога тайна надпревара за придобиване на събраните произведения на човечеството.

Съдебните документи показват, че компаниите са смятали книгите за особено ценна награда. В документ на Anthropic от януари 2023 г. един от съоснователите на компанията излага теорията, че обучението на модели с ИИ върху книги би могло да ги научи „как да пишат добре“, вместо да имитират „нискокачествения език в интернет“. В имейл в Meta от 2024 г. достъпът до дигитален масив от книги е описан като „жизненоважен“, за да може компанията да бъде конкурентоспособна спрямо съперниците си в областта на ИИ.

Съдебните материали обаче показват, че компаниите не са смятали за практично да получат пряко разрешение от издателите и авторите за използването на произведенията им. Вместо това Anthropic, Meta и други компании намерили начини да придобиват книги на едро без знанието на авторите, твърди се в съдебните документи, включително чрез изтегляне на пиратски копия.

На няколко пъти служители на Meta изразявали във вътрешни съобщения опасения, че изтеглянето без разрешение на колекция от милиони книги би нарушило закона за авторското право. Според документи по дело за авторски права, заведено от автори на книги срещу компанията, във вътрешен имейл от декември 2023 г. се посочва, че практиката е била одобрена след „ескалация до MZ“ – очевидно препратка към главния изпълнителен директор Марк Зукърбърг. Meta отказа коментар за тази статия.

В един от новоразсекретените съдебни документи Anthropic разкрива, че съоснователят Бен Ман лично е изтеглил голямо количество художествена и нехудожествена литература от „библиотека в сянка“ с книги и друго съдържание, нарушаващо авторски права, наречена LibGen, в продължение на 11 дни през юни 2021 г. Екранна снимка на браузъра му, включена в съдебните документи, го показва как изтегля файлове чрез софтуер за споделяне на файлове.

Година по-късно Ман приветствал появата през юли 2022 г. на нов сайт, наречен Pirate Library Mirror, който твърдял, че разполага с огромна база данни от книги и сам заявявал, че „умишлено нарушаваме закона за авторското право в повечето държави“. Ман изпратил линк към сайта на други служители на Anthropic със съобщението: „точно навреме!!!“

В съдебни документи Anthropic заявява, че компанията никога не е обучавала комерсиален модел с ИИ, който да е носил приходи, използвайки данните ѝ от LibGen, и никога не е използвала Pirate Library Mirror за обучение на цялостен модел с ИИ.

Ед Нютън-Рекс, бивш ръководител в сферата на ИИ и музикален композитор, който сега ръководи неправителствена организация за защита на правата на творците, заяви, че разкритията подчертават факта, че компаниите за ИИ дължат на творците повече, отколкото са им платили досега.

„Спешно се нуждаем от рестарт в цялата индустрия на изкуствения интелект, така че творците да започнат да получават справедливо възнаграждение за жизненоважния принос, който правят“, каза той.

Google, Microsoft и създателят на ChatGPT OpenAI също са изправени пред дела за авторски права, заведени от автори на книги с подобни обвинения. („Вашингтон пост“ има партньорство за съдържание с OpenAI.)

Повечето съдебни дела срещу компаниите за ИИ все още продължават, а Джеймс Гримелман, професор по дигитално и информационно право в Cornell Tech, заяви, че правните въпроси, които те повдигат, все още не са окончателно решени. Но в две ранни решения съдии постановиха, че използването на книги от технологични компании за обучение на модели с ИИ без разрешението на автора или издателя може да бъде законно по силата на доктрината в авторското право, известна като „добросъвестно използване“ (fair use).

През юни окръжният съдия Уилям Алсъп постанови, че Anthropic е имала право да използва книги за обучение на модели с ИИ, тъй като те обработват материала по „трансформативен“ начин. Той сравни процеса на обучение на ИИ с учители, които „обучават ученици да пишат добре“.

Същия месец окръжният съдия Винс Чхабрия постанови по делото срещу Meta, че авторите на книгите не са успели да докажат, че моделите с ИИ на компанията могат да навредят на продажбите на произведенията им.

Компаниите обаче все още могат да си навлекат проблеми заради начина, по който са придобили книгите. В случая с Anthropic проектът за сканиране на книги премина съдебната проверка, но съдията установи, че компанията може да е нарушила авторските права на писателите, когато е изтеглила безплатно милиони пиратски книги, преди да започне „Проект Панама“.

Алсъп даде статут на колективен иск на авторите, чиито книги са били включени в две „библиотеки в сянка“ – огромни масиви от дигитализирани книги, споделяни онлайн без разрешение, – които Anthropic е изтеглила и съхранявала за бъдеща употреба.

Вместо да се изправи пред съдебен процес, компанията се съгласи да плати 1,5 млрд. долара на издатели и автори, без да признава нарушение. Авторите, чиито книги са били изтеглени, могат да поискат своя дял от споразумението, който се оценява на около 3000 долара за заглавие.

„Това дело беше уредено, но знаковото решение на съда от юни 2025 г. остава в сила“, заяви в имейл до „Вашингтон пост“ заместник-главният юрисконсулт на Anthropic Апарна Шридхар.

„Съдия Алсъп постанови, че обучението на ИИ е „типичен пример за трансформативна употреба“: моделите с ИИ на Anthropic са били обучавани върху произведения не за да „ги възпроизвеждат или заменят, а за да поемат в напълно различна посока и да създадат нещо различно“. Въпросът, по който постигнахме споразумение, беше как са били придобити някои материали, а не дали можем да ги използваме за разработване на модели с ИИ.“

Снимка, представена в съдебните документи, показва склад за книги, за който се твърди, че е играл роля в „Проект Панама“ на Anthropic - проекта ѝ за сканиране, дигитализиране и унищожаване на милиони книги. Снимката е предоставена на The Post.

Купувай, режи, сканирай, рециклирай

Когато Anthropic започнала операцията по „Проект Панама“ за закупуване и сканиране на физически книги, компанията се обърнала към ветеран от Силициевата долина. Тя наела Том Търви, ръководител в Google, който две десетилетия по-рано участвал в създаването на прочутия, но оспорван по съдебен ред проект Google Books на интернет гиганта.

Първоначално Anthropic обмисляла да купува книги от библиотеки или книжарници за употребявани книги като емблематичната нюйоркска Strand, известна със своите „18 мили“ нови и употребявани книги, показват документите.

Магазинът бил „заинтересован да предоставя употребявани книги“, се казва в документ, описващ среща на Anthropic за придобиване на съдържание през март 2024 г.

Служители на Anthropic обсъждали също възможността да се обърнат към американски библиотеки, включително Нюйоркската обществена библиотека или „някоя нова библиотека, която хронично страда от недостиг на финансиране“, показват документите.

Не е ясно кои, ако изобщо някои, от тези предложения Anthropic е реализирала. Говорител на Strand заяви по имейл, че книжарницата в крайна сметка не е продала никакви книги на Anthropic. Нюйоркската обществена библиотека не отговори на молбата за коментар.

В крайна сметка Anthropic купила милиони книги, често на партиди от десетки хиляди, показват съдебните документи. Компанията разчитала на книжарници и търговци на употребявани книги, включително Better World Books и базираната във Великобритания World of Books.

Окончателният брой на сканираните книги и цената им са заличени в документите, но проектно предложение от доставчик, който впоследствие работил с Anthropic, отбелязва, че компанията за ИИ „търси опитен доставчик на услуги за сканиране на документи, който да преобразува между 500 000 и два милиона книги за период от шест месеца“.

Better World Books и World of Books не отговориха на молбите за коментар в понеделник.

Документът описва как „хидравлична машина за рязане“ на компанията за сканиране щяла „прецизно да разрязва“ книгите, чиито страници след това щели да бъдат „сканирани на високоскоростни, висококачествени скенери от производствен клас“.

Накрая, отбелязва документът, компанията за сканиране щяла да „организира с фирмата за рециклиране вземането на обработените книги“.

„Не ми се струва редно“

Документи, публикувани в рамките на делото за авторски права срещу Meta, показват, че служителите на гиганта в социалните мрежи също са били жадни за повече данни и са били готови да поемат юридически рискове, за да ги получат.

Макар съдия Чхабрия да застана на страната на Meta по въпроса за използването на книги за обучение на модели с ИИ, той позволи на авторите да продължат с твърденията, че Meta незаконно е разпространявала копия на пиратски книги. Ищците искат тези обвинения да получат статут на колективен иск в Северния окръг на Калифорния.

В иска си авторите твърдят, че висши ръководители на Meta са обмисляли да плащат за книги, с които да обучават своите модели с ИИ, но вместо това са решили да изтеглят безплатно милиони книги от „торент“ платформи, които улесняват онлайн пиратството. Начинът, по който са устроени тези платформи, често възнаграждава потребителите, които качват съдържание, като им позволява по-бързо изтегляне на големи колекции от файлове.

Вътрешни документи, част от които вече са били съобщавани от медиите, показват служители на Meta, които изразяват опасения, че това, което правят, е рисковано или неправилно – и обсъждат как да прикрият следите си.

„Торентването от служебен лаптоп не ми се струва редно“, написал един инженер през 2023 г., показват документите.

По-късно същият служител споделил с юридическия екип на компанията опасението си, че използването на торент сайтове може да означава споделяне на пиратски произведения с други хора, което „може да не е законно“.

Откъс от разговор между двама служители на Meta, разкрит в съдебните документи. Илюстрация: Washington Post; съдебни документи, получени от The Post.

Имейлът от декември 2023 г., включен в съдебните документи, ясно показва, че използването на LibGen е било одобрено, очевидно от Зукърбърг, посочен с инициалите си.

„След предходна ескалация до MZ, GenAI получи одобрение да използва LibGen за Llama 3... при редица договорени мерки за ограничаване на риска“, се казва в него, след което са изброени правните и политическите рискове, свързани с използването на тези данни.

„Ако в медиите се появят публикации, според които сме използвали набор от данни, за който знаем, че е пиратски, като LibGen, това може да отслаби позицията ни при преговорите с регулаторните органи по тези въпроси“, продължава имейлът.

До април 2024 г. вътрешната кореспонденция показва, че компанията вече се е насочила към изтегляне на LibGen и други „библиотеки в сянка“.

Разговори в чат показват как един служител попитал друг защо използват сървъри, наети от Amazon, за торентване, вместо сървъри, собственост на Facebook.

Отговорът бил:

„За да избегнем риска дейността да бъде проследена обратно до компанията.“

В съдебен документ от миналия месец адвокатите на Meta написаха, че компанията „отрича да е разпространявала произведенията на ищците, когато е изтегляла данни за обучение... чрез торенти“.

В отделно дело, заведено първоначално през 2023 г., автори на книги обвиняват OpenAI и Microsoft, че също са нарушили закона за авторското право в стремежа си да се сдобият с книги за обучение на ИИ.

OpenAI, където Ман и главният изпълнителен директор на Anthropic Дарио Амодей са работили, преди да съосноват стартъпа, признава, че е изтегляла LibGen, но е заявила пред съда, че е изтрила файловете преди пускането на ChatGPT.

„OpenAI даде стартовия изстрел, който доведе до необузданото пиратство от страна на компаниите за ИИ и до разграбването на цялото творческо наследство на човечеството“, заяви Джъстин А. Нелсън, адвокат от Susman Godfrey LLP, който представлява автори на книги както по делото срещу OpenAI, така и по това срещу Anthropic.

OpenAI отказа коментар за тази статия.

По-рано този месец две големи издателства поискаха от съд да им позволи да се присъединят към група писатели и илюстратори в дело за авторски права срещу Google, първоначално заведено през 2023 г.

Гримелман, професорът по право в Cornell Tech, заяви, че компаниите за ИИ „сами са се убедили в една заблуда“ по отношение на използването на защитени с авторско право данни.

Пробивите, довели до ChatGPT и сходните инструменти, започнали в академичните изследвания, където използването на защитени с авторско право материали за обучение е широко прието, каза той, но изследователите продължили тази практика и след като моделите с ИИ били комерсиализирани.

„Докато напрежението стана очевидно, те вече бяха направили огромни инвестиции във включването на защитени с авторско право данни в своите процеси и бяха заключени в бърза надпревара с огромен залог за пускането на все по-нови и по-добри модели“, каза Гримелман.

Решението на Anthropic да започне да придобива и сканира физически книги, вместо да изтегля „библиотеки в сянка“, „се оказа разумен ход“, добави той.

„Това е добър пример за компанията, която възприема по-сдържан подход и постига съответствие със закона.“

Източник: https://www.washingtonpost.com/technology/2026/01/27/anthropic-ai-scan-destroy-books/

CHF CHF 1 2.10463
GBP GBP 1 2.24498
RON RON 10 3.83729
TRY TRY 100 3.87564
USD USD 1 1.66355