Искусственный интеллект добрался до книжных полок. ИИ-компании скупают старые издания тысячами и даже миллионами экземпляров, чтобы в конечном итоге их уничтожить. Это заговор против культурного наследия человечества или на то есть более прагматичные причины? Скорее второе, но оттого факт не менее разочаровывает и настораживает. Рассказываем, почему ИИ-компании ополчились против печатных книг.
«Проект „Панама“ — это наша инициатива по деструктивному сканированию всех книг в мире. [Но] мы не хотим, чтобы стало известно, что мы работаем над этим», — так описывался план Anthropic во внутренних документах компании, которые рассекретили благодаря судебным разбирательствам в 2025 году.
Тогда на разработчика популярного чат-бота Claude подали в суд за нарушение авторских прав, обвинив компанию в том, что она использовала сотни тысяч электронных книг, скачанных с пиратских сайтов, для обучения своих ИИ-моделей. Так для компании было проще и дешевле, ведь они посчитали, что действовать легально — это «юридическая, практическая и деловая волокита», как выразился соучредитель и генеральный директор Anthropic.
Компания решила урегулировать спор, выплатив компенсацию авторам в размере $1,5 миллиарда, но при этом не признала свою вину. По данным The Washington Post, это соглашение стало первым в своем роде в эпоху искусственного интеллекта и крупнейшим в истории возмещением убытков в связи с нарушением авторских прав.
Обжегшись на цифровых книгах, Anthropic обратила свой взор на бумажную литературу, ведь нужно чем-то кормить своих детищ, чтобы они росли и умнели. Теперь разработчик Claude закупает миллионы подержанных книг через посредников, оцифровывает их, а затем уничтожает. Но так делает не только Anthropic, но и другие ведущие компании в области ИИ, как сообщают журналисты.
Языковые модели обучаются на огромных массивах текстов: книгах, статьях, сайтах и других источниках. Анализируя миллиарды примеров, ИИ-модели запоминают закономерности и учатся предугадывать следующее слово в тексте, постепенно приобретая способность понимать запросы и генерировать качественные ответы.
Но для обучения подходят не любые тексты, они должны быть высокого качества, чтобы процесс был эффективным. Иронично, но проблему компании, разрабатывающие искусственный интеллект, создали себе сами. Дело в том, что в интернет наводнился некачественным контентом, созданным, в том числе, их же ИИ-сервисами. Как поясняет Tom’s Hardware, такой тип данных загрязняет базы и становится контрпродуктивным для обучения ИИ.
Поэтому разработчики нейросетей обратились к чистому и оригинальному источнику знаний — печатной литературе. В особенности их интересуют книги, выпущенные до 2022, ведь в них нет сгенерированного контента. Anthropic надеялась, что «захватывающие художественные повествования» книг помогут научиться Claude «писать так же точно и убедительно, как и другие авторы, а не имитировать низкокачественный интернет-сленг», следует из судебных материалов.
Скорее всего, в описании проекта «Панама» Anthropic под «деструктивным сканированием» подразумевала не намерение уничтожить книги после оцифровки, а определенный метод сканирования, который по-английски называется destructive scanning.
При деструктивном сканировании специальная машина отрезает корешок книги, удаляет обложку и разделяет ее на отдельные листы. Затем страницы автоматически подаются на высокопроизводительный сканер, способный быстро обрабатывать большие объемы данных.
Этот метод не придумали не бездушные ИИ-компании, он существовал уже давно и считается одним из самых эффективных с точки зрения скорости, точности и экономичности. Разделенные страницы не изгибаются по направлению к корешку и не создают теней, поэтому качество полученной оцифровки получается высоким. Но книгу, обработанную таким методом, уже невозможно восстановить, поэтому после сканирования она просто уничтожается.
Для этих целей разработчики ИИ скупают книги в огромных масштабах. Точные цифры закупок не разглашаются, но известно, что Anthropic искала исполнителя для преобразования от 500 тысяч до двух миллионов книг за шестимесячный период.
Некоторые крупные книготорговцы увидели в этом способ заработать. Издание 404 Media рассказывало, что сервис ISBNdb, который называет себя «крупнейшей в мире книжной базой данных», предлагал оптовые поставки ИИ-компаниям в количестве от 1000 до миллиона экземпляров. На сайте ISBNdb появилась публикация, в которой утверждалось, что «лучшие в мире данные для обучения ИИ лежат на полке», добавляя, что «эти печатные тексты не испорчены ИИ, который уже так сильно загрязнил интернет».
В качестве дополнительного бонуса ISBNdb обещала заказчикам держать их покупки в секрете. «Проблема имиджа реальна. Заголовок „Компания, занимающаяся искусственным интеллектом, уничтожила два миллиона книг“ не вызовет сочувствия», — говорилось в публикации книжного сервиса. После того, как СМИ обратили на это внимание, публикации с сайта ISBNdb исчезли.
Это, конечно, не единственный ресурс получения бумажной литературы для разработчиков ИИ — компании делают массовые заказы у продавцов книг по всему миру. Об этом говорили торговцы антикварной литературой из Германии, Швейцарии, Австралии и других стран. Владельцы книжных лавок рассказывали о необычных заявках, в которых были, казалось, совершенно случайные экземпляры: нишевые издания, бульварные романы, а иногда и книги, которым уже несколько десятилетий. Некоторые продавцы настолько были удивлены подобным заказами, что посчитали их спамом или фишингом.
Согласно утекшим документам, только компания Anthropic таким образом закупила миллионы книг, часто партиями в сотни тысяч экземпляров, на что потратила десятки миллионов долларов.
В разбирательстве с Anthropic поднимался вопрос правомерности деструктивного сканирования. Как пишет The Guardian, суд постановил, что это не нарушает законодательство США, поскольку в данном случае речь идет о «преобразующем использовании» (transformative use). Один из судей сравнил процесс обучения ИИ с тем, как учителя обучают школьников хорошо писать, а в другом документе говорилось, что Anthropic не просто копирует и уничтожает книги, а использует их, чтобы создать нечто новое.
Таким образом, по мнению американского суда, то, как именно добываются книги для сканирования, вызывает вопросы с точки зрения авторских прав, но сама переработка с последующим уничтожением экземпляров совершенно законна.
Не все согласны с такой оценкой. Например, Эд Ньютон-Рекс, бывший руководитель компании, занимающейся искусственным интеллектом, а ныне возглавляющий некоммерческую организацию, защищающую права креаторов, заявил, что эти разоблачения подчеркивают: компании, работающие в сфере ИИ, в долгу перед создателями гораздо больше, чем они выплатили до сих пор.
«Нам срочно необходима перезагрузка всей индустрии ИИ, чтобы творческие люди начали получать справедливую оплату за свой жизненно важный вклад», — сказал он, добавив, что таким образом ИИ-компании поглощают человеческую культуру.
Один торговец книгами рассказал, что в апреле 2026-го его продажи внезапно выросли с не более чем 20 книг в неделю до сотен, и он почти уверен, что покупателями являются лаборатории искусственного интеллекта, отметив случайный отбор книг.
«Лично у меня смешанные чувства по этому поводу. Это выгодно мне как в финансовом плане, так и в плане реализации старых запасов, которые в противном случае вряд ли бы продались. С другой стороны, мне не нравится, как эти книги используются в дальнейшем, и мне не нравится, что редкие экземпляры отправляются на переработку», — поделился он эмоциями.
Любопытно, что представители некоторых ИИ-компаний присоединились к критике своих коллег. Так, например, основатель Factory AI заявил: «В механизированном уничтожении таких личных человеческих вещей есть что-то особенно мизантропическое. История редко благосклонно относится к тем, кто уничтожает книги, независимо от причин».
Не обошлось и без главы компании SpaceXAI, образованной из SpaceX и xAI, Илона Маска. Миллиардер ответил в своей соцсети X на пост с критикой деструктивного сканирования книг и заявил, что попросил свою команду разработчиков ИИ сохранить все редкие книги в библиотеке и отсканировать их традиционным способом, не отрезая корешки. Верим?
Нравится читать Onlíner? Добавьте наши новости в «Основные источники» Google
Есть о чем рассказать? Пишите в наш телеграм-бот. Это анонимно и быстро
Перепечатка текста и фотографий Onlíner без разрешения редакции запрещена. ga@onliner.by