ИИ-компании нашли новый источник данных для обучения своих моделей — обычные бумажные книги. Вместо цифровых копий они всё чаще массово скупают подержанные издания, разрезают их, сканируют страницы и превращают в обучающие наборы данных.
Спрос оказался настолько высоким, что некоторые книжные продавцы начали перестраивать свой бизнес под нужды разработчиков ИИ. Например, крупнейшая база ISBNdb теперь помогает лабораториям закупать партии от тысячи до миллиона книг.
Особую ценность представляют издания, выпущенные до бума генеративного ИИ. Их считают «чистыми» от нейрослопа.

Ранее стало известно, что Anthropic использовала гидравлические резаки, чтобы отделять страницы от переплётов, после чего сканировала их на промышленном оборудовании.
Суд признал такой процесс законным: компания приобретала книги легально, а создание цифровых копий для внутреннего использования было признано «трансформирующим» использованием, подпадающим под принцип добросовестного использования (fair use).
Один из продавцов рассказал, что ещё недавно продавал не больше двух десятков книг в неделю, а теперь регулярно отправляет неизвестным покупателям сотни экземпляров.
По его словам, заказы выглядят случайными, однако все книги объединяет наличие ISBN. Из-за этого он почти не сомневается, что их приобретают именно разработчики ИИ.

Наибольшие опасения вызывают редкие и давно не переиздававшиеся книги. Некоторые продавцы опасаются, что вместе с массовыми тиражами уничтожаются экземпляры, которых в мире сохранилось совсем немного.
В Нидерландвх продавцы антикварных книг также фиксируют необычные оптовые закупки и подозревают, что за ними стоят ИИ-компании. Прямых доказательств нет, поскольку посредники, включая ISBNdb, обещают не раскрывать личности покупателей.


Join the conversation.