Компании, занимающиеся искусственным интеллектом, систематически скупают печатные книги на блошиных рынках, срезают корешки для высокоскоростного сканирования, а затем уничтожают оригиналы. Причина в том, что интернет переполнен текстами, сгенерированными нейросетями, и старые книги — последний крупный источник «чистых» человеческих знаний. Обучение на синтетических данных ведёт к «краху модели» — качество алгоритмов неумолимо падает, как при копировании копии. К тому же многие авторы намеренно искажают веб-контент, чтобы нарушить работу парсеров. Книги же, изданные до 2022 года, защищены от этого: они отредактированы людьми, прошли традиционную публикацию и существуют офлайн.
Процесс поставлен на поток. Покупатели устанавливают автоматические фильтры на платформах вроде Alibris, скупая всё по определённым ISBN. Например, Anthropic через проект Panama потратила десятки миллионов долларов на сканирование книг для обучения Claude, при этом книготорговцы идентифицировали таких клиентов по аномальным объёмам и полному безразличию к ценам. При этом покупка, сканирование и уничтожение физического экземпляра с сохранением цифровой копии для обучения ИИ подпадает под добросовестное использование, поскольку цифровая версия «заменяет» физическую и не распространяется как товар.
Впрочем, есть и альтернативный путь: Гарвардский университет в партнёрстве с Google и Microsoft выпустил в открытый доступ почти миллион оцифрованных книг без их уничтожения. Однако не все лаборатории выбирают этот более этичный вариант. В результате редкие издания — особенно на иностранных языках — после однократного сканирования исчезают из физического мира. Вопрос о том, кто контролирует текстовое наследие человечества, остаётся открытым.
Аудиокниги и видео никогда не заменят бумажных книг!
