подписаться
logo
рассказываем
logo
рассказываем
рассказываем

Мир по Борхесу. Книги как корм для ИИ, норм? Пираты уже почти построили цифровую библиотеку Борхеса. Теперь ту же работу — только с другими целями — делают создатели искусственного интеллекта.

Когда-то Борхес придумал библиотеку всех возможных книг, пираты десятилетиями пытались собрать цифровую библиотеку всех существующих книг, а теперь выясняется, что этот же книжный массив нужен тем, кто строит искусственный интеллект.

Artiiicle - Истории

Хорхе Луис Борхес придумал библиотеку, в которой содержатся все возможные книги. В его рассказе «Вавилонская библиотека» это бесконечное пространство с шестнадцатеричными залами, где среди почти бесчисленного количества бессмысленных текстов где-то существует и тот самый, единственно важный. Библиотека Борхеса была литературной фантазией, но спустя несколько десятилетий человечество неожиданно получило технологии, позволяющие приблизиться к ней. Правда, строить такую библиотеку начали не библиотекари и не издатели, а пираты.

Сегодня существуют цифровые архивы, в которых собраны десятки миллионов книг и научных публикаций. Один из самых известных — Z-Library, крупнейшая из так называемых теневых библиотек. Её пользователи получают доступ к книгам, которые в обычном мире продаются в магазинах, хранятся за платной подпиской или вообще давно исчезли из продажи. Для издателей это огромная пиратская машина, лишающая авторов и правообладателей доходов. Для сторонников проекта — попытка сделать человеческое знание доступным каждому, независимо от страны и толщины кошелька. История Z-Library особенно интересна потому, что она выросла из гораздо более старой идеи: если цифровая копия книги уже существует, почему нельзя дать её прочитать всем желающим?


Artiiicle - Истории

Как построить библиотеку из файлов

Теневые библиотеки появились задолго до Z-Library. В интернете давно существуют проекты, которые собирают книги и научные статьи, сканируют их, каталогизируют и распространяют без разрешения правообладателей. Самые известные из них — Library Genesis, Sci-Hub и Z-Library. У каждого проекта своя история, устройство и аудитория, но все они используют одно фундаментальное свойство цифровой информации: скопировать файл можно бесконечное количество раз, причём исходный экземпляр при этом никуда не исчезнет.

Для книжной индустрии это стало проблемой почти сразу после появления массового интернета. Физическая книга дефицитна по определению: если у вас один экземпляр, его одновременно не могут читать сто человек. Цифровая книга дефицитна только потому, что кто-то решил ограничить к ней доступ. Именно на этом противоречии и строится вся современная экономика электронных книг: издатели продают не столько сам файл, сколько право пользоваться им на определённых условиях.

Теневые библиотеки предлагают противоположную модель. Они исходят из того, что книгу достаточно один раз оцифровать, после чего её распространение практически ничего не стоит. Если человек в Бразилии, России или Индии не может позволить себе иностранное научное издание, цифровая библиотека может дать ему доступ к той же самой книге, которую студент из Гарварда получил через университетскую подписку.

В этом есть и практическая, и идеологическая сторона. Исследователь цифровой культуры Балаж Бодо обращает внимание на особую роль постсоветского пространства в истории подобных проектов. Здесь существовала культура самиздата, подпольного распространения литературы и обмена копиями, а сама книга традиционно воспринималась как важная часть образования и общественной жизни. После распада СССР к этому добавилась простая экономическая реальность: огромное количество западной литературы и научных публикаций было либо трудно достать, либо практически невозможно купить.

Интернет превратил старую культуру обмена книгами в глобальную инфраструктуру. Машинописные копии сменились сканами, бумажные архивы — гигантскими цифровыми хранилищами, а обмен книгами между несколькими знакомыми превратился в систему, которой пользуются миллионы людей.

Artiiicle - Истории

Одним из самых масштабных воплощений этой идеии стал проект Z-Library. К середине 2020-х на его серверах находились десятки миллионов книг и научных текстов. Проект развивался как полноценная технологическая организация: ему требовались разработчики, дизайнеры, техническая поддержка, серверная инфраструктура и деньги на хранение огромного массива данных.

Американские власти всерьез взялись за Z-Library в 2022 году. Были изъяты связанные с проектом домены, а в Аргентине арестовали Антона Напольского и Валерию Ермакову, которых американское следствие называло операторами сервиса. Им предъявили обвинения, связанные с нарушением авторских прав, мошенничеством и отмыванием денег. Однако уничтожить библиотеку оказалось значительно сложнее, чем конфисковать несколько доменных имён. Проект быстро появился по новым адресам, а его пользователи никуда не исчезли. Книги, однажды попавшие в цифровой архив, вообще трудно заставить исчезнуть: копии можно хранить на других серверах, передавать через другие сети и снова загружать после очередной блокировки.

При этом Z-Library не была исключительно альтруистическим проектом. По данным американского расследования, сервис получал значительные суммы от пользователей, в том числе через пожертвования и платные функции. В отдельные периоды речь шла о десятках тысяч долларов в месяц, а во время специальных кампаний по сбору средств поступления могли быть существенно выше. Это добавляет истории неприятный нюанс. Теневую библиотеку можно считать частью движения за свободный доступ к знаниям, но одновременно она остаётся бизнесом, построенным на распространении контента, за который кто-то другой заплатил, написал, отредактировал и издал.

Поэтому спор о таких проектах нельзя свести к простой формуле «пираты хорошие» или «пираты плохие». Здесь сталкиваются две совершенно разные модели отношения к книге. В первой книга является интеллектуальной собственностью и товаром, который должен приносить доход тем, кто его создал. Во второй цифровая копия книги рассматривается как часть общего информационного пространства, где искусственное ограничение доступа воспринимается как нечто противоестественное.

Artiiicle - Истории

Сначала Google, потом пираты

При этом идея собрать все книги мира принадлежит вовсе не пиратам. Ещё в 1971 году появился проект «Гутенберг» — один из первых проектов цифровой библиотеки. Его участники начали оцифровывать произведения, перешедшие в общественное достояние, и распространять их бесплатно.
Затем за похожую задачу взялся Google. Компания начала массово сканировать книги из библиотек по всему миру и в какой-то момент оцифровала десятки миллионов изданий. Проект Google Books стал предметом многолетних судебных споров с издателями и авторами: компания считала, что создание поискового индекса по книгам и предоставление ограниченных фрагментов соответствует общественным интересам и допустимому использованию произведений, а правообладатели видели в массовом сканировании угрозу своему бизнесу.


На этом фоне Z-Library выглядит не столько исключением, сколько следующим этапом всё той же истории. Сначала книги оцифровывали, чтобы сделать их доступными через поиск. Затем возникли проекты, которые начали собирать цифровые копии уже без разрешения правообладателей. Разница между официальной и теневой библиотекой при этом оставалась принципиальной: первые действовали в рамках договоров и авторского права, вторые — за их пределами. Но обе стороны решали одну и ту же техническую задачу: превратить книжное наследие человечества в цифровой массив. И тут в историю вошёл искусственный интеллект.

Artiiicle - Истории

Зачем ИИ столько книг?

Большие языковые модели обучаются на огромных объёмах текста. Им нужны статьи, сайты, документы, книги и другие материалы, по которым они учатся находить закономерности человеческого языка. Чем разнообразнее корпус, тем больше у модели материала для обучения. Книги в этом смысле особенно ценны. В них есть длинные связные тексты, сложные аргументы, литературные приёмы, научные объяснения, диалоги, исторические сведения и огромное количество примеров того, как люди используют язык. Поэтому неудивительно, что вокруг обучения ИИ возник тот же вопрос, который десятилетиями обсуждался в связи с пиратством: можно ли использовать произведения, защищённые авторским правом, для создания нового технологического продукта? Ответ на него сейчас пытаются найти суды и законодатели. Авторы и издатели утверждают, что компании не должны бесплатно использовать их книги для обучения коммерческих систем. Технологические компании, в свою очередь, настаивают, что анализ произведений для обучения модели принципиально отличается от публикации или продажи самих произведений.
Но здесь возникает почти комический парадокс. Издательская индустрия десятилетиями боролась с пиратскими библиотеками, которые копировали книги и раздавали их бесплатно. А теперь технологическая индустрия заинтересована в том, чтобы получить доступ к максимально большим массивам текстов — в том числе к книгам, которые существуют в таких библиотеках. Пираты хотели построить библиотеку, где человек может найти любую книгу. Создатели ИИ хотят построить систему, которая прочитает огромное количество книг и научится работать с полученными знаниями. Цели разные. Инфраструктура и исходный материал во многом одинаковые.

Artiiicle - Истории

От библиотеки к машине

В итоге история Z-Library уже трансформировалась не столько в историю о пиратстве, сколько о контроле над знаниями. На протяжении столетий библиотека была физическим местом. Кто-то собирал книги, кто-то покупал их, кто-то решал, что именно попадёт на полки, а библиотекари помогали посетителям найти нужный текст. Электронная эпоха постепенно разрушила эту модель. Теперь библиотека может находиться не в здании, а на серверах, а её фонд может быть доступен человеку за тысячи километров.

Следующий шаг оказался ещё радикальнее. Если раньше цифровая библиотека давала человеку доступ к огромному количеству книг, то искусственный интеллект способен использовать те же массивы текстов для создания нового интерфейса к знаниям. Вместо того чтобы искать книгу, открывать нужную страницу и читать десятки источников, пользователь задаёт вопрос машине и получает сформированный ею ответ.

Это не означает, что языковая модель буквально хранит внутри себя копии всех книг, на которых обучалась. Она работает иначе, превращая закономерности из обучающих данных в параметры модели. Но с точки зрения истории доступа к информации переход довольно любопытный: человечество сначала научилось оцифровывать книги, затем — собирать их в гигантские библиотеки, а теперь учится превращать эти библиотеки в обучающие корпуса для машин. Борхес, вероятно, оценил бы эту шутку. В его «Вавилонской библиотеке» существует любой возможный текст, но найти среди бесконечного множества книг нужный практически невозможно. Современные технологии идут в противоположном направлении: они пытаются не просто собрать как можно больше текстов, но и создать инструменты, которые позволят ориентироваться в этом океане информации.
 

Artiiicle - Истории

Кому принадлежит библиотека человечества?

Проблема в том, что собрать книги — это только половина задачи. Вторая половина заключается в том, чтобы решить, кто имеет право ими пользоваться. В случае физической библиотеки ответ относительно прост: есть собственник здания, фонд, правила посещения и законодательство. В цифровом мире всё гораздо запутаннее. Один файл можно скопировать бесконечное количество раз, разместить на десятках серверов и передать миллионам людей практически мгновенно. Отсюда и бесконечная война между правообладателями и пиратскими ресурсами. Одни пытаются контролировать распространение, другие пытаются его сделать неконтролируемым. Каждая новая технология — от сканера до торрент-клиента — только меняет правила этой игры. А теперь к этому всему добавился и искусственный интеллект.

Возможно, через несколько десятилетий сегодняшняя борьба вокруг Z-Library будет выглядеть как ранняя глава гораздо большей истории. Истории о том, как человечество впервые попыталось собрать в одном цифровом пространстве большую часть своей письменной культуры — и одновременно столкнулось с вопросом, что делать с этим богатством дальше. Потому что собрать все книги — уже недостаточно. Нужно ещё решить, кто сможет их читать, кто будет на этом зарабатывать, кто сможет использовать их для обучения машин и, наконец, кому вообще принадлежит накопленное человечеством знание.
Борхес представлял бесконечную библиотеку как фантастический кошмар. Мы же постепенно строим её в реальности — сервер за сервером, скан за сканом, торрент за торрентом. А теперь учим машины читать её вместо нас.