Според скорошни разкрития компаниите за изкуствен интелект изкупуват милиони книги, някои от които са редки, и ги използват за обучение на модели за изкуствен интелект, като често унищожават книгите в този процес. Сега разполагаме с повече подробности за това как протича този процес, благодарение на разследване на 404 Media. Медията постави проследяващо устройство в една рядка книга, която беше част от голяма поръчка от 1000 книги – и тя се озова в склад на Amazon в Лас Вегас.

Служители, които разговаряха с 404 Media, споделиха, че прекарват времето си в обекта (наречен VGT3), като отрязват гръбчетата на книгите и ги подават към скенер. Според информацията VGT3 е част от друг, по-голям обект в Лас Вегас, наречен LAS8. Целта му според служителите, които разговаряха с 404 Media, е единствено да се отрязват гръбчетата на книгите и да се сканират. „Всичко, което правим, е да сканираме книги“, каза един от служителите пред медията.

Ако е имало някакви съмнения относно предназначението на обекта, логото с VGT3 показва динозавър, който държи книга и изглежда, сякаш е на път да я разкъса и да отхапе от нея.

Разследването започна през юли, когато 404 попита книжарница дали магазинът може да постави Apple AirTag в книга от пратка от 1000 книги. Пратка с такъв обем е необичайна, макар че според информациите подобни пратки стават все по-чести в ерата на изкуствения интелект. Продажбите на книги бележат ръст и мнозина подозират, че това не се дължи на увеличаване на читателската аудитория, а на обучението на авангардни модели на изкуствен интелект. Поръчката беше подадена чрез Biblio – онлайн пазар, който твърди, че е най-големият независим пазар за книги в света.

Често тези големи поръчки съдържат разнородна смесица от различни книги. Независим книгопродавец в Ирландия например получи поръчка за 5000 книги, за които подозираше, че са предназначени за обучение на изкуствен интелект. „Някои бяха висококачествена нехудожествена литература, като A History of Connemara, а следващата можеше да бъде The Eddie Hobbs Guide to your SSIA, каза тогава Томас Кени от книжарница Kennys Bookshop. 404 Media твърди, че от служителите на VGT3 се изисква да сканират ISBN (баркода) на всяка книга, което придава достоверност на теорията, че компаниите за изкуствен интелект преминават през списък с всяка книга, която някога е била публикувана.

Или поне всяка книга с ISBN. Един търговец на книги сподели пред 404 Media, че тези големи поръчки „никога“ не включват редки книги, които нямат ISBN.

По-рано тази година съдебни документи разкриха т.нар. Project Panama на Anthropic, който стартира през 2024 г. Документите, част от тези съдебни материали, ясно посочват целта на проекта: Project Panama е нашият опит да сканираме по разрушителен начин всички книги в света“, се казва във вътрешен документ за планиране. Съдия постанови, че Anthropic има право да използва книги за обучение на своите модели за изкуствен интелект. Въпреки това компанията беше глобена с 1.5 милиарда долара за съхраняването на 7 милиона пиратски книги в централна библиотека. В съдебен процес срещу Meta през 2025 г. беше разкрито, че компанията е пиратствала близо 82 TB книги.

Масовото сканиране на книги не е нищо ново. През 2005 г. Google постави началото на проекта Google Books, като сканира заглавия, чиито авторски права са изтекли, от библиотека в университетски кампус с помощта на специализирани скенери. След това книгите бяха върнати. Предполага се, че Google е използвал някакъв вид V-образен скенер, който разгръща книгата по естествен начин, за да не се повредят гръбът и подвързията ѝ.

В случая с VGT3 404 съобщава, че служителите са отрязали гърба на книгата преди сканирането, вероятно за да могат страниците да се поставят плоски в индустриален скенер. Неутолимият глад за данни в авангардните модели на изкуствения интелект изглежда напредва с по-бързи темпове, отколкото ранните усилия на Google за дигитализиране на книги.

Снимка: Unsplash/404 Media

Виж още: iPhone 20 Pro: преработеният модел на юбилейния iPhone не е отменен, но ще бъде различен

 

 

 

Още от Tech