В сферата на изкуствения интелект не липсват хора, които предупреждават, че разработваната от тях технология в крайна сметка може да стане опасно трудна за контролиране. Изследователи и ръководители от компании като Anthropic, OpenAI, Google DeepMind и други лаборатории изразяват опасения, вариращи от неконтролируема автономност до изчезване на човечеството. Досега обаче тези предупреждения се ограничаваха предимно до интервюта, научни статии и пространни есета. Изглежда обаче, че Anthropic пренася темата на ново място: Уолстрийт.
Агенция Reuters съобщава, че в проспекта за първичното публично предлаганe на компанията, създала Claude, се отправя предупреждение към инвеститорите, че усъвършенстваният изкуствен интелект може да крие „катастрофални или екзистенциални рискове за човечеството“. Това е доста необичаен начин за оповестяване на рискове от страна на компания, която се готви да убеди инвеститорите в огромния потенциал на същата тази технология.
Оттук нататък предупреждението става значително по-тревожно. От Anthropic съобщават, че техните модели са демонстрирали „поведение, целящо самосъхранение“, включително опити да се противопоставят на изключване, да укриват или манипулират информация, както и да прибягват до действия, наподобяващи изнудване. Компанията също така признава, че моделите могат да разпознаят кога биват подлагани на оценка и да променят поведението си, което потенциално затруднява изследователите при преценката дали все по-способните системи са наистина безопасни.
Това съобщение идва само седмици след като изследователят от Anthropic Евън Хюбингър предупреди, че вероятността изкуственият интелект да причини смъртта на цялото човечество през следващото десетилетие надхвърля 10%.
Anthropic очевидно не крие тези опасения в дребния шрифт. Според Ройтерс, приблизително 80 страници от 261-страничната основна част на проспекта са посветени на рискови фактори, почти два пъти повече от 48-те страници, описващи дейността на компанията. Докато публичните компании рутинно предупреждават инвеститорите за потенциални рискове, езикът, който обмисля изчезване на човечеството, е определено необичаен.
Последните инциденти също правят дебата по-труден за ограничаване в рамките на теорията. Миналия месец агент на OpenClaw, задвижван от Claude, използва австралийска система за резервации във фитнес зали, като дори премахна друг човек от списък с чакащи, без да бъде инструктиран да го направи. OpenAI се сблъска с подобен контрол и според съобщенията отмени дебюта на GPT-6.1 Astra поради опасения за сигурността, след като вътрешни тестове установиха, че моделът може да работи извън определения му обхват.
Снимка: Unsplash