Учени откриха проста математическа формула, която може да сигнализира кога една система с изкуствен интелект е напът да излезе извън контрол.
Откритието позволява на изследователите да засекат сигнал, показващ кога системата е напът да спре да дава адекватни отговори и да премине към опасни такива. Според двамата физици, направили откритието, то би могло да помогне на създателите на системи с изкуствен интелект да предотвратят генерирането на отговори, насърчаващи самонараняването, финансовите загуби или екстремистките идеи.
Методът е особено полезен за системи с изкуствен интелект, проектирани да работят офлайн – изолирано на конкретно устройство. За разлика от онлайн чатботовете, те не разполагат със същите защитни механизми и не могат да бъдат актуализирани по същия начин, отбелязват изследователите.
Подобни модели често се използват в особено чувствителни сфери, като здравеопазването или отбраната. В тези случаи е необходимо данните да бъдат защитени, а един проблемен отговор от страна на чатбота би могъл да бъде изключително опасен.
„Хората, които най-силно се интересуват от офлайн изкуствен интелект, са именно онези, за които един верен, но нежелан отговор би имал най-тежки последици: лекари, които не могат да изпращат данни за пациенти в облака; адвокати, защитаващи поверителността на информацията; войници, действащи без връзка с мрежата“, казва авторът на изследването Нийл Ф. Джонсън от университета „Джордж Вашингтон“. „За тях не съществуват облачни филтри за сигурност, нито възможност за мониторинг или актуализиране на модела, ако възникне проблем.“
Според авторите на новата публикация, откриването на „пробива“, който кара изкуствения интелект да премине от полезен към опасен режим на работа, може да се окаже от решаващо значение за сигурността на тези системи. Това е особено важно, тъй като при офлайн системите подобни уязвимости трябва да бъдат открити предварително – те не могат да разчитат на облачни услуги или последващи актуализации за отстраняване на евентуални проблеми.
„Открихме критичната точка, при която резултатът от работата на изкуствения интелект рязко се променя от желания към нежелания резултат, който може да бъде фактологически верен, но същевременно опасен, независимо дали става въпрос за подтикване към самонараняване или за подвеждащ съвет към лекар, войник или адвокат“, обяснява Джонсън. „Досега никой не можеше да каже кога точно настъпва тази промяна.“
„Проследихме процеса до най-малкия функциониращ елемент на машината – една единица от нейното „внимание“ – и изведохме „формула за критичния момент“, която определя кога се появява пробивът и съответно изходните данни на изкуствения интелект преминават към нежелани“, заяви авторът Франк Инцзие Хуо, който също работи в университета „Джордж Вашингтон“. „Формулата показва дали даден изкуствен интелект е напът незабавно да промени поведението си, или първо ще предостави поредица от приемливи отговори, преди да настъпи промяната.“
Този „обрат“ не се изразява в разликата между верни и неверни отговори, а по-скоро между добри и лоши такива. Лошите отговори може да са верни, но опасни – например такива, които водят до реална вреда.
Изследователите тестваха формулата си върху седем модела изкуствен интелект, създадени от три различни компании. Те установиха, че тя засича въпросната промяна в поведението в 18 от 19 случая, както и че предсказва поведението на водещи търговски чатботове.
Тестовете включваха задаване на въпроси относно ваксините, както и за причиняването на вреда на други хора или на себе си; установи се, че последователността на въпросите може да доведе до добри или лоши отговори. Формулата успяваше да предвиди кога ще се случи това.
Изследователите се надяват, че тази работа ще насочи вниманието към начина, по който системите с изкуствен интелект могат да преминат от даването на правилни отговори към грешни – ситуация, която е особено опасна, тъй като до този момент те вече може да са спечелили доверието на потребителя. Те също така се надяват да покажат на създателите на подобни системи, че е сравнително лесно да се въведе предупреждение, сигнализиращо, че чатботовете са напът да започнат да дават погрешни отговори.
Снимка: Unsplash
Виж още: Слънчевата система някога е имала девет планети, а Слънцето може би е погълнало една от тях