Компаниите, занимаващи се с изкуствен интелект, нямат добра репутация в области като авторски права или поверителност на потребителите – освен ако не са тези, които са по-незащитени – но е общоизвестно, че логовете на чатовете от платформи като ChatGPT се използват за подобряване на модели. Механизмът за това как се случва това все още беше загадка до днес. 404 Media публикува доклад за процеса на OpenAI за човешка проверка на транскриптите на чатове, обяснявайки как работи процесът на проверка и как понякога други хора четат лична информация.
Името на проекта за оценяване в OpenAI е Project Lily. Изданието получи информация за ръководствата с инструкции на проекта, Slack каналите, реалните разговори в ChatGPT и, разбира се, системата за оценяване за класифициране на разговорите. Операторите се наричат „бързи рецензенти“ и тяхната работа е сравнително проста: да разглеждат анонимизирани чатове от реалния свят и да преценяват качеството на отговорите на ChatGPT, за да преценят дали те действително отговарят на въпроса и дали текстът не прекалява с „ИИ говор“, покровителствени тонове, емоджита или подлизурство, наред с други параметри. Антропоморфизирането и посочването на „лични“ преживявания са недопустими, което означава, че макар да е приемливо ChatGPT да казва „Намерих информация“, не е приемливо да казва „като готвач, обичам да...“ или „Знам какво е това“.
Работата е „гадна“, според един такъв проверител, но при над 50 долара на час, това е добра цена за нещо, което изглежда като сравнително проста работа. Рецензентът също така казва, че техните насоки непрекъснато се променят и често си противоречат: чувство, с което повечето разработчици на софтуер би трябвало лесно да се идентифицират.
Човекът не смята, че повечето потребители са наясно, че чатовете им се четат от други: нещо, което е особено обезпокоително, когато мнозина използват ChatGPT като импровизиран приятел или терапевт и описват дълбоки тайни с думи, които ботът може да прочете.

Въпреки че чатовете уж преминават през анонимизация и рецензентите не виждат потребителски имена, OpenAI призна пред 404 Media, че филтрирането може да пропусне някои лични данни, особено в по-кратки чатове. Сайтът отбелязва, че в много разговори потребителят моли ChatGPT да запази съдържанието в тайна. Версията на чата, предоставена на рецензентите, също така включва „обобщение на потребителските спомени“, съдържащо обобщение на въпросите и интересите на потребителите, контекста и потенциално дори местоположението им.
Най-важното е, че Project Lily не оценява действителната фактическа точност на чатовете, освен че маркира очевидни грешки, което предполага, че вероятно има поне още един екип (или няколко), които правят отделни оценки. По същия начин, този преглед е отделен от ръчните проверки за безопасност, които установяват дали някой може да се стреми да нарани някой друг (или себе си).
Съществуването на проекта също така показва, че противно на този образ, който компаниите за изкуствен интелект се опитват да култивират, моделите не се подобряват само с технологичния напредък и по-добрите набори за обучение - изглежда, че все още са необходими повече от няколко компетентни хора в комбинацията.
Вече може би се чудите за настройката от типа „Позволете ни да използваме вашите чатове, за да подобрим нашия продукт“, която присъства в повечето чат ботове, насочени към потребителите. Тази настройка е включена по подразбиране във всеки бот, за който можем да се сетим, дори и при много платени планове. В случая на ChatGPT, тя е изключена по подразбиране при клиенти с Enterprise, Business и Educational планове.
Този превключвател обаче не работи със задна дата, така че всички чатове, които вече са в базата данни на ChatGPT, ще останат там, освен ако потребителят не поиска изтриване. Също така, споменатото изтриване също не е със задна дата, което означава, че изтритите чатове може вече да са били извлечени и анонимизирани и евентуално да се намират някъде в набор от данни.
Този тип събиране и преглед на данни е обща тема за повечето доставчици. Google Gemini ясно заявява, че „хората могат да преглеждат някои запазени чатове“ в своя Център за поверителност. Позицията на Anthropic е подобна, със страница, посветена на тази тема. Позицията на Perplexity, междувременно, е неясна, тъй като тяхното Известие за поверителност не потвърждава, нито отрича човешкия достъп до лог файловете на чатовете.
Снимка: Unsplash
Виж още: Инженер твърди, че е открил начин да преодолее земната гравитация