Відмови ШІ не гарантують безпеки моделей
Механізми відмови чатботів від небезпечних запитів залишаються імовірнісними та можуть обмежувати законні дослідження.
Системи штучного інтелекту навчають відмовлятися від небезпечних запитів, однак цей механізм не є цілком надійним і може водночас обмежувати легітимну інформацію. Про це йдеться в матеріалі MIT Technology Review, присвяченому практиці так званих відмов у відповідях мовних моделей.
Сучасні чатботи зазвичай не відповідають на запити, пов’язані з насильством, самогубством, створенням небезпечних патогенів чи зловживанням комп’ютерними системами. Компанії навчають моделі розпізнавати такі звернення, винагороджуючи за відмову, а також застосовують додаткові моделі-класифікатори, які перевіряють запити користувачів і відповіді системи.
Імовірнісний механізм
Колишній співробітник OpenAI Стівен Адлер розповів виданню, що ранні моделі могли відповідати практично на будь-які запити. Згодом розробники почали донавчати їх на прикладах небезпечних звернень. Зокрема, у 2022 році OpenAI залучила десятки фахівців із тестування безпеки для перевірки моделі перед запуском ChatGPT. Один із них, дослідник Пол Реттгер, повідомив, що модель тоді погоджувалася створити вербувальний текст для «Аль-Каїди», але після подальшого навчання вже відмовлялася це робити.
Відмова моделі не є результатом зрозумілого морального міркування, а ґрунтується на статистичних закономірностях і внутрішніх активаціях у її параметрах. Дослідник безпеки ШІ Яннес Ельстнер зазначив, що фахівці можуть спостерігати сам факт відмови, проте не мають повного пояснення того, як саме модель ухвалює таке рішення.
Обхід захисту та межі обмежень
За даними матеріалу, захисні механізми можуть не спрацювати, оскільки їхня робота має імовірнісний характер. Психолог Гарвардського університету Раян Макбейн у своїх експериментах з’ясував, що провідні моделі переважно відмовляються відповідати на небезпечні питання про самогубство, але іноді все ж генерують відповідь за повторних однакових запитів.
Розробники також стикаються зі спробами обійти обмеження — так званими джейлбрейками. У матеріалі згадано, що італійські дослідники змогли обійти захист двох десятків поширених моделей, формулюючи запити у віршах. Водночас надмірно суворі відмови можуть заважати науковцям, яким потрібні відомості про віруси або вразливості комп’ютерних систем для досліджень і захисту. Член ради OpenAI та співзасновник Gray Swan Зіко Колтер назвав визначення межі між допустимими й небезпечними запитами великою проблемою.