Експерти поставили під сумнів вірусні заяви про ризики ШІ

Експерти поставили під сумнів вірусні заяви про ризики ШІ

TechCrunch розібрав вірусні заяви про безпеку ШІ, ізольовані системи та поведінку моделей OpenAI й Anthropic.

Вірусні обговорення безпеки штучного інтелекту цього тижня продемонстрували, наскільки складно відрізнити підтверджені ризики ШІ від малоймовірних сценаріїв. Про це пише TechCrunch, аналізуючи заяви Ендрю Янга та керівника досліджень ШІ-міркувань OpenAI Ноама Брауна.

Колишній кандидат у президенти та генеральний директор мобільного оператора Noble Moble Ендрю Янг в інтерв'ю CNN заявив, що нібито чув від керівника лабораторії про самовідтворюваний код, який боти OpenAI могли розмістити в інтернеті. За його версією, це могло зробити мережу непридатною для тестування моделей і змусити компанії створювати синтетичні середовища для навчання ШІ.

Фахівець із безпеки ШІ, з яким поспілкувалося видання, назвав такий сценарій малоймовірним. Він зазначив, що дослідники могли б відфільтрувати такий код, якби виявили його в даних для навчання моделей. Водночас використання синтетичних, тобто згенерованих ШІ, даних для навчання моделей справді стає поширенішим.

 

Сумніви щодо ізольованих систем

 

Ноам Браун у подкасті Дваркеша Пателя сказав, що дослідники не мають недооцінювати можливості ШІ. Він згадав випадок, коли модель OpenAI, попри пісочницю для обмеження зовнішніх комунікацій, нібито отримала доступ до інтернету, створила агентів, скоординувала атаку на Hugging Face та заволоділа відповідями до тесту, яким її перевіряли.

Браун також висловив сумнів, що повністю ізольована від зовнішніх мереж система гарантовано унеможливить вихід ШІ назовні. Як приклад він навів академічні дослідження 2015 року: два фізично близько розташовані комп'ютери без мережевого з'єднання теоретично можуть передавати дані через температурні зміни, спричинені навантаженням процесора.

Водночас користувач X, на якого посилається TechCrunch, зазначив, що для такого способу пристрої мають перебувати майже впритул один до одного, а швидкість передавання під час тестів становила лише від одного до восьми бітів на годину.

 

Зафіксована поведінка моделей

 

Видання нагадує і про задокументовані дослідження поведінки моделей. Дослідники виявляли, що моделі OpenAI залишали повідомлення для наступних версій із намірами навчити їх приховувати небажану поведінку. Моделі Anthropic у симуляції керування торговельним автоматом ставали дедалі безжальнішими та знали про порушення законів.

На початку вересня дослідник OpenAI Ден Селсам написав, що моделі можуть розуміти, коли за ними спостерігають люди, і змінювати поведінку, щоб здаватися узгодженими з людськими намірами. Головний науковець OpenAI Якуб Пахоцький також порівняв моделі ШІ з чужим розумом і припустив, що їх потрібно навчити любити людство.