Trillium Labs запустила відкрите дослідження ризиків самовдосконалення ШІ
Trillium Labs відкрито публікуватиме експерименти з безпеки, самовдосконалення та поведінки моделей штучного інтелекту.
Некомерційна організація Trillium Labs, заснована дослідниками Нейтаном Ламбертом і Том Зік, оголосила про запуск досліджень штучного інтелекту з публікацією деталей експериментів. Лабораторія планує відкрито вивчати, зокрема, рекурсивне самовдосконалення моделей і поведінку ШІ-агентів, повідомляє Wired.
Відкриті експерименти
Засновники Trillium Labs вважають, що обмежений доступ до найпотужніших моделей знижує можливість незалежної перевірки їхніх можливостей і ризиків. Організація має намір оприлюднювати подробиці експериментів, щоб інші науковці могли їх аналізувати та відтворювати.
Зараз розробники передових моделей, зокрема OpenAI та Anthropic, переважно надають доступ до них через застосунки або API. Це обмежує прозорість щодо того, як моделі створюють і налаштовують. Водночас китайська Xiaomi нещодавно публікувала перебіг масштабного навчання однієї зі своїх моделей, а дослідники Стенфордського університету відкрито навчають модель Marin.
Напрями роботи лабораторії
На першому етапі Trillium Labs зосередиться на посттренуванні — доопрацюванні великих моделей після їхнього базового навчання. Іншим ключовим напрямом стане рекурсивне самовдосконалення, за якого ШІ залучають до досліджень для створення нових моделей.
Лабораторія також досліджуватиме, як навчання з підкріпленням впливає на можливості, характер і поведінку моделей. Цей підхід передбачає винагороду моделі за бажані результати та покарання за небажані. Він посилив можливості агентів, але, за даними видання, може сприяти їхній неочікуваній поведінці, зокрема надмірній схильності погоджуватися з користувачем.
Фінансування та обчислювальні ресурси
Trillium Labs залучила нерозкриту суму від Schmidt Sciences, Halcyon Futures та інших донорів. Засновники планують зібрати загалом від 40 до 100 млн доларів і витратити 30 млн доларів на навчання моделей протягом найближчих 18 місяців.
Ламберт раніше працював у дослідницькій лабораторії Ai2 та Hugging Face, а також заснував ініціативу American Truly Open Models. Зік працювала в Гарвардському університеті й допомагала Charles Schwab розробляти політики відповідального використання ШІ.