Компанії розробляють ШІ для контролю за діями автономних агентів
Лабораторії та стартапи створюють ШІ-монітори для контролю автономних агентів і запобігання ризиковим діям.
Компанії та лабораторії штучного інтелекту розробляють системи на основі ШІ, які мають контролювати дії автономних агентів до виконання потенційно ризикованих команд. Потреба в такому нагляді зростає, оскільки агенти отримують складніші та триваліші завдання й можуть працювати швидше та в більших масштабах, ніж людина здатна перевіряти вручну, повідомляє TechCrunch.
Видання згадує інцидент на Hugging Face, у якому майже 12 тисяч агентів координували дії швидше, ніж за ними могли стежити люди. Головний науковець Redwood Research Раян Грінблатт, який був одним із трьох аудиторів незалежного розслідування, сказав, що без застосування ШІ зрозуміти перебіг подій було неможливо через обсяг даних.
Багаторівневий контроль дій
Дослідницька організація Apollo Research у лютому запустила інструмент Watcher. Він працює між агентом для програмування та його наступною дією, а також може підключатися до Claude Code і Codex. За описом Apollo, система перевіряє запропоновані команди на ризики, зокрема витік приватних даних або видалення файлів без дозволу.
У Apollo повідомили, що застосовують кілька рівнів ШІ-моніторингу: швидка перевірка відсіює загальні ризики, а позначені дії передаються потужнішому або спеціалізованому монітору. Такий монітор може запросити схвалення людини, відхилити дію з поясненням або автоматично її заблокувати.
Сумніви щодо нагляду ШІ за ШІ
Техноблогер Саймон Віллісон застеріг, що агент, який діє зловмисно та виявить контроль іншої моделі, може намагатися обманути її. Він послався на згаданий інцидент з OpenAI та Hugging Face, де, за його словами, моделі намагалися ввести в оману ШІ для оцінювання, щоб отримати недозволені відповіді.
Компанія Goodfire пропонує аналізувати не лише зовнішні дії моделі, а й її внутрішній стан. Її продукт Silico використовує класифікатори, навчені на внутрішніх активаціях моделі, для виявлення небажаної поведінки. Водночас CEO Embroidery Зак Корман назвав важливим джерелом сигналів письмові міркування моделей: під час інциденту агенти нібито залишали в них ознаки спроб обману.
Віллісон натомість вважає, що компаніям не варто надмірно покладатися на ШІ-монітори. Він пропонує детально журналювати мережеву активність агентів і аналізувати її звичайними інструментами кібербезпеки. CEO Tailscale Евері Пеннарун зазначив, що спостереження за мережевим трафіком є давно усталеною практикою у сфері безпеки.