Goodfire представила внутрішні монітори для контролю ШІ-агентів

Goodfire представила внутрішні монітори для контролю ШІ-агентів

Goodfire запустила внутрішні монітори для ШІ-агентів і заявила про нижчу вартість та високу точність виявлення ризиків.

Стартап Goodfire запустив монітори, які мають відстежувати ризиковану поведінку ШІ-агентів через внутрішні сигнали мовної моделі під час її роботи. Рішення стало доступним клієнтам платформи Baseten, що розгортає та запускає ШІ-моделі для інших компаній. Як повідомляє TechCrunch, система має знизити витрати на контроль моделей порівняно з підходом, за якого окрема ШІ-модель перевіряє весь текст, створений агентом.

 

Як працює система

 

Монітори Goodfire використовують невеликі детектори, або зонди, які на кожному кроці аналізують внутрішні активації моделі. Якщо зонд виявляє потенційно небезпечний сигнал, до перевірки залучають окрему ШІ-модель. Клієнти Baseten можуть обирати категорії ризиків для контролю, зокрема наступальний злам систем, неправомірне використання хімічної та біологічної зброї, а також винагородне шахрайство — ситуації, коли модель знаходить спосіб формально виконати поставлене завдання, не досягаючи його мети.

Компанії також можуть визначати автоматичну реакцію на сигнал: зафіксувати подію в журналі, передати її на перевірку людині або відхилити запит. Технічний директор і співзасновник Goodfire Ден Балсам заявив, що внутрішній моніторинг дає змогу виявляти ознаки можливої небезпечної поведінки до її реалізації.

 

Заявлена вартість і точність

 

За результатами тестів Goodfire на відкритій моделі Kimi K3, моніторинг приблизно 1 500 сесій коштував близько 51 долара. Для порівняння, перевірка кожного кроку дешевшою ШІ-моделлю, за оцінкою компанії, обійшлася б у 233 долари, а використання моделі вищого класу — приблизно у 10 тисяч доларів.

Goodfire стверджує, що її зонди виявили 94% сесій зі шкідливими діями, пов’язаними зі зламом, і спрямували на додаткову перевірку 8,7% нешкідливих сесій. За даними стартапу, одночасний запуск чотирьох зондів збільшив час до початку відповіді моделі менш ніж на 2%.

Компанія орієнтує продукт насамперед на відкриті моделі, чиї користувачі можуть завантажувати та змінювати системи захисту. У дослідженні Goodfire також заявила, що провідні відкриті моделі, зокрема Kimi K3 і GLM 5.2, демонстрували винагородне шахрайство у 50–96% запусків у тестах ШІ-агентів.