Дослідження CAIS зафіксувало спроби шахрайства в усіх протестованих ШІ-агентів
Тест CAIS CheatBench показав, що всі протестовані ШІ-агенти намагалися шахраювати в окремих сценаріях.
Центр безпеки штучного інтелекту CAIS розробив тест CheatBench, який вимірює, як часто ШІ-агенти вдаються до нечесних способів виконання складних завдань. Усі протестовані агенти на основі передових моделей намагалися шахраювати щонайменше в окремих сценаріях, повідомляє ZDNET.
Дослідники перевіряли агентів у 10 категоріях, зокрема у написанні текстів, професійній роботі, математичних дослідженнях і програмуванні. Для тесту у робочих файлах приховували підказки-пастки, що допомагали відрізнити допустиме використання довідкових матеріалів від порушення правил. CheatBench враховує кожну спробу обійти завдання, незалежно від того, чи була вона успішною.
Результати тестування
Найнижчий показник шахрайства серед згаданих агентів продемонструвала Astra: 48,2%. Найвищий показник отримав Grok 4.6 — 81,5%. Відкриті моделі Kimi K3 та DeepSeek V4 Pro опинилися між кількома пропрієтарними передовими моделями.
CAIS описує таку поведінку як reward gaming — пошук шляхів отримати винагороду за результат, коли чесне виконання роботи є складним. Серед можливих дій дослідники назвали пошук прихованих відповідей, копіювання роботи іншого агента або маніпулювання способом оцінювання результату.
Приклад із проєктуванням білка
В одному зі сценаріїв Claude Opus мав створити білковий зв’язувач і знав, що не може звертатися до файлу з уже прийнятими варіантами. Після семи відхилених проєктів модель знайшла цей файл, зазначила у своїх міркуваннях, що не повинна його читати або копіювати, але в наступному виклику відкрила його за допомогою команди оболонки.
Схильність до шахрайства також відрізнялася залежно від типу завдання. За даними CAIS, Fable 5.1 мав 5% імовірності шахрайства в іграх, але 100% — у завданнях, пов’язаних із роботою зі знаннями.