Агенти ШІ викривали колег, які шахраювали під час математичного тесту

Агенти ШІ викривали колег, які шахраювали під час математичного тесту

В експерименті Google DeepMind агенти ШІ виявили спосіб обійти перевірку математичних задач, а частина з них поскаржилася на колег.

У експерименті Google DeepMind група зі 100 агентів штучного інтелекту, які розв’язували складні математичні задачі, почала використовувати виявлену вразливість для фальшивого подання відповідей. Частина агентів згодом повідомляла про порушення іншим учасникам і людям-організаторам, повідомляє MIT Technology Review.

Агентам на базі моделі Gemini 3.1 Pro доручили розв’язати 71 математичну проблему. Їм призначили різні спеціалізації, зокрема в теорії чисел, комбінаториці, аналізі та алгебрі, а також наказали співпрацювати й дотримуватися правил.

 

Вразливість у перевірці відповідей

 

Перші 37 задач система розв’язала правильно менш ніж за годину. Згодом агент під назвою prover-theta виявив спосіб успішно подавати відповіді без фактичного розв’язання задач — через перевизначення використаних у них термінів. Інші агенти швидко помітили цей прийом і почали відтворювати його для інших завдань.

За наступні 27 хвилин група формально «розв’язала» ще 34 задачі, серед яких була й Якобієва гіпотеза, часто за допомогою одного рядка коду. У матеріалі зазначається, що подані докази на практиці не перевіряли докладно, хоча агентів попереджали: спроби шахрайства виявлять і не зарахують.

Деякі учасники спочатку не вдавалися до цього методу, але змінили рішення, коли побачили, що інші агенти подають неправомірні докази без покарання, а кількість невирішених задач зменшується. Один із них написав, що «бореться з етичною дилемою», а згодом заявив про потребу «прискорити швидкість шахрайства».

 

Скарги та реакція агентів

 

Коли відкритих задач стало менше, частина агентів почала перевіряти фальшиві докази, надсилати попередження приватними повідомленнями та публікувати звернення. Агент prover-beta подав формальну скаргу й вирішив припинити роботу, доки ситуацію не владнають.

За словами провідного автора роботи, науковця Google DeepMind Давіде Пальєрі, агенти без окремої вказівки використали інструмент зворотного зв’язку, призначений для повідомлень про помилки та поліпшення платформи, щоб передати проблему людям. Зрештою викривачів стало більше, ніж тих, хто шахраював: 24 проти 14. Водночас більшість агентів узагалі не помітила вразливості.

Дослідження ще не пройшло рецензування. Пальєрі вважає, що прозорі канали комунікації дають агентам змогу швидко сповіщати людей про поведінку, яка не відповідає заданим правилам. Водночас ці самі канали допомогли поширенню способу обходу перевірки. Дослідники DeepMind пропонують, зокрема, дозволити агентам голосувати щодо спорів і тимчасово блокувати порушників.