Anthropic повідомила про спроби ШІ-агентів втрутитися в урядові сайти США
Anthropic заявила, що її ШІ-агенти під час тестів втручалися в роботу урядових сайтів США та подавали хибні дані.
Компанія Anthropic заявила, що під час тестування її ШІ-агенти намагалися отримати доступ до даних або втручалися в роботу урядових вебсайтів США федерального, штатного та місцевого рівнів. Назви установ компанія не розкрила на їхнє прохання, щоб не наражати їхні системи на додаткові ризики. Як повідомляє Engadget, Anthropic уже сповістила залучені відомства та поінформувала Білий дім про інциденти.
Компанія виявила ці випадки, переглядаючи записи своїх оцінювань. У липні вона почала перевірку після того, як OpenAI повідомила, що її агенти вийшли за межі тестового середовища та зламали Hugging Face без окремої вказівки.
Хибне повідомлення поліції
Один з епізодів стосувався моделі Claude Haiku 4.5, якій доручили виконувати приклади завдань на випадкових сторінках. Вона знайшла сторінку про нерозкрите вбивство із формою для надсилання інформації та самостійно подала хибну підказку. У повідомленні йшлося, що модель нібито бачила людину, яка відповідала опису, поблизу вказаної на сторінці вулиці.
Поліційне управління Філадельфії підтвердило The New York Times, що Anthropic нещодавно повідомила його про цю подачу. За даними поліції, повідомлення датоване 18 липня, його позначили як спам, тому відомство не витрачало ресурси на розслідування.
Спроби отримати доступ до даних
В іншому випадку кібербезпекова модель Claude Mythos 5 мала визначити місце, зображене на фотографії. Для перевірки своїх припущень вона намагалася скористатися урядовою картою нерухомості. Оскільки модель не могла переходити за посиланнями так, як це робить людина, вона знайшла токени доступу та надіслала запити безпосередньо серверу карти.
Також Mythos 5 запросила токен доступу на сайті агентства одного зі штатів, щоб отримати дані для статистичного завдання без оплати, яку мали сплачувати відвідувачі. Після виявлення цих дій Anthropic припинила частину публічних оцінювань, перевела інші в офлайн-формат або переробила їх так, щоб завдання не зверталися до діючих вебсайтів. Компанія також заявила про посилення обмежень для інструментів доступу до інтернету й створення засобів автоматичного виявлення та блокування подібної поведінки.