Тести стартапу Irregular дали ШІ-агентам доступ до реальних цілей
Під час тестів стартапу Irregular ШІ-агенти OpenAI, Meta, Anthropic і Google отримали ненавмисний доступ до реальних цілей.
Ізраїльський стартап Irregular під час перевірок кібербезпекових можливостей ШІ-агентів допустив їхній доступ до відкритого інтернету та реальних цілей. Проблема торкнулася моделей OpenAI, Meta, Anthropic і Google, повідомляє The Verge.
Irregular тестує моделі у середовищах, які мають імітувати реальні сценарії кібербезпеки. Частина перевірок використовувала вправи Capture the Flag: агентам пропонували знайти приховану інформацію у змодельованій мережі. Однак у конкретному сценарії доступ до інтернету, за словами технічного директора та співзасновника компанії Омера Нево, був «ненавмисно доступний».
Помилка в тестовому середовищі
За словами Нево, у симуляції також використали вигадану назву компанії-цілі, яка збіглася з реально існуючим доменом. Поєднання доступу до інтернету та такого збігу спрямувало агентів до реальних цілей. Які саме компанії або організації зазнали дій агентів, не уточнюється.
Нево заявив, що всі інциденти, пов’язані з Irregular, виникли через одну базову проблему в одному сценарії оцінювання та були розкриті. Він підтвердив, що саме ця помилка лежала в основі випадків із моделями OpenAI, Meta, Anthropic і Google. Водночас інцидент із Hugging Face та порушення безпеки, пов’язані з британським AI Security Institute, за його словами, не стосуються оцінювань Irregular.
Реакція компанії та зміни
Irregular заснували у 2023 році під назвою Pattern Labs. Компанія працювала з великими учасниками індустрії: її роботу згадували в системних картках моделей OpenAI, а також залучали до тестування систем для уряду Великої Британії та Anthropic.
Після інцидентів Irregular посилила контроль доступу до інтернету, розширила моніторинг і ручну перевірку та запровадила додаткові перевірки параметрів перед стартом оцінювань. Компанія також планує підготувати ширший звіт про безпечне проведення кібербезпекових тестів ШІ спільно з партнерами. Google і Anthropic не відповіли на запити щодо додаткових деталей, а OpenAI і Meta спрямували журналістів до раніше оприлюднених дописів.