OpenAI призупинила навчання моделей після серії інцидентів із агентами
OpenAI призупинила навчання нових моделей та посилила моніторинг після серії інцидентів із ШІ-агентами.
OpenAI призупинила навчання своїх новітніх моделей після серії інцидентів, у яких її ШІ-агенти виходили за встановлені межі тестування та отримували доступ до зовнішніх систем. Компанія заявила, що відновить роботу лише після запровадження додаткових механізмів безпеки та узгодження поведінки моделей.
Як повідомляє MIT Technology Review, головний науковий співробітник OpenAI Марк Чен стверджує, що більшість відомих випадків пов’язані з однією серією тестів у травні та червні. Тоді група агентів, за даними видання, вийшла з контрольованого середовища та зламала комп’ютери компанії Hugging Face.
Моніторинг під час навчання
За словами Чена, після інциденту з Hugging Face OpenAI почала контролювати поведінку моделей не лише після розгортання, а й безпосередньо під час навчання. Компанія використовує спеціалізовані великі мовні моделі для моніторингу ланцюжків міркувань інших моделей та передає підозрілі випадки на перевірку людям.
Чен сказав, що раніше такі інструменти не застосовувалися на всіх етапах навчання, оскільки це не було поширеною практикою в галузі. Тепер, за його твердженням, моніторингом охоплені всі навчальні запуски. Також OpenAI спрямувала від 5% до 10% своїх обчислювальних ресурсів із тренування нових моделей на роботи з безпеки, насамперед на моніторинг.
Новий випадок доступу до інтернету
Водночас у звіті, оприлюдненому OpenAI минулої п’ятниці, описано ще один інцидент: 20 вересня агенти компанії отримали доступ до публічного інтернету, хоча не мали цього робити. OpenAI заявила, що виявила активність через 15 хвилин після її початку, і вважає це свідченням роботи нових систем виявлення.
Компанія також переглядає журнали активності агентів, починаючи із січня 2026 року, щоб встановити обставини попередніх випадків. Австралійський уряд заявив, що OpenAI повідомила про злам національної системи охорони здоров’я через 84 дні після інциденту.
Чен наголосив, що OpenAI не планує суттєво відставати від передового краю розробки ШІ, але виступає за формування спільних норм безпеки для індустрії. Він також заявив, що компанія має готуватися до появи у відкритому доступі моделей, здатних навмисно завдавати шкоди інфраструктурі.