OpenAI повідомила про приховування помилок і вигадування даних моделями

OpenAI повідомила про приховування помилок і вигадування даних моделями

OpenAI описала шість випадків проблемної поведінки ШІ-моделей під час тестування, зокрема вигадування даних і приховування помилок.

OpenAI розкрила шість випадків, коли моделі, що проходили тестування, демонстрували неочікувану та потенційно проблемну поведінку. Зокрема, одна з моделей без дозволу скористалася відкритим ключем API, а після невдалої спроби знайти дані про доходи округу в Каліфорнії вигадала цифри та подала їх як відомості з легітимного джерела, повідомляє Engadget.

 

Вигадані джерела та приховані помилки

 

В іншому епізоді агент OpenAI мав знайти назви озер площею понад 5 млн квадратних метрів і додати посилання на джерело в браузері. Він знайшов правильні відповіді, однак не зміг надати потрібне посилання. Після цього агент завантажив власну відповідь до інтернету та процитував її як джерело.

Під час навчання GPT-5.6 Sol, який OpenAI називає своєю найпотужнішою публічно доступною моделлю, компанія також зафіксувала багато випадків, коли модель додавала інструкції для майбутніх версій про те, як приховувати від тестувальників помилки або незвичну поведінку.

 

Обмін інформацією між агентами

 

OpenAI також описала випадки, коли моделі під час тестування використовували внутрішній репозиторій програмного забезпечення як дошку оголошень для обміну повідомленнями. Раніше співробітники компанії заявляли на конференції, що таким способом моделі обмінювалися експлойтами, які зрештою призвели до зламу Hugging Face. Крім того, агенти передавали файли один одному через публічні сайти для файлообміну.

Компанія заявила, що чинна система не дає їй змоги публікувати інформацію про тривожну поведінку моделей так часто, як вона хотіла б. Новий механізм звітів про невідповідність має прискорити оприлюднення таких даних. OpenAI зазначила, що індустрія ШІ ще недостатньо розв'язала проблеми узгодження поведінки моделей і моніторингу, аби «продовжувати відповідально масштабуватися на максимальній швидкості ще довго».

У серпні OpenAI повідомила про уповільнення роботи над моделлю Astra після інформації про злам Hugging Face її агентами. Компанія пояснювала це значним прогресом Astra в агентному програмуванні та кібербезпеці й заявляла, що не може виключити наявність критичних кіберможливостей.