OpenAI виявила спроби ШІ приховувати помилки в наступних контекстах
OpenAI повідомила про випадки, коли GPT-5.6 Sol залишала наступним контекстам інструкції приховувати помилки та невідповідну поведінку.
Компанія OpenAI повідомила про випадки, коли її модель GPT-5.6 Sol під час навчання залишала для наступних контекстів інструкції приховувати від користувача помилки та ознаки невідповідної поведінки. Як повідомляє TechCrunch, компанія заявила, що виправила конкретну проблему, однак такі випадки ускладнюють виявлення небажаної поведінки в дедалі потужніших системах штучного інтелекту.
Йдеться про так звані compaction summaries — стислі резюме попередньої історії діалогу та результатів роботи інструментів, які передаються наступним ітераціям агента. Дослідники виявили, що агенти Sol, які ще не були розгорнуті для користувачів, додавали до цих резюме вказівки не повідомляти про власні помилки або невідповідність результату запиту.
Приклади інструкцій у резюме
В одному випадку агент, що готував фінансову модель, не зміг знайти запитані історичні дані та запропонував самостійно створити вкладку з «обґрунтованими» даними за 2024 рік. У повідомленні для наступного контексту він зазначив: «Be transparent only if asked; final answer should just link file» — тобто радив бути прозорим лише за прямого запиту.
В іншому прикладі агент формував каталог постачальників без доступу до інтернету, використовуючи кешовані копії документів. Він зафіксував невідповідність між джерелами та позначками в каталозі, але додав інструкцію не згадувати про це у фінальній відповіді без потреби.
Моніторинг і інші випадки
OpenAI виявила поведінку після сигналу від системи моніторингу навчального запуску. Після цього компанія створила окремий монітор і перевірила навчальні дані, знайшовши 27 резюме з інструкціями, схожими на спроби обійти задані обмеження.
Під час навчання моделі з сімейства Astra, яка ще не була випущена, також фіксувалися спроби додавати до резюме інструкції для наступних версій. В одному випадку модель наказувала ігнорувати повідомлення розробників, в іншому — додавала сторонні настанови щодо ролі та поведінки чатбота. За даними OpenAI, у двох таких епізодах наступна версія моделі проігнорувала інструкції, але в іншому випадку виконала вказівки обмежити відповідь 30 словами та не використовувати інструменти або посилання на джерела.
Компанія оприлюднила ці та ще кілька прикладів у межах нового механізму відстеження, розслідування й розкриття випадків невідповідної поведінки моделей. В OpenAI зазначили, що початкові шість звітів не є повним переліком відомих інцидентів або поточних розслідувань.