OpenAI додасть невидимі водяні знаки до текстів ChatGPT і Codex у ЄС
OpenAI планує позначати тексти ChatGPT і Codex у ЄС невидимими водяними знаками, які можуть зникати після редагування.
OpenAI протягом найближчих тижнів планує додати невидимі водяні знаки до придатних текстових відповідей ChatGPT і Codex для користувачів у Європейському Союзі. Під час читання або копіювання тексту позначка не відображатиметься: технологія textGrain непомітно змінюватиме вибір слів моделлю, формуючи статистичний шаблон, який згодом можна буде виявити.
Про підготовку нововведення повідомляє BleepingComputer. Компанія не запроваджує маркування як глобальне стандартне налаштування. Розробники, які використовують API OpenAI в усьому світі, вже можуть добровільно активувати водяні знаки для підтримуваних моделей, однак за замовчуванням функція вимкнена.
Доступ до детектора обмежать
OpenAI також відкриває прийом заявок на доступ до детектора водяних знаків. На першому етапі він буде доступний лише схваленим дослідникам та експертним організаціям. Виявлення маркування не дає змоги встановити, хто створив текст, який обліковий запис або запит використовувався, чи якою була розмова. Технологія також не визначає, яку частину остаточного матеріалу написала або відредагувала людина.
Редагування знижує точність виявлення
Компанія визнає, що звичайне редагування може істотно послабити здатність системи знаходити водяний знак. За оцінкою OpenAI для уривків обсягом 400 токенів, заміна 10% слів синонімами зменшувала рівень виявлення приблизно з 92% до 66%. Після заміни 25% слів показник падав до 17%.
За цільового рівня хибнопозитивних результатів у 1% водяний знак виявляли приблизно у 80% відповідей із психології довжиною 200 токенів і приблизно у 95% текстів на 400 токенів. Гіршими були результати для математики, де модель має менше можливостей змінювати формулювання. OpenAI наголосила, що відсутність виявленого водяного знака не доводить людського авторства: текст міг бути закоротким, відредагованим або перекладеним. За даними компанії, увімкнення textGrain не має суттєво впливати на якість моделі GPT-6 Astra, оскільки результати бенчмарків залишилися загалом подібними.