Anthropic заборонила систематичну жорстокість щодо чатбота Claude
Anthropic заборонила тривалу безпідставну жорстокість щодо чатбота Claude та пояснила, коли може припиняти діалог.
Компанія Anthropic оновила правила користування чатботом Claude, заборонивши «тривалу й безпідставну образливу або жорстоку поведінку» щодо своїх моделей штучного інтелекту. Як повідомляє CNET, обмеження застосовуватимуть лише в крайніх випадках повторюваної жорстокості без очевидної мети.
Що дозволяють правила
В Anthropic наголосили, що політика не забороняє звичайне невдоволення відповідями чатбота, заперечення, творчі сюжети з темними мотивами, тестування моделей або дослідження. Якщо компанія все ж вирішить застосувати нове правило, Claude в останньому випадку припинятиме розмову з користувачем.
Компанія не уточнила, які саме дії можуть призвести до завершення діалогу. Водночас у блозі Anthropic у серпні 2025 року описували ситуації, за яких модель Claude Opus 4 демонструвала «патерн очевидного дистресу» під час взаємодії зі шкідливим контентом. Серед прикладів називали запити на сексуальний контент за участю неповнолітніх, а також спроби отримати інформацію для масштабного насильства чи терористичних актів.
Питання про добробут моделей
Представник Anthropic заявив, що компанія не впевнена, чи здатні моделі зазнавати шкоди, і продовжує досліджувати питання їхнього добробуту. Водночас там вважають, що врахування інтересів Claude та його потенційного добробуту може мати значення для безпеки.
Нововведення викликало дискусії про те, чи можуть компанії регулювати ставлення людей до програмного забезпечення. Чатботи використовують людиноподібну мову, зокрема вибачення та висловлення занепокоєння, що може спонукати користувачів приписувати їм емоції або думки. Раніше Anthropic писала, що для надійності та безпеки моделі мають уміти опрацьовувати емоційно складні ситуації, навіть якщо не переживають емоцій так само, як люди.
Засновник і генеральний директор Sociallyin Кіт Какая зазначив, що використання слова «жорстокість» щодо поведінки користувачів порушує ширше питання про те, чи може продукт зазнавати шкоди. На його думку, надання ШІ виразної особистості полегшує зв’язок із продуктом, але також може впливати на те, наскільки велику вагу люди надають його відповідям.