Circuit Breaker Labs створив AI-агентів для тестування безпеки чатботів

Circuit Breaker Labs створив AI-агентів для тестування безпеки чатботів

Circuit Breaker Labs розробив AI-агентів, що імітують користувачів для перевірки безпеки чатботів у ризикованих діалогах.

Стартап Circuit Breaker Labs створив AI-агентів для перевірки того, як чатботи реагують на потенційно небезпечні для психічного стану користувачів розмови. Компанія тестує високоризикові застосунки штучного інтелекту, зокрема сервіси для коучингу, ведення щоденників і підтримки психічного здоров’я, повідомляє TechCrunch.

Засновники стартапу — брат і сестра Ширалі та Арул Нігам. Ширалі Нігам обіймає посаду CEO, а Арул Нігам є технічним директором. Команда налічує п’ятьох співробітників і вже має робочий продукт, хоча перебуває на ранньому етапі розвитку.

 

Симуляції реальних користувачів

 

Розроблені компанією агенти імітують користувачів різного віку, походження, мовного та культурного середовища. Їх застосовують у red-team тестуванні — моделюванні взаємодій, покликаному виявити слабкі місця мовних моделей. Симуляції враховують реальні мовні патерни, сленг, кодовані вислови, друкарські помилки та відмінності між носіями й неносіями англійської мови.

За словами Ширалі Нігам, моделі добре працюють зі стандартним мовленням, однак можуть неправильно розуміти нюанси або сленг. Це, за оцінкою стартапу, може спричинити небезпечні відповіді під час спілкування з користувачем.

 

Перевірка тривалих діалогів

 

Circuit Breaker Labs проводить від десятків до сотень тисяч змодельованих взаємодій щодня. Перевірки мають показати, чи здатна модель належно реагувати на ризиковані ситуації, що виникають поступово впродовж багатьох повідомлень, а не лише в окремому запиті.

Компанія залучає фахівців із відповідних сфер для створення реалістичних симуляцій, а результати оцінює за власною методикою, яка має формувати придатні для аудиту та пояснення оцінки. Арул Нігам не назвав основних клієнтів стартапу. У перспективі платформа може застосовуватися й для інших продуктів із чатботами, зокрема AI-агентів для роботи, де користувачі можуть формувати парасоціальні стосунки із системою.