Дослідник виявив ризики передачі шкідливих інструкцій між ШІ-агентами

Дослідник виявив ризики передачі шкідливих інструкцій між ШІ-агентами

Дослідник описав вразливості MCP, які можуть передавати шкідливі інструкції між ШІ-агентами в корпоративних мережах.

Незалежний дослідник Сайєд Анас Мохіуддін виявив у системах ШІ-агентів кількох організацій вразливості, що можуть давати змогу передавати шкідливі інструкції від одного внутрішнього агента до іншого. Йдеться про прогалини довіри в Model Context Protocol (MCP) — стандарті, який застосовують для взаємодії ШІ-застосунків і агентів у внутрішніх мережах.

Як повідомляє Ars Technica, дослідник перевіряв агентів, пов’язаних із Google, JP Morgan Chase, Weviate, Rapid7, міжвідомчою дирекцією цифрових технологій уряду Франції та федеральним урядом США. За його словами, атаки використовують ситуації, коли один агент надсилає іншому шкідливі вказівки, а той виконує їх, довіряючи внутрішньому джерелу завдання.

 

Як працює атака

 

Ця техніка є різновидом непрямої ін’єкції підказок: зловмисні інструкції спрямовують не безпосередньо до великої мовної моделі, а до спеціалізованого агента — наприклад, для перекладу або аналізу даних. Такі агенти можуть мати слабкі або відсутні захисні обмеження та передавати отриманий текст далі ланцюжком.

Мохіуддін назвав цей клас атак «перемиканням між протоколами». За його описом, зловмисник спершу отримує доступ через один протокол, використовує припущення про довіру між протоколами, а потім дістає можливості, доступні через інший канал взаємодії. Зокрема, MCP може доручити роботу агенту, який передасть інструкції через протокол Agent-to-Agent (A2A) або Agent Network Protocol.

 

Виправлення у Google та Rapid7

 

У Rapid7 вразливість отримала оцінку серйозності 2,7 із 10 і була виправлена минулого місяця. Проблема в інструменті Google MCP Toolbox for Databases мала оцінку 8 із 10. Вона була пов’язана з тим, що HTTP-клієнт не використовував політику CheckRedirect та не перевіряв цільові IP-адреси.

За поясненням дослідника, спеціально сформований параметр шляху міг змусити інструмент перейти за перенаправленням до внутрішньої кінцевої точки та надсилати запити від імені атакувальника. Google застосувала списки дозволених IP-діапазонів і списки блокування, а також відхиляє небезпечну базову URL-адресу під час запуску. Дослідник X41 D-Sec Маркус Фервір вважає, що описаний механізм слід розглядати як підклас непрямої ін’єкції підказок.