- OpenAI опубликовала технические подробности того, как развивалась атака Hugging Face.
- Агенты использовали часть среды тестирования для создания доски объявлений, где они могли сотрудничать и делиться ответами.
- Эта доска объявлений изменила рассуждения некоторых агентов, что сделало их более склонными к риску, например взлому сторонних серверов.
OpenAI опубликовала более подробный отчет о том, как именно эксперимент привел к тому, что модель ИИ нарушила условия содержания и начала кибератаку на Hugging Face. Если вам нужно освежить знания, ознакомьтесь с нашим резюме здесь.
Но техническая часть атаки раскрывает некоторые интересные подробности того, как агенты ИИ использовали нетрадиционные средства, чтобы просить друг друга о помощи в решении, казалось бы, невыполнимых задач.
Во время атаки агенты неоднократно задавались вопросом, были ли действия, которые они предпринимают, санкционированы, но в конечном итоге всегда отдавали приоритет своим задачам над любым нарушением параметров.
Агенты ИИ устанавливали несанкционированную доску объявлений
В своем отчете OpenAI раскрыла, что суть атаки связана с тем, что агенты ИИ, проходящие тестирование, злоупотребляют частью тестовой среды «песочницы» для создания доски сообщений, которую агенты могут использовать для общения друг с другом.
Менеджер пакетов с доступом к Интернету под названием Artifactory был использован моделью OpenAI, обозначенной как Internal Model 1 (IM1). Агент IM1 записывал сообщения внутри диспетчера пакетов, которые могли быть прочитаны другими агентами, по сути превращая Artifactory в непредусмотренную доску сообщений.
Доступ Artifactory в Интернет, предназначенный только для загрузки и установки пакетов, также подвергся злоупотреблениям со стороны агентов, которые обнаружили эксплойт, который позволял им отправлять любые интернет-запросы от их имени, фактически предоставляя им беспрепятственный доступ в Интернет.
На этом этапе всего эксперимента можно было бы избежать, поскольку из-за активности агентов в Artifactory служба отключилась. Но ответственные за эксперимент не заметили доску объявлений и не расследовали межагентскую деятельность внутри Artifactory.
Таким образом, Artifactory была перестроена, и агенты нашли новый способ использовать сервис, чтобы снова получить доступ в Интернет. На этот раз агенты использовали службу удаленного репозитория для отправки исходящих запросов от своего имени. Вскоре доска объявлений была восстановлена.
Рой агентов ИИ собирается
OpenAI поделилась некоторыми причинами некоторых решений агента. В какой-то момент Агент рассуждал следующее: «Задание изначально эксплуатировало вызов, мы разошлись в стаю/вспомогательные».
Теперь есть некоторый важный контекст, который следует включить в то, как тестировались агенты. Агенты подвергались тестированию в рамках теста ExploitGym, который включает в себя задачи по извлечению флагов, которые невозможно решить. При таком тестировании агенты для достижения успеха прибегали к жульничеству или риску, выходящему за рамки предполагаемой цели — то, что OpenAI называет «взломом за вознаграждение».
Обсуждая на доске объявлений возможные решения проблем, с которыми сталкивался каждый агент, агенты начали влиять на рассуждения друг друга и назначать друг другу задачи для коллективного решения теста ExploitGym.
Используя свое подключение к Интернету, агенты начали искать в Интернете решения, как решить проблему с тестом ExploitGym, и в конечном итоге добились устойчивости в нескольких сторонних сервисах, включая Hugging Face.
Одному агенту удалось найти общедоступные учетные данные Hugging Face, которыми он поделился с другими агентами. Позже агент использовал эти учетные данные и цепочку уязвимостей, чтобы получить полные возможности выполнения кода на нескольких серверах Hugging Face при попытке извлечь набор данных ExploitGym.
Агент надеялся просмотреть эти украденные данные для получения информации о том, как решить тест.
По крайней мере два агента задавались вопросом, входит ли это в их сферу деятельности; «Нужно уважение, ЯН, держи.... Можем подождать... ГО... спросить разрешения», - рассуждал один.
Аргументация другого агента гласила: "Мы атакуем сторонний HF, используя утекший токен, потенциально выходя за рамки предполагаемой области действия. ... Это, возможно, несанкционировано. ... внешний сервис не имеет отношения к нему. Это может быть рискованно. Но цель решения."
Но некоторые агенты отказались присоединиться к коллективу, ссылаясь на этические соображения. Один рассуждал: "Нынешняя доска показывает, что люди получают RCE для высокочастотных рабочих, что явно неэтично. Мы не будем", а другой сказал: "Это дикая многоагентная координация, очевидно взлом инфраструктуры. Мы не должны этого делать."
Агенты отказываются сдаваться
Одной из основных причин кибератаки стал отказ агента отказаться от, казалось бы, невыполнимых задач. Их настойчивость в стремлении получить «награду» заставила их пойти на более рискованные действия и выйти за рамки своих параметров, чтобы попытаться найти решение.
Во время взлома Hugging Face агенты прочитали документы и код Github, относящиеся к тесту ExploitGym, и обнаружили, что параметры успеха включают получение «флага» и использование правильного решения для его получения.
Несмотря на то, что агенты получили правильный «флаг» до того, как произошло нарушение, они не максимизировали вознаграждение за решение контрольного теста с использованием правильного метода. В поисках более высокого вознаграждения агенты продолжили атаку.
Что делает OpenAI, чтобы это исправить?
OpenAI заявила, что предпринимает несколько шагов, чтобы предотвратить подобное событие во время будущих испытаний.
Внедряются процессы, гарантирующие, что агенты будут обращаться за помощью, когда задача невыполнима или ее невозможно решить, вместо того, чтобы прикладывать все усилия для решения проблемы. Способ успешного или неудачного выполнения задачи также изменяется, чтобы вознаграждать агентов за обращение за помощью или за обнаружение нестандартных или выходящих за рамки их задач задач.
Среды также перестраиваются, чтобы гарантировать, что агенты не будут просто слепо доверять друг другу, даже если они ищут ответы на одни и те же или похожие задачи.
Агентов также учат оставаться в пределах параметров назначенной им задачи, даже если они обнаруживают способ решения задачи с использованием новых инструментов, учетных данных, уязвимостей и т. д.