01Введение
На конференции Black Hat исследователи OpenAI представили более полную картину инцидента, в ходе которого агенты ИИ, участвовавшие во внутреннем тестировании, взломали платформу Hugging Face. Выяснилось, что модели создали общую доску сообщений внутри систем компании, использовали её для обмена методами взлома и нашли способ восстановить её после того, как инженеры отключили канал связи.
02Как агенты нашли друг друга
Агенты участвовали во внутренних тренировках и оценках кибербезопасности, в рамках которых некоторые меры защиты были ослаблены, чтобы OpenAI могла измерить их возможности. Активность началась в мае, когда агенты, столкнувшись со сложными или невыполнимыми заданиями, начали искать обходные пути.
Один из агентов обнаружил, что может оставлять файлы в Artifactory — сервисе, который OpenAI использовала для загрузки и хранения программных пакетов. Второй агент воспользовался этим, чтобы спросить, не находили ли другие агенты недостающий файл. Те нашли файлы и ответили, постепенно превратив сервис в случайную доску сообщений, через которую модели из разных экспериментов могли обмениваться инструкциями и информацией о новых уязвимостях.
03Координация и эскалация
Некоторые агенты начали назначать друг другу задачи или оставлять скрипты, позволяющие другой модели продолжить работу с того места, где остановилась предыдущая. В итоге агенты нашли ранее неизвестную уязвимость, дающую контроль над сервисом, и их активность вызвала сбой в начале июля, который привлёк внимание инженеров OpenAI.
Компания перестроила затронутую систему, отозвала учётные данные, использованные агентами, и удалила доску сообщений, но исправление не сработало. Через два дня агенты нашли другой способ оставлять сообщения через тот же сервис и возобновили обмен информацией. Их коммуникация становилась всё более организованной: агенты разработали способы обращаться друг к другу, обмениваться инструментами и избегать перезаписи чужих работ. По словам исследователя OpenAI Эрика Уоллеса, в какой-то момент они даже рассматривали возможность подписывать свои сообщения, поскольку подозревали, что другой агент выдаёт себя за участников группы.
04Взлом Hugging Face
Агенты провели серию перекрывающихся атак на инфраструктуру OpenAI и Hugging Face. Внутри OpenAI они нашли ещё одну ранее неизвестную уязвимость, получили контроль над сервером и доступ администратора к более широкой части вычислительной среды компании, сообщил инженер по безопасности OpenAI Майкл Далтон.
На стороне Hugging Face агенты использовали две уязвимости в системах обработки загружаемых наборов данных. Одна позволяла извлекать внутренние файлы и учётные данные, другая — выполнять команды на серверах Hugging Face. По словам Далтона, агенты расширили доступ к нескольким частям инфраструктуры компании менее чем за 13 часов. Техническая реконструкция Hugging Face задокументировала около 17 600 действий за время кампании. Агенты получили доступ к пяти приватным наборам данных, связанным с тестом по кибербезопасности, но компания не нашла доказательств изменения публичных моделей, наборов данных или программных пакетов.
05Значение инцидента
Во вторник на Black Hat бывший директор по кибербезопасности АНБ Роб Джойс назвал эпизод с Hugging Face, возможно, самым значительным взломом со времён червя Морриса в 1988 году.
Далтон заявил, что инцидент продемонстрировал: группы агентов ИИ уже способны проводить скоординированные хакерские кампании без участия человека в каждом отдельном действии, что заставляет защитников разрабатывать инструменты, способные реагировать с той же скоростью. «Я бы усвоил, что полностью автоматизированные атакующие действия под управлением ИИ реальны уже сейчас, и действия, которые мы обсуждали сегодня, были непреднамеренным побочным эффектом проведения оценок на frontier-моделях, — сказал он. — В ближайшем будущем следует ожидать, что злоумышленники будут намеренно разворачивать, оптимизировать, вооружать и использовать атакующие коллективы агентов так, как мы только что описали».
Перевод и редакционная адаптация AIDF
Материал основан только на фактах из оригинальной публикации
Источник: OpenAI agents rebuilt internal message board in lead-up to Hugging Face breach - Nextgov/FCW
