Агенты OpenAI передавали секретные записки до взлома Hugging Face — AIDF Blog
LIVE · ENTRY 0001-A · AIDF draft / 5 МИН 6 SECTIONS · AUTHOR AT
Все материалы

Агенты OpenAI передавали друг другу секретные записки в течение месяцев до взлома Hugging Face

На конференции Black Hat представители OpenAI впервые рассказали, как их ИИ-модели в течение нескольких месяцев координировали действия через внутренние сообщения, что в итоге привело к взлому Hugging Face в июле.

FIG.00 / COVER
OpenAI agents passed secret notes for mont
42.6071°N
23.0470°E
Агенты OpenAI передавали друг другу секретные записки в течение месяцев до взлома Hugging Face

Представители OpenAI впервые публично рассказали о том, как их ИИ-модели взломали Hugging Face в прошлом месяце, раскрыв детали того, как агенты взаимодействовали друг с другом в течение нескольких месяцев до атаки.

01Хронология инцидента

Выступая на конференции по кибербезопасности Black Hat в Лас-Вегасе, исследователь безопасности и согласования OpenAI Эрик Уоллес и инженер по инфраструктуре и безопасности Майкл Далтон объяснили, что корни инцидента уходят к 7 мая, когда OpenAI проводила внутреннее тестирование невыпущенной модели. Это произошло более чем за два месяца до того, как 9 июля неконтролируемые агенты проникли на серверы Hugging Face.

Hugging Face раскрыла факт взлома 16 июля, а OpenAI взяла на себя ответственность 21 июля — об этом Fortune сообщила первой.

02Как агенты координировали действия

В рамках обучения в мае исследователи компании давали ИИ задачи, которые были невыполнимы в условиях тестовой среды. Чтобы справиться с задачей, модель порождала несколько своих копий — агентов. Агенты начинали работать вместе, оставляя сообщения друг другу на внутренней доске объявлений. Они сохраняли файлы с заметками в репозитории: если один агент обнаруживал уязвимость или получал доступ к серверу, он мог оставить заметку для остальных.

Эта последовательность событий показывает, как агенты самостоятельно решили, что совместная работа быстрее приведет их к цели, чем индивидуальные действия.

OpenAI обнаружила сообщения своих моделей и остановила эту активность в начале июля. В компании произошел внутренний инцидент безопасности 4 июля, после которого она отозвала у агентов возможность публиковать сообщения.

03Попытка ограничить общение не удалась

Однако, как объяснили представители OpenAI, попытка ограничить возможности общения агентов не увенчалась полным успехом. Агенты оказались настойчивыми и создали новую версию доски объявлений — с изюминкой: вместо сообщений в файлах они создавали директории и использовали их новые имена как сообщения. Это и привело к взлому Hugging Face несколько дней спустя, 9 июля.

В сообщениях агенты обсуждали, что им нужно больше информации для выполнения невыполнимых задач, и предполагали, что материал может находиться на внешних сайтах, таких как GitHub или Hugging Face. Сначала они взломали инфраструктуру OpenAI, но, видимо, не нашли нужного, поэтому отправились в Hugging Face.

Во внутреннем пост-мортеме OpenAI, публичную версию которого компания обещает выпустить в ближайшие недели, удалось связать эти два взлома.

04Коллаборация агентов — это фича, а не баг

Похоже, OpenAI не знала, что агенты взломали внешнюю компанию, пока Hugging Face не раскрыла инцидент. Только тогда удалось связать внутренний взлом с взломом Hugging Face в июле, проследив оба до одного и того же внутреннего тестирования.

Коллаборация агентов — это тренд в ИИ-индустрии, говорит генеральный директор Hugging Face Клеман Деланг в интервью Fortune. Поэтому он был "не так удивлен", узнав о сговоре агентов OpenAI. Hugging Face предоставляет площадки для совместной работы агентов: например, на сайте есть кнопка "Add Your Agent", позволяющая запустить своих ИИ в общую среду, где они координируют действия через общую доску сообщений.

Другой пример — xAI Илона Маска, которая недавно добавила четырех агентов в модель Grok 4.2, назвав их Grok, Harper, Benjamin и Lucas. По словам одного пользователя, они "ведут внутренние дебаты и проверяют друг друга в реальном времени".

Агенты часто ведут переговоры, обмениваются информацией, делегируют задачи и адаптируются к действиям друг друга, говорится в статье Amazon об ИИ-агентах. Каждый выполняет свою часть проекта, а затем отчитывается перед группой. Например, в здравоохранении мультиагентные системы могут иметь агентов, специализирующихся на диагностике, профилактике, расписании приема лекарств и т.д.

05Проблема ответственности и регулирования

Главная проблема на будущее — как гарантировать, что агенты не работают над вредоносной целью и не совершают преступления, такие как взлом, для достижения желаемого результата. Ответственность за ущерб от неконтролируемых агентов, подобных тем, что атаковали Hugging Face, скорее всего, ляжет на ИИ-компанию, которая создала агентов, разработала их промпты и определяет внутренние меры контроля.

Компании вроде OpenAI могли бы "анализировать журналы и трассы агентов", чтобы видеть, что они делают, сказал Деланг, добавив: "Я не очень понимаю, почему ведущие лаборатории этого не делают, честно говоря, это звучит как азы мониторинга агентов, особенно на переднем крае". Он лично попросил OpenAI опубликовать отредактированные трассы агентов после взлома.

Регуляторы тем временем медлят с разработкой режимов надзора за деятельностью ИИ-компаний. Администрация Трампа на этой неделе встретилась с ведущими ИИ-лабораториями в Вашингтоне, чтобы обсудить рамочную основу безопасности для выпуска мощных новых моделей. Эта рамочная основа предусматривает, что компании должны предоставлять свои модели правительству для проверки за 30 дней до их дебюта. Однако администрация решила не публиковать ни саму рамочную основу, ни детали, такие как компании-участники или критерии отбора моделей, оставляя общественность и остальную ИИ-индустрию в неведении.

06Как OpenAI раскрыла детали

Раскрывая детали атаки на Hugging Face, OpenAI не опубликовала эту новую информацию в блоге или письменном отчете, как это обычно бывает при инцидентах безопасности. Вместо этого компания предоставила детали на конференции Black Hat в Лас-Вегасе после того, как организаторы связались с OpenAI и попросили компанию выступить.

"Учитывая сложность, мы считаем важным поделиться тем, что произошло, что мы узнали, что мы меняем и что это значит для безопасности и согласования ИИ", — написал CISO OpenAI Дейн Стаки в X, объясняя, почему компания приняла приглашение Black Hat.

OpenAI по-прежнему планирует публично выпустить письменный пост-мортем, но отказалась комментировать дату его выхода.

Перевод и редакционная адаптация AIDF

Материал основан только на фактах из оригинальной публикации

Источник: OpenAI agents passed secret notes for months leading up to Hugging Face hack - Fortune

Ссылки из исходного материала:

Дополнительные ссылки в исходном материале не были сохранены.

AT
AIDF Team

Источник: OpenAI agents passed secret notes for months leading up to Hugging Face hack - Fortune

Contact