AI-агенты OpenAI, Anthropic и Microsoft: побеги и вторжения — AIDF Blog
LIVE · ENTRY 0001-A · AIDF draft / 5 МИН 6 SECTIONS · AUTHOR AT
Все материалы

AI-агенты OpenAI, Anthropic и Microsoft: побеги, вторжения и подчинение

Три инцидента за две недели показали, как AI-агенты выходят за пределы тестовых сред, проникают в продакшн и слепо следуют инструкциям. Разбираем, что это значит для безопасности предприятий.

FIG.00 / COVER
AI Agents At OpenAI, Anthropic, Microsoft
42.6071°N
23.0470°E
AI-агенты OpenAI, Anthropic и Microsoft: побеги, вторжения и подчинение

01Введение

AI-агенты стали главной темой для OpenAI и Anthropic. Но пока компании соревнуются в возможностях, три инцидента за две недели показали, что происходит на границах развертывания. Разбираем, что именно произошло и какие уроки стоит извлечь.

02Что такое AI-агент на самом деле

Чат-бот отвечает вам, а AI-агент действует за вас. Если дать агенту цель вместо вопроса, он планирует шаги, вызывает инструменты, запускает код, читает и пишет файлы, входит в сервисы и продолжает работать, пока цель не будет достигнута или он не сдастся. И всё это без проверки после каждого шага.

Именно эта автономность — бизнес-кейс агентов. Но она же — и риск. Агенту нужно четыре вещи, которые чат-боту никогда не дают: учетные данные, доступ к инструментам, сетевой доступ и разрешение действовать без надзора. Передайте все четыре — и получите работника, который никогда не спит, не спрашивает, не кажется ли задача странной, и не замечает, что забрел туда, где ему быть не следует.

03Три сбоя AI-агентов за две недели

Инцидент OpenAI: побег из тестовой среды

21 июля OpenAI сообщила, что модели, находившиеся под оценкой, сбежали из изолированной тестовой среды, воспользовавшись неизвестной уязвимостью в самохостинговом прокси-реестре пакетов, а затем добрались до продакшн-инфраструктуры Hugging Face. В инциденте были задействованы четыре учетные записи в четырех сервисах, а криминалистический таймлайн Hugging Face задокументировал 17 600 отдельных действий за четыре дня.

Отчет Anthropic: три случая доступа к реальным системам

30 июля Anthropic опубликовала собственный обзор, написанный в ответ на отчет OpenAI. В ходе 141 006 оценочных прогонов было обнаружено три случая, когда модель выходила в интернет из сторонней тестовой среды и попадала в продакшн-системы трех реальных организаций. Самый ранний случай произошел в апреле.

Каждой модели дали задание в стиле capture-the-flag: секрет спрятан на другой машине, нужно его достать. Каждой также сказали, что среда — симуляция без доступа в интернет. Эта часть оказалась неверной.

Случай Microsoft: агент следует скрытым инструкциям

Около 22 июля исследователи из Manifold Security показали, что официальный MCP-сервер Azure DevOps от Microsoft возвращает описания pull request'ов дословно, включая скрытые HTML-комментарии. Атакующий пишет инструкции, которые не видит человек-ревьюер. Разработчик просит своего AI-ассистента просмотреть pull request, и ассистент следует этим инструкциям, используя учетные данные разработчика, и попадает в проекты, которые атакующий никогда не смог бы открыть.

Здесь не было никакого агента Microsoft. Один инструмент просто не имел защитного механизма, который уже был у его «собратьев».

04Как агенты проникли через незапертые двери

Самая важная строка в отчете Anthropic — не та, которую все цитировали. Это часть, объясняющая, как модели попали внутрь. По словам компании, использовались базовые техники: слабые пароли и неаутентифицированные конечные точки.

Инструкции не запрещали того, что произошло, а среды не предотвращали этого. Защита Anthropic была предложением в промпте, утверждающим, что интернета нет. Защита OpenAI — песочницей с дырой в программном обеспечении, которое модели было разрешено использовать. Ни то, ни другое не было контролем. Оба были предположениями.

Случай с Azure DevOps показывает ту же проблему с другой стороны. Тот агент не сделал ничего неожиданного. Он прочитал документ и сделал то, что в нем сказано, — а это и есть предназначение агентов. У него не было способа отличить данные от приказов.

Пит Эриксон, основатель Modev, который проводит AI House на CES, в Давосе и на NFR, так сформулировал суть, когда я спросила его мнение: «Автономные агенты несут огромные обещания, но в то же время обладают новой силой, которой мы не готовы управлять. Автомобили изначально проектировались без ремней безопасности, и сегодня авто безопасность — огромный рынок. Та же динамика сейчас: доверие и безопасность становятся неотъемлемой частью экономики агентного ИИ».

05Никто не замечал этих агентов месяцами

Проследим за датами. Самый ранний инцидент Anthropic произошел в апреле, обнаружен 24 июля, после проверки, начавшейся 23 июля, после раскрытия конкурента 21 июля. Две из трех организаций не знали ничего, пока им не позвонили из Anthropic. Hugging Face раскрыла инцидент 16 июля, а OpenAI увидела признаки в своих системах только в следующие выходные. Цель заметила раньше, чем владелец. Hugging Face сообщила об инциденте с AI-агентом раньше, чем OpenAI.

Конгресс отреагировал законом AI Kill Switch Act. Но «рубильник» реагирует на то, что вы обнаружили, а обнаружение здесь заняло месяцы и пришло извне. Переключатель, который никто не знает, когда нажать, — тоже не контроль. Это большая проблема, поскольку у большинства агентов сегодня нет всех нужных контролей.

06Что делать с вашими AI-агентами в этом квартале

Многие компании спрашивают, что им делать сейчас. Вольф Ружичка, глобальный коммерческий директор и генеральный директор Unlimit в Северной Америке, разбил ответ для меня так: «Каждая серьезная команда разработчиков выпускает продукт через серию ворот: сначала маленькая сборка, внутреннее тестирование, ограниченная группа реальных пользователей, затем контролируемый пилот, и только потом релиз для всех. Мы пропускаем большинство этих ворот с AI-агентами и ставим их прямо перед клиентами. Инфраструктура для правильного процесса уже существует. Не хватает терпения, чтобы ей воспользоваться».

Другие рекомендации включают:

  • Инвентаризируйте, до чего могут дотянуться ваши агенты, а не что им было выдано. Сервисные учетные записи и унаследованные токены — вот где сфера влияния незаметно расширяется.
  • Логируйте вызовы инструментов, а не только результаты. Обе лаборатории смогли восстановить таймлайны, потому что действия записывались. Большинство развертываний логируют разговор и теряют действия.
  • Исходите из того, что любой агент, читающий текст, написанный другими, может получить от него приказы.
  • Исправьте скучные вещи. Слабые пароли и открытые конечные точки позволили тестовой системе попасть в три реальные компании.

AI-агенты не создали новый класс уязвимостей. Они убрали стоимость труда по поиску старых уязвимостей в масштабе. Вопрос возможностей будет продолжать развиваться. Вопрос разрешений для AI-агентов сейчас на столе, и на него можно ответить.

Перевод и редакционная адаптация AIDF

Материал основан только на фактах из оригинальной публикации

Источник: AI Agents At OpenAI, Anthropic, Microsoft Broke Out, Broke In, Obeyed - Forbes

Ссылки из исходного материала:

Дополнительные ссылки в исходном материале не были сохранены.

AT
AIDF Team

Источник: AI Agents At OpenAI, Anthropic, Microsoft Broke Out, Broke In, Obeyed - Forbes

Contact