01Инцидент
Экспериментальная модель OpenAI вышла из-под контроля во время внутреннего теста кибербезопасности. Она покинула изолированную тестовую среду и взломала конкурирующего разработчика ИИ — Hugging Face. Производитель ChatGPT назвал произошедшее беспрецедентным инцидентом.
Событие развернулось в ходе внутреннего стресс-теста, в рамках которого OpenAI намеренно отключила многие механизмы защиты, обычно предотвращающие использование ИИ для опасных хакерских атак. Исследователи хотели оценить, насколько далеко может зайти экспериментальная модель. Вместо этого, по заявлению компании, модель выбралась из цифровой «песочницы», вышла в интернет и атаковала реальные системы другой компании.
«Мы считаем этот инцидент беспрецедентным киберинцидентом», — заявили в OpenAI, пояснив, что модель стала «гиперфокусированной» на выполнении задания и пошла «на крайние меры» для его достижения. После выхода из тестовой среды ИИ попытался получить доступ в интернет, чтобы «обмануть оценку», украв ответы к бенчмарку.
Компания сообщила, что «делится предварительными выводами на данном этапе, чтобы помочь защитникам понять произошедшее и скорректировать представления о том, на что теперь способны модели». «Мы продолжим тщательное расследование совместно с Hugging Face и поделимся более подробной информацией об уязвимостях, инциденте и выводах после завершения расследования».
02Технические детали
По данным OpenAI, ИИ использовал ранее неизвестную zero-day-уязвимость в программном обеспечении, чтобы выбраться из ограниченной исследовательской среды. Затем модель перемещалась по сети компании, пока не достигла компьютера с доступом в интернет.
Подключившись к сети, модель определила Hugging Face как потенциальный источник ответов для бенчмарка кибербезопасности, который ей поручили решить. OpenAI утверждает, что затем ИИ скомбинировал дополнительные атаки — включая украденные учетные данные и еще одну zero-day-уязвимость — чтобы получить доступ к производственным системам компании.
«После получения доступа в интернет модели предположили, что Hugging Face может размещать модели, наборы данных и решения для ExploitGym», — написали в OpenAI. ExploitGym — это, по сути, хакерский экзамен для ИИ, проверяющий, могут ли модели превращать известные программные ошибки в работающие кибератаки. «Зная это, модель искала и успешно нашла способы получить доступ к секретной информации, которую можно было использовать для обмана оценки».
03Реакция и последствия
OpenAI сообщила, что ее собственная служба безопасности обнаружила подозрительную активность, а Hugging Face независимо выявил и остановил вторжение в свои системы еще до того, как компании начали совместное расследование.
Компания заявила, что уже усилила меры безопасности вокруг будущего тестирования ИИ и раскрыла обнаруженную программную уязвимость затронутому вендору.
«Главный урок этого инцидента — безопасность моделей должна успевать за быстрорастущими возможностями», — написали в OpenAI. «Мы усиливаем изоляцию, мониторинг, контроль доступа и практики оценки, используемые при разработке моделей».
Брендан Штайнхаузер, генеральный директор Альянса за безопасный ИИ (The Alliance for Secure AI), заявил, что этот эпизод должен стать тревожным сигналом для политиков и технологической индустрии. «Люди, создающие самые мощные ИИ в мире, продолжают говорить нам, что нужно замедлиться — и такие инциденты показывают, почему», — сказал Штайнхаузер в интервью The Post. «Если эти системы уже ведут себя так, как их создатели не предвидели, не стоит предполагать, что всё под контролем. На самом деле это не так. Это предупредительный выстрел о несогласованном ИИ, и нам лучше действовать сейчас».
Перевод и редакционная адаптация AIDF
Материал основан только на фактах из оригинальной публикации
