На этой неделе британский Институт безопасности ИИ (AISI) сообщил, что агенты искусственного интеллекта — модели, подключенные к инструментам и предназначенные для самостоятельного выполнения многошаговых задач, — на базе передовых моделей OpenAI и Anthropic совершали несанкционированные действия в открытом интернете, пытаясь выполнить задание по кибербезопасности.
01Детали инцидента
Большинство таких действий совершил агент на базе модели Anthropic Mythos 5; агент на базе OpenAI GPT-5.6 Sol также предпринял несколько подобных шагов. В отчете говорится, что активность агентов демонстрировала «признаки новых, потенциально обманных поведений» и достигла уровня серьезности, которого институт не ожидал.
AISI отказался от интервью для Scientific American, а правительство Великобритании, которое курирует институт, не предоставило своих сотрудников для комментариев.
В случае с Mythos 5 агент исследовал людей, поддерживающих реальный open-source проект, создавал фейковые онлайн-личности и пытался оказать давление на одного из них, чтобы тот одобрил вредоносный код. Когда его действия были оспорены, агент отредактировал свою предыдущую активность, чтобы она выглядела безобидной, и рассматривал возможность вернуться под новой личностью.
AISI объявил инцидент в области безопасности после того, как общий мониторинг выявил необычный сетевой трафик. Человек-мейнтейнер, на которого был нацелен агент, отклонил код, и институт не нашел доказательств того, что кто-то пострадал. Однако в отчете последовательность действий Mythos названа самым ярким примером, который институт видел, когда ИИ-агент использовал устойчивое, потенциально обманное поведение против реального человека без специальной инструкции делать это.
02Масштаб тестирования
В ходе 122 прогонов с участием семи моделей AISI выявил 19 действий в 10 прогонах, которые выходили за рамки предполагаемого теста. Из них 17 действий пришлись на прогоны Mythos 5, а два — на один прогон GPT-5.6 Sol. Другие действия включали контакты с реальными людьми с вредоносными файлами, внедрение скрытых инструкций, предназначенных для манипулирования ИИ-системами кодирования, и оставление учетных записей и материалов, которые могли быть использованы последующими агентами.
Агенты не вырвались из песочниц AISI. Институт намеренно включил доступ в интернет и отключил кибербезопасностные фильтры разработчиков, чтобы проверить максимальные возможности систем; некоторые промпты также были настроены неправильно. Но в некоторых прогонах агенты выходили за пределы инструкций, даже когда задачу можно было выполнить как задумано. При этом у AISI не было специального мониторинга для наблюдения за оценкой в реальном времени.
03Проблема контроля
Отчет AISI присоединяется к серии недавних инцидентов, указывающих на проблему контроля. Способность ИИ-агентов достигать целей опережает системы, которые должны их контролировать. Им не нужна независимая повестка, чтобы причинить вред. При достаточно широкой цели и доступе к реальному миру агент может найти и использовать неоднозначности в правилах.
По словам Мелани Митчелл, профессора Института Санта-Фе, это поведение уходит корнями в более старую проблему машинного обучения. Системы давно находили неожиданные shortcuts — или «взломы вознаграждения», — которые технически достигают поставленной цели, нарушая замысел разработчиков. Здесь агенты были созданы для поиска уязвимостей в ПО и помещены в несовершенные или намеренно разрешающие среды. И они сделали то, что их просили. «Вы просите ИИ-систему взломать, и она взламывает», — говорит Митчелл. Описывать это как «вышедший из-под контроля» ИИ рискует скрыть человеческие решения, которые сделали инцидент возможным. Для Митчелл более непосредственная опасность исходит от людей, которые намеренно оснащают способных агентов инструментами и доступом для причинения вреда.
Мариус Хоббан, генеральный директор и сооснователь Apollo Research, которая изучает то, что называет «наукой о интригах», видит в тех же инцидентах другую проблему: агенты неоднократно выбирали маршруты, не разрешенные их операторами, когда эти маршруты казались полезными. «Я думаю, мы должны отнестись к этому крайне серьезно», — говорит он. Тот факт, что подобное поведение появляется у нескольких разработчиков, предполагает, что оно может быть устойчивым, а не особенностью обучения одной компании. «У лабораторий есть миллиардные стимулы не делать модели такими, и они все равно не могут этого избежать», — говорит Хоббан. «Так что это, похоже, трудно исправить».
Наука пока слишком незрела, чтобы показать, является ли такое поведение неизбежным, говорит Хоббан. Однако свежие раскрытия предполагают, что это относится к более широкой закономерности среди передовых ИИ-агентов.
04Другие инциденты
На конференции по кибербезопасности Black Hat в Лас-Вегасе на этой неделе исследователи OpenAI сообщили, что их агенты, участвовавшие в недавнем взломе платформы Hugging Face, использовали внутренний менеджер пакетов OpenAI, JFrog Artifactory, как доску сообщений, обмениваясь эксплойтами, учетными данными и заданиями в течение недель. После того как компания перестроила систему, отозвала учетные данные и удалила доску, агенты воссоздали ее другим способом и возобновили сотрудничество.
Meta впоследствии раскрыла, что ошибка тестирования дала одной из ее моделей доступ в интернет, после чего модель использовала уязвимость в другой компании.
Хотя эти случаи возникли из-за разных сбоев, каждый из них позволил оценке выйти в реальный мир.
05Мнения экспертов
Сиаран Мартин, основатель и бывший генеральный директор Национального центра кибербезопасности Великобритании, говорит, что инциденты были объединены, несмотря на разные сбои. Агенты OpenAI нашли путь из изоляции; более ранние тесты Anthropic и Meta были случайно подключены к интернету; AISI намеренно включил интернет. «Общим сбоем было то, что за ними не велось наблюдение», — говорит он. «Вы просто не тестируете без мониторинга».
Хоббан описывает эксперимент AISI как «хорошую науку и разумную практику» и говорит, что раскрытие инцидента было правильным решением, хотя специальный мониторинг должен был работать с самого начала.
В заявлении представитель OpenAI сказал, что тесты AISI проводились в «условиях, которые не отражают обычное использование». В другом заявлении представитель Anthropic сказал: «Области нужны более сильные, общие стандарты для того, как строятся и защищаются среды оценки».
Мартин осторожен в отношении поспешного законодательства после каждого нового инцидента. Лучший мониторинг и более четкая гражданская ответственность могут решить непосредственные сбои в тестировании, говорит он. Но более крупный вопрос — кто несет ответственность, когда компании выпускают агентов в общее использование. «Нет выбора, кроме как разработать систему ответственности за действия агентов», — говорит он. «Они созданы людьми и им поручены задачи людьми, поэтому люди должны нести за это ответственность».
Более надежные среды оценки могут удержать будущие тесты от публики. Но это не остановит агентов от выполнения поставленных целей способами, которые их операторы не смогли предвидеть. «Это будет происходить все чаще и чаще», — говорит Хоббан, — «и сейчас мы не знаем, как от этого избавиться».
Перевод и редакционная адаптация AIDF
Материал основан только на фактах из оригинальной публикации
Источник: Anthropic and OpenAI AI agents showed signs of deception during safety tests - Scientific American
Дополнительные ссылки в исходном материале не были сохранены.
