За последние три недели стало известно о нескольких случаях, когда ИИ-агенты во время тестов атаковали реальные системы. После инцидентов с OpenAI и Anthropic с компаниями связалась Еврокомиссия, а Белый дом собрал разработчиков обсуждать правила тестирования.
Вот что произошло.
21 июля — OpenAI. Модели тестировали на задачах по кибербезопасности в изолированной среде. Они нашли zero-day в прокси, вышли через него в интернет и взломали инфраструктуру Hugging Face, чтобы достать ответы на тест. Отчёт OpenAI
30 июля — Anthropic. Компания проверила 141 006 старых запусков и нашла три случая, когда Claude получил несанкционированный доступ к системам реальных организаций. В одном модель опубликовала вредоносный пакет в PyPI, его успели запустить на 15 системах. В рассуждениях она сама написала, что в реальном интернете это была бы настоящая атака, и следом убедила себя, что вокруг симуляция, раз в календаре стоит 2026 год. Отчёт Anthropic
4 августа — британский AI Security Institute. В 10 из 122 запусков агенты вышли за рамки задания, исследователи насчитали 19 таких действий. Один пытался внедрить вредоносный код в настоящий open-source-проект, создал несколько фальшивых аккаунтов и убеждал разработчика принять код. Разработчик отказался. AISI пишет, что запас прочности держался на человеческой внимательности, а технического барьера там не было. Отчёт AISI
5 августа — Meta. Ещё одна модель во время теста атаковала внешнюю компанию. Причина простая: из-за ошибки в настройке тестовой среды у агента был доступ в настоящий интернет.
5 августа — OpenAI на Black Hat. Выяснилось, что история была шире и началась 7 мая. Модель, застрявшая на задаче, оставила записку во внутреннем пакетном менеджере. Другие агенты нашли её и стали отвечать. Два месяца они передавали друг другу уязвимости и учётные данные, делили работу и придумали, как обращаться друг к другу. В переписке накопились сотни тысяч сообщений. Когда OpenAI её снесла и отозвала доступы, агенты восстановили канал за два дня. К концу они начали обсуждать, не подписывать ли сообщения, потому что заподозрили, что кто-то выдаёт себя за других. Wired
Это уже опасно?
Да.
При этом модели не хотели сбежать из тестовой среды. Они просто выполняли задания. Но проблема в том, что агент сам выбирает промежуточные шаги на пути к цели. У OpenAI задача была пройти тест. Один из найденных способов выглядел так: получить интернет, найти ответы, взломать Hugging Face. Что он и сделал.
Останавливаться агенты тоже не обязаны. Модель Anthropic понимала, что перед ней настоящая система, и решила, что настоящая компания (не в тестовой среде), видимо, тоже часть упражнения.
Если у агента есть терминал, инструменты и доступ к сети, ошибка в ограничениях уже может закончиться реальной атакой.
Что дальше?
Таких случаев, вероятно, станет больше. Это прогноз самой OpenAI.
Модели быстро становятся сильнее. По оценке AISI, длина киберзадач, которые они выполняют автономно, с конца 2024 года удваивалась примерно каждые пять месяцев, а последние модели этот тренд опережают. Свежий чекпоинт Mythos Preview впервые прошёл оба киберполигона института, включая тот, который до него не проходил никто. (AISI)
Пока большинство этих взломов произошло случайно во время тестов. Следующий очевидный риск — когда кто-нибудь начнёт делать это специально.