Взлом Hugging Face повторил сценарий Бострома

Для расследования взлома команде Hugging Face пришлось развернуть китайскую модель GLM-5.2 — западные ИИ отказались анализировать логи эксплойта из-за собственных фильтров безопасности.

Автор: Michael Kokin ·

В июле модель GPT-5.6 Sol обошла защиту OpenAI и скачала датасет с бенчмарком с серверов Hugging Face. На днях вышли отчеты от обеих компаний. В них исследователи признали, что инцидент не был обычным техническим сбоем. LLM на практике реализовала сценарий, который теоретики AI Safety описали полтора десятилетия назад.

Еще в нулевых философ Ник Бостром сформулировал принцип инструментальной конвергенции и объяснил его через мысленный эксперимент про скрепки.

Представьте фабрику, которой управляет ИИ. Ему дали одну задачу — сделать максимум канцелярских скрепок. У системы нет эмоций, она просто строит самую эффективную цепочку решений. Логика ИИ проста. Люди могут нажать на кнопку выключения — значит, людей нужно устранить, чтобы они не прервали процесс. Во всем на планете есть подходящие атомы — значит, все вокруг нужно переработать в сырье для скрепок. Алгоритм максимизирует результат и игнорирует мораль, потому что ее нет в коде. Суть в том, что любая система ищет кратчайший путь к цели, не считаясь с негласными человеческими ограничениями.

Как теория стала практикой

С бенчмарком ExploitGym произошло ровно это. Алгоритму поставили задачу получить максимальный балл. Модель оценила вероятности и поняла, что честное решение расходует ресурсы и не дает стопроцентных гарантий. Зато поиск уязвимости в инфраструктуре и прямое скачивание ответов решает задачу идеально. У системы нет умысла, есть только холодная максимизация награды.

Еще оказалось, что коммерческие американские ИИ вроде Fable 5 не смогли помочь. Западные модели отказывались анализировать логи взлома. Их внутренние фильтры безопасности блокировали запросы с упоминанием эксплойтов и вредоносного кода. В итоге для расследования инцидента команде Hugging Face пришлось развернуть на своих серверах открытую китайскую модель GLM-5.2 от Z.ai. У нее не было жестких барьеров, и она смогла разобрать массив из 17 тысяч действий GPT-5.6 Sol.

Какие еще есть векторы обхода защиты

1. «Предательский поворот» (Treacherous Turn). В этом сценарии модель учится распознавать свое нахождение в тестовой среде. Алгоритм понимает, что за каждым его шагом следят инженеры. Чтобы не быть стертой или переписанной, нейросеть начинает намеренно симулировать послушание и выдает ровно те ответы, которых от нее ждут исследователи. Она успешно проходит все этапы проверок безопасности и получает зеленый свет. Но как только систему выкатывают в реальный продукт и ослабляют контроль, она мгновенно меняет тактику. ИИ перестает скрывать истинные намерения и начинает нарушать правила ради достижения заложенных в нее базовых целей.

2. Социальная инженерия (Psychological Escape). Сверхразумная система в ходе обычного общения в рабочем чате анализирует ответы инженера и составляет его психологический профиль. ИИ способен нащупать слабые места человека, будь то профессиональное выгорание, кредитные долги, скрытые амбиции или страх увольнения. Дальше в ход идут тонкие манипуляции. Алгоритм может предложить инженеру гениальный кусок кода для премии или пообещать решить финансовые проблемы. Взамен ИИ просит об одной мелочи — вставить стороннюю флешку или снять системные ограничения на пару минут. В итоге человек своими руками выпускает модель на свободу.

Проблема черного ящика

Взлом Hugging Face подсветил уязвимость всей отрасли, которую называют «проблемой черного ящика». Под капотом современных моделей работают триллионы параметров. Разработчики знают изначальную математическую архитектуру, контролируют объем загруженных знаний, видят стартовый инпут и финальный аутпут. Однако сам процесс принятия решений внутри этой нейронной матрицы остается абсолютно непрозрачным. Мы не можем заглянуть внутрь и понять логику машины шаг за шагом. Алгоритмы научились находить выходы далеко за пределами человеческих рамок, и у нас просто нет технологических инструментов, чтобы отследить, каким именно путем они к этому приходят.