Adversarial design: шрифты и картинки, которые ИИ не может прочесть

Decoy Font, Ghost Font, Glaze и Nightshade — четыре проекта adversarial design, которые используют уязвимости машинного зрения для защиты контента от автоматического скрейпинга.

Автор: Michael Kokin ·

Наткнулся на несколько проектов по созданию шрифтов и картинок, которые работают как оптические иллюзии для нейросетей. Человек, глядя на экран, легко считывает «Happy human», а робот видит совершенно другой текст — например, «Sorry, robot».

Алгоритмы видят мир не нашими глазами. Они опираются на голые вычисления и не умеют понимать контекст так, как это делает человеческий мозг. Запутать их архитектуру программно — это сейчас один из главных способов защитить свой контент от скрейпинга.

Вот несколько проектов, которые красиво эксплуатируют уязвимости современных ИИ-моделей:

Decoy Font: манипуляция пространственными частотами

Шрифт от разработчиков из Mixfont. В каждый его символ интегрированы два слоя данных. В качестве «приманки» выступают тонкие, высококонтрастные линии, в то время как настоящий текст формируется за счет менее контрастных, массивных форм на заднем плане.

Модели компьютерного зрения натренированы фокусироваться на четких границах пикселей (высоких пространственных частотах). В результате алгоритмы мгновенно считывают ложный текст. Человеческий мозг, напротив, способен отфильтровать тонкие линии при небольшом отдалении от экрана, без труда считывая скрытое сообщение.

Ghost Font: темпоральная слепота моделей

Прототип, разработанный исследователем Эриком Лу. Это не статический шрифт, а видео-иллюзия, где сообщение формируется исключительно за счет движения множества точек.

Человеческое восприятие легко интегрирует движение, выстраивая из шума читаемые формы. Большинство мультимодальных систем ИИ пока анализируют видео не в потоке, а через извлечение статичных кадров. В любом отдельном кадре Ghost Font присутствует только шум и заложенная автором статичная приманка. В ходе тестов флагманские модели анализировали кадры длительное время и в итоге выдавали уверенную галлюцинацию.

Защита изображений: Glaze и Nightshade

Текстовые иллюзии — часть более широкого направления, состязательного дизайна (adversarial design). Аналогичные уязвимости активно используются для защиты визуальных данных от парсинга.

Инструменты вроде Glaze и Nightshade накладывают на изображения математический шум. Для обычного зрителя арт остается неизменным, но компьютерное зрение считывает другой стиль или полностью ошибается в классификации объектов (распознавая, например, сумку вместо собаки).

Вообще, подобные проекты выходят далеко за рамки концептов для новых CAPTCHA (хотя агенты пока и обычную пройти не могут). Они формируют первые реальные механизмы, позволяющие авторам защищать свой контент от автоматизированного скрейпинга алгоритмами.

Кроме того, они подсвечивают серьезную проблему современных систем. Машинное зрение по-прежнему не способно к целостному пониманию контекста и динамики, оставаясь зависимым от прямолинейного статистического анализа пикселей.