Оказалось, это довольно залипательная игра. Гордиться мне, правда, нечем: этот тест любой человек (ну почти) сделает на интуиции, зато топовые ИИ-модели набирают на нём меньше процента. Называется он ARC-AGI-3. Хочу рассказать, почему это сейчас один из самых интересных бенчмарков.
Зачем вообще нужен ARC-AGI
Современные нейросети натасканы на терабайтах текстов и отлично справляются с задачами, похожими на то, что они уже видели. Но если дать им что-то по-настоящему новое, задачу, для которой нельзя вспомнить готовый паттерн, они часто ломаются. При этом обычный человек такую задачу решает легко.
Исследователь Франсуа Шолле (создатель Keras) давно утверждает, что индустрия неправильно измеряет интеллект. Популярные бенчмарки награждают способность запоминать, а не способность разбираться в незнакомых ситуациях. ARC-AGI — его попытка это исправить.
Что было раньше (версии 1 и 2)
Первые версии — это головоломки с цветными сетками. Тебе показывают пару примеров «было → стало», и нужно понять правило трансформации, а потом применить его к новой сетке. Никаких инструкций, догадайся сам. Первые версии измеряли «пассивный» подвижный интеллект, способность видеть закономерность в незнакомых данных. Но лаборатории научились такие тесты добивать: вторую версию модели прошли примерно за год, Gemini сделал на ней 77%.
Что нового в ARC-AGI-3
Третья версия — это принципиальный сдвиг. Вместо статичных головоломок там теперь интерактивные среды, похожие на видеоигры. Агент должен действовать в несколько шагов, исследовать мир, планировать и адаптироваться. Игры не дают инструкций, игрок сам разбирается в правилах.
По сути, ИИ бросают в незнакомую игру и смотрят, сможет ли он сам понять, что происходит, и начать действовать осмысленно? Ключевая метрика теперь не решил ты задачу или нет, а эффективность решения, то есть сколько шагов для этого понадобилось. Причём разницу возводят в квадрат, так что тыкать наугад больше невыгодно.
Почему это важно
Для людей эти задачи лёгкие и даже увлекательные, а ИИ-агенты буксуют. Даже мощнейшие модели теряются там, где нужно исследовать, строить гипотезы и помнить, что уже пробовал. На старте в марте люди прошли 100% заданий, а лучший из ИИ, Gemini 3.1 Pro, набрал 0.37%.
Но, как мы знаем, и об этом не нужно забывать, ИИ развивается по экспоненте. Так что к июлю лидером стал GPT-5.6 с 7.8%, это в двадцать раз больше мартовского рекорда. С прошлыми версиями было так же. Сначала бенчмарки держались, а потом ИИ резко подтягивался и решал все задачи.
В общем, ARC-AGI-3 проверяет, умеет ли ИИ учиться на лету в незнакомой ситуации, а не просто хорошо вспоминать. Это, мне кажется, довольно прикольная штука. Ну и это один из бенчей, где человек может (пока что) почувствовать себя непревзойденным. Потому что ни одна система не прошла его на уровне человека. И пройти его можно самому прямо в браузере. Вперед — тешить самолюбие!