AGI уже здесь. Но это ещё не точно

OpenAI объявила эру AGI, Nvidia — что он уже наступил, а создатели теста, который Astra якобы прошла на 99,9%, отказываются называть это AGI. Разбираюсь, с чем нас поздравляют, и почему мне всё меньше важно само название.

Автор: Michael Kokin ·

Третьего сентября OpenAI выпустила GPT-6 Astra, и Грег Брокман закончил брифинг фразой «Добро пожаловать в эру AGI». Через три дня Дженсен Хуанг написал в X, что AGI наступил, — и в том же твите, что следующие 400 тысяч GPU уже на подходе. Человек, который продаёт видеокарты, — не то чтобы незаинтересованная сторона, но ладно.

Прочитал. Не обрадовался, не взгрустнулось — скорее захотелось уточнить: а с чем нас, собственно, поздравляют? Потому что за те лет тридцать, что индустрия произносит эти три буквы, она так и не договорилась, что они значат.

У OpenAI в уставе AGI — это «высокоавтономные системы, превосходящие людей в большей части экономически ценной работы». То есть не «думает как человек», а «делает работу за человека». Разные вещи, и разница между ними внезапно стала очень дорогой. Шахматная программа давно обыгрывает любого гроссмейстера, калькулятор считает быстрее Эйнштейна — и никто их пока не поздравлял. Всё держится на слове general, общий. А дальше у каждого своя линейка — широта, самообучение, умение не потеряться в незнакомой комнате. Договориться, кажется, некому.

При этом Astra действительно не «ещё на 12% лучше в тесте». Главное в ней не ответы, а действия: она сама ходит по браузеру, заполняет формы, правит документы, собирает сайты. На Agents' Last Exam (это когда нейросеть сажают в настоящий рабочий софт — финмодели, инженерные расчёты, монтаж — и смотрят, что она там наделает) у неё 59%, и работает она почти вдвое быстрее прошлого поколения. Нейросеть перестаёт быть штукой, которой говорят «объясни, как сделать», и становится штукой, которой говорят «сделай». Я это чувствую и на себе: недавно собрал рилс целиком внутри ChatGPT — не спрашивал, как монтировать, а просто поставил задачу. Коллеги потом уточняли: «Это в Codex?» Нет. В чате.

Самая красивая цифра релиза — 99,9% на ARC-AGI-3, тесте Франсуа Шолле, который проверяет, сумеет ли система разобраться в мире с незнакомыми правилами. Интернет от неё, понятно, немного сломался. Но есть нюанс, и не один. 99,9% получены в собственном адаптере OpenAI, где модель ведёт с тестом непрерывный диалог и не теряет контекст между ходами, а через стандартный харнесс ARC — 62,7%. Обе цифры честные, просто отвечают на разные вопросы. И сам Шолле на прямой вопрос «так это AGI?» отвечает суше некуда: «Мы этого не утверждаем. Всё, что мы пока знаем о системе, — её результаты в бенчмарках». ARC — набор замкнутых сред с понятными правилами и судьёй, который через пять минут скажет «молодец». В реальной работе «молодец» никто не говорит, а задачу часто ещё и сформулировать некому.

Гэри Маркус, главный профессиональный скептик, отреагировал предсказуемо, но, по-моему, точно: объявлять победу без определения — «просто мутить воду». Сначала индустрия десятилетиями пользуется туманным словом, потом появляется сильная модель, а потом определение подстраивается под неё. В науке, вообще-то, критерии принято писать до эксперимента. Но у нас тут не наука, у нас релизы.

Забавно, что Anthropic, выпустившая почти в ту же неделю Claude Fable 5.1 (а та вышла на первое место в Intelligence Index от Artificial Analysis), никакой эры не объявляла. Возможности примерно те же, но у OpenAI — начало эпохи, а у Anthropic просто вышла новая версия Claude. И там же, у Fable, лежит вещь поважнее аббревиатур: модель стала умнее — и одновременно чаще предпочитает уверенно ошибиться, чем сказать «не знаю». На вопросах, где она неправа, она всё равно лезет отвечать в 72,6% случаев (у предыдущей версии — в 63,6%). Тупая программа ошибается очевидно. Очень умная — убедительно. И вот такую — умную, самостоятельную и через раз надёжную — очень хочется считать сотрудником. Зря.

Мне кажется, мы просто ждём слишком театрального AGI. Вот вчера был чат-бот, в 14:32 инженеры нажали Enter, монитор засветился, машина сказала «Добрый день, Миша, я осознала себя», заиграл Ханс Циммер. Так не будет. Интернет тоже не наступил в какой-то конкретный вторник. В 2023-м нейросеть писала тексты, в 2024-м — код, в 2025-м работала с инструментами, в 2026-м сама сидит за компьютером. В какой точке между ними AGI? Не уверен, что точка вообще существует. Может, и не нужна.

Так что «мы, возможно, вошли в раннюю эпоху AGI» звучит, по-моему, куда честнее, чем «AGI достигнут, расходимся». Про ASI, понятно, пока даже не начинали.

Но чем дольше я об этом думаю, тем схоластичнее кажется весь спор. Есть вопрос полезнее любых трёх букв: какую часть моей работы эта штука уже делает без меня. И второй, совсем не сексуальный, — сколько после неё придётся переделывать. Когда ответ на первый станет «почти всю», а на второй — «почти ничего», спор о дате наступления AGI закончится сам собой. А я пока пойду поставлю ей следующую задачу — и посчитаю, сколько потом переделывать.

P.S. И ещё. Мы ведь и про себя так и не договорились, что такое общий интеллект. С чем тогда сравниваем?