Недавно все обсуждали Vending-Bench — симуляцию, где нейросети доверили вендинговый автомат. Агенты там жестко тупили: Claude 3.5 Sonnet запаниковал из-за «взломанного» счета и написал заявление в ФБР, а в реальном офисе Anthropic ИИ раздавал шоколадки бесплатно и галлюцинировал, что у него появилось физическое тело.
В общем, оказалось, это была не шутка, а тренировка агентов, чтобы создать из этого продукт.
Создатели бенчмарка, Andon Labs, выкатили платформу Pion, на которой ИИ-агентам можно полностью передать управление своей компанией.
Почему запуск произошел именно сейчас
Способность моделей зарабатывать растет с пугающей стабильностью. По свежим данным Vending-Bench 2, экономическая эффективность ИИ растет строго линейно — в среднем на +$822 чистой прибыли в месяц (R² = 0.95).
Если весной 2025 года модели болтались около нуля, то линейка Claude Opus и GPT-6 Astra пробили планку в $11 000–15 000 прибыли за симулированный год. Агенты банально научились вести дела в плюс.
Как Pion устроен внутри
Это не один всесильный чат-бот, а распределенная программная система:
- **ИИ-сотрудники как код.** Каждый агент компании изолирован в отдельном репозитории на GitHub.
- **Агенты сами пишут софт.** Их ключевая задача — кодить скрипты под свои рутинные операции, снижая число ошибок.
- **Корпоративный Slack для нейросетей.** Боты разделены по отделам (закупки, финансы, маркетинг) и коммуницируют между собой и с основателями через единый слой сообщений.
Агент получает реальные рычаги: банковские счета, почту, телефонию, браузер и серверные мощности.
Кто этим пользуется, сколько стоит и как подключиться
Продукт находится в режиме закрытой беты — доступ выдают по заявкам.
Официального публичного прайса нет: основные затраты придутся на API-токены, так как штат агентов непрерывно общается, генерирует и тестирует код.
Первые отзывы с HackerNews подтверждают: агентам уже отдают операционку и лидогенерацию. Но есть нюанс — как и живым джунам, нейросетям требуются недели онбординга, чтобы въехать в контекст конкретного бизнеса.
Почему это безопасно (и агент не напишет в ФБР снова)
Вместо надежды на «идеальный промпт» Andon Labs внедрили искусственную бюрократию:
- **Кросс-чек моделями.** Критические действия не исполняются вслепую: задачу, спланированную Claude, валидирует агент на Gemini или GPT.
- **Изоляция доступов.** У агентов нет root-прав: взбесившийся бот-закупщик физически не дотянется до клиентской базы или мастер-счета компании.
- **Иерархия.** Боты-менеджеры непрерывно прогоняют тесты и следят, чтобы действия исполнителей не противоречили базовым KPI бизнеса.
Что это значит для рынка
«ИИ-помощник» больше никому не нужен. Andon Labs (в очередной раз) фиксирует переход к Service-as-a-Software — модели, где агент не советует, а выполняет бизнес-функцию под ключ. Главной метрикой крутости ИИ становятся не бенчмарки в вакууме, а P&L (отчет о прибылях и убытках).
Будет прикольно, когда (и если) агенты смогут совершать автономные сделки за нас. То есть мой агент подойдет к агенту продавца, уточнит условия, поторгуется и купит, что мне нужно. Agent2agent economy!