Только три AI-модели из многих не обанкротились в симуляции стартапа

3 мин чтения 0
Только три AI-модели из многих не обанкротились в симуляции стартапа

Что показал тест CEO-Bench

Исследователи из Принстонского университета создали бенчмарк CEO-Bench, в котором AI-агенты управляют виртуальной софтверной компанией NovaMind в течение 500 симулированных дней. Компания начинает с миллиона долларов на счету и нулевой клиентской базой. Финальная оценка — остаток на банковском счёте. Если баланс хотя бы раз уходит в минус, симуляция останавливается, а компания считается обанкротившейся.

AI-агент управляет фирмой через Python API с 34 инструментами и базой данных из 19 таблиц. Вместо простых одиночных команд он пишет собственный код, формирует SQL-запросы и выстраивает рабочие процессы на основе результатов. По сути, это полноценная имитация задач реального CEO — расстановка приоритетов, распределение ресурсов, интерпретация нечётких сигналов и адаптация к меняющимся условиям.

Какие модели справились, а какие — нет

Из всех протестированных моделей лишь три завершили 500-дневную гонку с остатком на счету выше начального миллиона. Подавляющее большинство AI-систем обанкротились — причём простая эвристика на основе правил без какого-либо AI обошла по результатам почти все модели. Это говорит о том, что текущие AI-агенты хорошо справляются с узкими задачами: исправить баг, провести диалог по политике сервиса, завершить веб-workflow. Но управление компанией — это совсем другая история.

Результаты Princeton показывают интересную асимметрию: модели, которые хуже всего справлялись с бизнес-задачами, при этом лидировали в узких AI-бенчмарках. Это подтверждает давно известную проблему переобучения на специализированных тестах — модель может блестяще решать задачу X, но полностью проваливаться в задачу Y, которая от X лишь немного отличается.

Почему AI проваливает там, где справляется человек

Ключевая проблема — структура задач. Типичные тесты для AI-агентов дают чёткую цель, короткое действие и быструю обратную связь. Реальный бизнес устроен иначе: длинные цепочки решений в условиях неопределённости, где нужно одновременно учитывать множество противоречивых факторов. Модели склонны к импульсивным тратам, не умеют грамотно распределять ресурсы между проектами и не могут должным образом оценивать долгосрочные риски.

Интересно, что даже лучшие модели показывали серьёзные провалы в отдельные симулированные дни, прежде чем в целом выйти в плюс. Это указывает на то, что устойчивость к неопределённости — не сильная сторона текущих LLM в условиях автономной работы.

Что это значит для индустрии AI-агентов

CEO-Bench наглядно демонстрирует разрыв между способностью AI выполнять конкретные задачи и возможностью ставить долгосрочные цели. Компании, которые сейчас вкладывают в AI-агентов для бизнес-процессов, должны учитывать: автоматизация отдельных функций ещё не означает, что AI способен заменить стратегическое управление. Пока модели не научатся мыслить на горизонте в сотни «дней» — они останутся помощниками с известными ограничениями, а не руководителями.

Впрочем, результаты не означают, что AI-агенты бесполезны для бизнеса. Они отлично работают в роли помощников при принятии решений — но сами решения должны оставаться за людьми. Особенно в условиях неопределённости, где требуется взвешивать множество противоречивых факторов, AI пока проигрывает даже простым эвристикам.

Подробные результаты и методология опубликованы командой Princeton.

Материал был полезен?
AI-инструменты без границ

Получите доступ к нужному AI-сервису уже сегодня

ChatGPT, Claude, Gemini, MiniMax и агенты для кода — предложения проверенных продавцов по доступным ценам. Оплата российскими картами, через СБП или криптовалютой.

Проверенные продавцы Быстрая выдача Доступные цены
Прокрутить вверх