Что показал тест CEO-Bench
Исследователи из Принстонского университета создали бенчмарк CEO-Bench, в котором AI-агенты управляют виртуальной софтверной компанией NovaMind в течение 500 симулированных дней. Компания начинает с миллиона долларов на счету и нулевой клиентской базой. Финальная оценка — остаток на банковском счёте. Если баланс хотя бы раз уходит в минус, симуляция останавливается, а компания считается обанкротившейся.
AI-агент управляет фирмой через Python API с 34 инструментами и базой данных из 19 таблиц. Вместо простых одиночных команд он пишет собственный код, формирует SQL-запросы и выстраивает рабочие процессы на основе результатов. По сути, это полноценная имитация задач реального CEO — расстановка приоритетов, распределение ресурсов, интерпретация нечётких сигналов и адаптация к меняющимся условиям.
Какие модели справились, а какие — нет
Из всех протестированных моделей лишь три завершили 500-дневную гонку с остатком на счету выше начального миллиона. Подавляющее большинство AI-систем обанкротились — причём простая эвристика на основе правил без какого-либо AI обошла по результатам почти все модели. Это говорит о том, что текущие AI-агенты хорошо справляются с узкими задачами: исправить баг, провести диалог по политике сервиса, завершить веб-workflow. Но управление компанией — это совсем другая история.
Результаты Princeton показывают интересную асимметрию: модели, которые хуже всего справлялись с бизнес-задачами, при этом лидировали в узких AI-бенчмарках. Это подтверждает давно известную проблему переобучения на специализированных тестах — модель может блестяще решать задачу X, но полностью проваливаться в задачу Y, которая от X лишь немного отличается.
Почему AI проваливает там, где справляется человек
Ключевая проблема — структура задач. Типичные тесты для AI-агентов дают чёткую цель, короткое действие и быструю обратную связь. Реальный бизнес устроен иначе: длинные цепочки решений в условиях неопределённости, где нужно одновременно учитывать множество противоречивых факторов. Модели склонны к импульсивным тратам, не умеют грамотно распределять ресурсы между проектами и не могут должным образом оценивать долгосрочные риски.
Интересно, что даже лучшие модели показывали серьёзные провалы в отдельные симулированные дни, прежде чем в целом выйти в плюс. Это указывает на то, что устойчивость к неопределённости — не сильная сторона текущих LLM в условиях автономной работы.
Что это значит для индустрии AI-агентов
CEO-Bench наглядно демонстрирует разрыв между способностью AI выполнять конкретные задачи и возможностью ставить долгосрочные цели. Компании, которые сейчас вкладывают в AI-агентов для бизнес-процессов, должны учитывать: автоматизация отдельных функций ещё не означает, что AI способен заменить стратегическое управление. Пока модели не научатся мыслить на горизонте в сотни «дней» — они останутся помощниками с известными ограничениями, а не руководителями.
Впрочем, результаты не означают, что AI-агенты бесполезны для бизнеса. Они отлично работают в роли помощников при принятии решений — но сами решения должны оставаться за людьми. Особенно в условиях неопределённости, где требуется взвешивать множество противоречивых факторов, AI пока проигрывает даже простым эвристикам.
Подробные результаты и методология опубликованы командой Princeton.