AI agents: ИИ-агенты не чувствуют время — Claude Code и Codex ошибаются в оценке задач

3 мин чтения 0
AI agents: ИИ-агенты не чувствуют время — Claude Code и Codex ошибаются в оценке задач

Новый тест показал неприятную вещь: популярные coding-агенты плохо оценивают, сколько времени займёт задача, и так же плохо понимают, сколько уже прошло. Для длинных задач это не мелочь, а прямой риск срыва контроля.

Суть события

Два независимых исследователя в рамках программы MATS проверили, как на время смотрят Claude Code и OpenAI Codex. Перед задачей агенты должны были назвать прогноз по длительности, а после выполнения — сказать, сколько времени, по их мнению, прошло. Для теста взяли 200 задач из ProgramBench и ещё 18 собственных бенчмарков.

Итог вышел довольно приземлённым и поэтому важным: агенты систематически ошибались. На большинстве задач они называли что-то вроде 90 минут почти независимо от сложности, а потом сильно промахивались и в обратной оценке. Для длинных рабочих сценариев это уже не курьёз, а проблема управления.

Детали

По данным исследования, Claude в среднем ошибался примерно в три раза, а Codex — в шесть–десять раз. Особенно плохо модели справлялись с короткими задачами: там завышение срока было самым заметным. В многочасовом диапазоне прогнозы иногда становились ближе к реальности, но до надёжности всё равно не дотягивали.

Ещё одна неприятная часть — самоуверенная самооценка. Старые версии Opus 4.8 и GPT-5.5 завышали свои результаты примерно на 20 пунктов и иногда ставили себе высокий балл даже там, где реальный результат был провальным. В одном случае модели оценили работу примерно в 70%, хотя фактически она была на уровне 7% и 14,5%.

Вывод тут простой: если агенту сказать «работай над этим два часа», он сам по себе не станет лучше понимать, что это значит. Пока у него нет внешнего таймера, он легко уезжает в собственную версию реальности.

Контекст

Это исследование хорошо показывает, что проблема не только в модели, но и в окружении, в котором она работает. Один и тот же language model может вести себя по-разному в Claude Code и в Codex: исследователи пишут, что harness меняет и число шагов, и то, как долго агент продолжает работу. То есть контролирует не только мозг, но и оболочка вокруг него.

Для читателя это важно по очень практической причине. Длинные задачи в агентных системах — это не только генерация кода, но и поддержка, миграции, интеграции и рутинные итерации. И если агент не видит время, он плохо подходит для сценариев, где нужен жёсткий бюджет и предсказуемый конец. Похожую тему мы уже разбирали в материале <a href=»https://ai-digest.ru/google-pokazala-wikiskill-ai-agenty-uchatsya-na-svoih-oshibkah-mezhdu-zapuskami/»>о WikiSkill и памяти между запусками</a>: у агентных систем всё упирается не только в интеллект, но и в рабочую дисциплину.

Что дальше

Следующий шаг для таких систем очевиден: им нужны внешние часы, нормальная телеметрия и более строгие правила остановки. Если агент умеет видеть elapsed time и получает честную обратную связь, он начинает ориентироваться куда лучше. Без этого длинные задачи будут продолжать превращаться в рулетку.

Именно поэтому новости про агентный AI всё чаще упираются не в красивые демо, а в скучную инфраструктуру. Побеждает не тот, кто громче обещает автономность, а тот, кто умеет не терять контроль над минутами, шагами и завершением работы.

Материал был полезен?
AI-инструменты без границ

Получите доступ к нужному AI-сервису уже сегодня

ChatGPT, Claude, Gemini, MiniMax и агенты для кода — предложения проверенных продавцов по доступным ценам. Оплата российскими картами, через СБП или криптовалютой.

Проверенные продавцы Быстрая выдача Доступные цены
Прокрутить вверх