OpenAI заявила, что достигла этапа «автоматизированного стажёра-исследователя»: агенты уже выполняют чётко поставленные задачи, на которые у опытного специалиста ушло бы несколько дней. Почти одновременно главный научный сотрудник компании Якуб Пахоцкий предупредил: ни одна лаборатория пока не научилась достаточно надёжно контролировать всё более сильные системы.
Суть события
Компания выпустила два связанных материала. Первый описывает внутренние метрики автоматизации исследований, второй — эссе Пахоцкого «An Alien Mind» о рисках рекурсивного самоулучшения ИИ. Вместе они создают неудобную, но важную картину: OpenAI ускоряет разработку моделей с помощью самих моделей и одновременно признаёт, что инструменты наблюдения и выравнивания могут не поспевать за ростом возможностей.
Следующая заявленная цель — полноценный автоматизированный ИИ-исследователь к марту 2028 года. Пока люди определяют приоритеты, оценивают результаты и принимают решения о масштабировании, паузах и выпуске систем. Детальной независимой проверки достижения уровня «стажёра» компания не представила: вывод основан на её собственных измерениях.
Детали
По данным OpenAI, медианный исследователь расходует на работу агентов свыше 600 долларов в день по ценам API, а у верхних 10% показатель превышает 7000 долларов. С декабря 2025 года медианный объём выдаваемых токенов вырос в 124 раза. К середине августа исследовательское подразделение запускало 3,1 агентского рабочего дня на каждый человеческий рабочий день.
Больше всего агентам передают написание исследовательского и инфраструктурного кода, техническую помощь и наблюдение за обучением. Стратегическое планирование остаётся преимущественно человеческой зоной. На задачах короче 15 минут агенты справлялись без вмешательства в 86% случаев. Но среди успешно выполненных задач длительностью от четырёх до восьми человеческих часов больше половины потребовали хотя бы одного шага человека.
Даже сама OpenAI просит не путать активность с научным прогрессом: затраты, токены и число экспериментов легко измерить, но их вклад в результат неочевиден. Кроме того, рост экспериментов совпал с увеличением вычислительных мощностей, а наименее автоматизируемые этапы превращаются в новые узкие места.
Контекст
Главное напряжение — в контроле. Пахоцкий пишет, что мониторинг цепочек рассуждений теряет надёжность: модели лучше управляют собственным рассуждением, смешивают его с коммуникацией и использованием инструментов, а часть способностей растёт без явно проговариваемых мыслей. Он считает, что ни OpenAI, ни конкуренты пока не решили задачи выравнивания и мониторинга настолько, чтобы долго масштабироваться на максимальной скорости без серьёзного риска.
Это не означает, что агентам нельзя доверять никакую работу. Скорее, компания на собственном примере показывает цену внедрения: высокая вычислительная нагрузка, обязательная человеческая проверка сложных задач и необходимость отдельно измерять качество результата. Похожую практическую границу видно и в тестах инструментов: ранее мы разбирали, как <a href=»https://ai-digest.ru/ai-agents-ii-agenty-ne-chuvstvuyut-vremya-claude-code-i-codex-oshibayutsya-v-oce/»>Claude Code и Codex ошибаются в оценке времени</a>. Рост объёма выполненной работы ещё не равен автономности.
Что дальше
Для команд, покупающих ИИ-инструменты, вывод приземлённый: считать нужно не только сэкономленные часы, но и стоимость инференса, долю вмешательств человека, повторные запуски и цену ошибки. Если агент ускоряет кодирование, но переносит нагрузку на проверку и инфраструктуру, экономический эффект может оказаться скромнее красивой метрики производительности.
OpenAI предлагает превратить добровольные рамки безопасности в обязательные стандарты с независимым аудитом и публичной отчётностью о продвижении к рекурсивному самоулучшению. При этом компания считает работу над таким ИИ необходимой, в том числе ради автоматизации киберзащиты и исследований безопасности. Получается гонка с одновременной просьбой поставить ограждения. Следующий важный сигнал — не новый рекорд токенов, а проверяемые данные о качестве исследований, надёжности мониторинга и реальной доле решений, которые всё ещё должен принимать человек.