В проекте Atria Dawn Preview агенты участвовали почти во всех изученных задачах и со временем выполняли больше действий на каждую человеческую команду. Однако цели, методы и параметры по-прежнему в основном выбирали люди — важное уточнение для команд, которые надеются получить автономного исследователя, а не очень производительного исполнителя.
Суть события
Команда с участием исследователей Фуданьского университета разобрала более 700 журналов задач от 56 участников, а также логи использованных ими агентов. Материалом послужила реальная разработка агентной языковой модели Atria Dawn Preview — системы на архитектуре mixture-of-experts с 744 млрд параметров, рассчитанной на исследовательские и инженерные задачи.
ИИ применяли в 96,5% рассмотренных задач. За четыре недели медианное число действий агента на один ввод человека выросло с 11 до 28,5. Но исследователи предупреждают: длиннее стала цепочка исполнения, а не перечень решений, которые агент принимал самостоятельно. Иными словами, делегирование выросло быстрее автономности.
Детали
Самая частая схема при выборе методов и параметров выглядела так: «ИИ предлагает, человек выбирает» — на неё пришлось 55,4% случаев. Люди приняли 85,5% решений о методах и параметрах, а агенты — 9,2%. Цели и границы задачи человек окончательно определял в 93,4% случаев. Доля предложений от ИИ менялась в зависимости от типа решения, но доля финальных решений оставалась однозначной.
При этом агенты не были просто ускорителем рутины. Из 455 завершённых задач с ИИ участники назвали 151 задачу невыполнимой без него при том же масштабе и качестве. Это примерно треть, причём такие ответы дали люди из разных частей команды, а не узкая группа опытных пользователей.
Когда возникали трудности, в 76% из 588 зафиксированных случаев работу продвигало вмешательство человека; самостоятельно агент справлялся в 23%. Обычно человек добавлял контекст, уточнял требования, диагностировал проблему или менял метод. Полностью забирать выполнение себе приходилось лишь в 0,7% случаев. После обратной связи 75,4% необходимых правок снова выполнял сам ИИ.
Контекст
Для руководителя команды и B2B-покупателя вывод довольно практичный: ценность агента сейчас лучше считать не только в сэкономленных часах. Он может расширять объём проектов, за которые команда вообще готова взяться. Но бюджет на внедрение должен включать экспертов, способных ставить цели, оценивать варианты и вовремя менять курс. Убрать этот слой — значит убрать именно тот компонент, который в исследовании чаще всего разблокировал работу.
Здесь появляется и риск формального контроля. Чем больше действий выполняется после одного решения человека, тем труднее проверить всю цепочку. Ревьюер может незаметно превратиться в человека, который лишь подтверждает готовый результат. Похожую проблему разрыва между сигналом агента и человеческой реакцией видно и в разборе о том, почему ИИ-агенты заметили взлом, но не позвали человека.
Что дальше
Командам стоит отдельно измерять три вещи: сколько операций делегировано, кто принимает финальные решения и сколько задач без ИИ не состоялось бы вовсе. Одна метрика активности агента легко создаёт ложное ощущение автономности.
Для пилотного проекта разумная схема — дать агенту готовить варианты и выполнять длинные проверяемые цепочки, а человеку оставить цели, критерии качества и право остановки. Следующий рубеж — не ещё больше шагов без участия пользователя, а способность предлагать действительно разные исследовательские направления и заранее оценивать их ценность. По данным команды Atria, именно это пока остаётся открытым вопросом.