Google показала WikiSkill: AI-агенты учатся на своих ошибках между запусками

4 мин чтения 0
Google показала WikiSkill: AI-агенты учатся на своих ошибках между запусками

Google предложила для AI-агентов рабочую замену непрерывной памяти: сырые трассы сохраняются, ошибки и удачные ходы складываются в постоянную вики, а сверху живут навыки, которые можно откатывать. Это не магия самообучения, но довольно практичный способ перестать повторять одни и те же промахи.

Суть события

Google исследует подход WikiSkill — схему, которая помогает AI-агентам накапливать опыт между запусками. Идея простая: агент не просто выполняет задачу и забывает всё, что было вокруг неё, а оставляет после себя следы работы, из которых потом можно извлечь полезные правила. Авторы называют это рабочим обходом проблемы, которую до сих пор не удалось решить по-настоящему: непрерывное обучение без потери устойчивости.

Вместо одной «памяти» здесь три уровня. Raw Layer хранит полные трассы выполнения — вызовы инструментов, ответы и результат. Wiki Layer превращает этот сырой материал в накопленное знание: типовые ошибки, удачные стратегии и наблюдения. Skill Layer уже использует это знание как активные инструкции, по которым агент действует в следующем прогоне.

Детали

Схема работает по циклу. Сначала inference-агент решает задачу с текущими навыками и пишет трассу. Затем Wiki Maintainer разбирает эту трассу и добавляет в вики новые выводы. После этого Skill Proposer предлагает точечные изменения навыков на основе накопленного опыта. И только потом включается gating-механизм, который проверяет, стало ли реально лучше. Если нет — навык откатывают, но сама вики остаётся и продолжает расти.

Это важная деталь: система не стирает неудачные попытки. Даже когда предложенный навык не прошёл проверку, след от него остаётся в вики. Так следующая итерация не начинает с нуля, а опирается на уже зафиксированное знание о том, что сработало, а что нет. В статье Google и соавторы отдельно ссылаются на идею Andrej Karpathy о «LLM Wiki» — накоплении опыта в постоянную общую память вместо разовых подсказок.

Контекст

Исследователи проверили WikiSkill на пяти типах задач: математическое рассуждение, веб-поиск, работа с таблицами, вопрос-ответ по документам и интерактивные сценарии в виртуальной среде. Среди моделей были Qwen в версиях 4B, 9B и 27B, Gemma-4-31B и Gemini-3.5-Flash. На большинстве наборов WikiSkill обошёл альтернативные методы эволюции навыков и базовый режим без навыков.

По цифрам эффект выглядит заметно. Gemini-3.5-Flash вырос в среднем с 49,5% до 68,1%, а Qwen-3.6-27B — с 39,4% до 63,3%. Особенно сильный прирост виден там, где есть чёткая процедура и короткая обратная связь: математика и таблицы. А вот длинные документные контексты, вроде OfficeQA, улучшаются куда скромнее. Это как раз тот случай, когда система лучше учится на повторяемой работе, чем на длинном и рыхлом тексте.

Что дальше

Главный вывод у этой работы довольно трезвый. WikiSkill не решает проблему «настоящего» непрерывного обучения, но даёт агентам способ становиться полезнее без полного переобучения. Для продакшен-сценариев это особенно интересно: если модель умеет копить удачные стратегии и откатывать неудачные навыки, внедрение агентных систем становится менее хрупким.

Самый практичный сигнал здесь в том, что навыки, найденные одной моделью, иногда переносятся на другую. Значит, компании могут не просто улучшать отдельного агента, а собирать общую рабочую память команды систем. Именно там сейчас и лежит самый приземлённый выигрыш — меньше повторяющихся ошибок, меньше ручной донастройки и чуть больше шансов, что AI-агент завтра не наступит на те же грабли, что и сегодня.

Материал был полезен?
AI-инструменты без границ

Получите доступ к нужному AI-сервису уже сегодня

ChatGPT, Claude, Gemini, MiniMax и агенты для кода — предложения проверенных продавцов по доступным ценам. Оплата российскими картами, через СБП или криптовалютой.

Проверенные продавцы Быстрая выдача Доступные цены
Прокрутить вверх