Google предложила для AI-агентов рабочую замену непрерывной памяти: сырые трассы сохраняются, ошибки и удачные ходы складываются в постоянную вики, а сверху живут навыки, которые можно откатывать. Это не магия самообучения, но довольно практичный способ перестать повторять одни и те же промахи.
Суть события
Google исследует подход WikiSkill — схему, которая помогает AI-агентам накапливать опыт между запусками. Идея простая: агент не просто выполняет задачу и забывает всё, что было вокруг неё, а оставляет после себя следы работы, из которых потом можно извлечь полезные правила. Авторы называют это рабочим обходом проблемы, которую до сих пор не удалось решить по-настоящему: непрерывное обучение без потери устойчивости.
Вместо одной «памяти» здесь три уровня. Raw Layer хранит полные трассы выполнения — вызовы инструментов, ответы и результат. Wiki Layer превращает этот сырой материал в накопленное знание: типовые ошибки, удачные стратегии и наблюдения. Skill Layer уже использует это знание как активные инструкции, по которым агент действует в следующем прогоне.
Детали
Схема работает по циклу. Сначала inference-агент решает задачу с текущими навыками и пишет трассу. Затем Wiki Maintainer разбирает эту трассу и добавляет в вики новые выводы. После этого Skill Proposer предлагает точечные изменения навыков на основе накопленного опыта. И только потом включается gating-механизм, который проверяет, стало ли реально лучше. Если нет — навык откатывают, но сама вики остаётся и продолжает расти.
Это важная деталь: система не стирает неудачные попытки. Даже когда предложенный навык не прошёл проверку, след от него остаётся в вики. Так следующая итерация не начинает с нуля, а опирается на уже зафиксированное знание о том, что сработало, а что нет. В статье Google и соавторы отдельно ссылаются на идею Andrej Karpathy о «LLM Wiki» — накоплении опыта в постоянную общую память вместо разовых подсказок.
Контекст
Исследователи проверили WikiSkill на пяти типах задач: математическое рассуждение, веб-поиск, работа с таблицами, вопрос-ответ по документам и интерактивные сценарии в виртуальной среде. Среди моделей были Qwen в версиях 4B, 9B и 27B, Gemma-4-31B и Gemini-3.5-Flash. На большинстве наборов WikiSkill обошёл альтернативные методы эволюции навыков и базовый режим без навыков.
По цифрам эффект выглядит заметно. Gemini-3.5-Flash вырос в среднем с 49,5% до 68,1%, а Qwen-3.6-27B — с 39,4% до 63,3%. Особенно сильный прирост виден там, где есть чёткая процедура и короткая обратная связь: математика и таблицы. А вот длинные документные контексты, вроде OfficeQA, улучшаются куда скромнее. Это как раз тот случай, когда система лучше учится на повторяемой работе, чем на длинном и рыхлом тексте.
Что дальше
Главный вывод у этой работы довольно трезвый. WikiSkill не решает проблему «настоящего» непрерывного обучения, но даёт агентам способ становиться полезнее без полного переобучения. Для продакшен-сценариев это особенно интересно: если модель умеет копить удачные стратегии и откатывать неудачные навыки, внедрение агентных систем становится менее хрупким.
Самый практичный сигнал здесь в том, что навыки, найденные одной моделью, иногда переносятся на другую. Значит, компании могут не просто улучшать отдельного агента, а собирать общую рабочую память команды систем. Именно там сейчас и лежит самый приземлённый выигрыш — меньше повторяющихся ошибок, меньше ручной донастройки и чуть больше шансов, что AI-агент завтра не наступит на те же грабли, что и сегодня.