Авито Реклама собрала конвейер из специализированных ИИ-агентов и Python-помощника, чтобы разбирать растущий поток отзывов пользователей. Ключевая идея проста: один комментарий может содержать несколько независимых проблем, поэтому искать одну метку на весь текст недостаточно.
Суть события
Когда кабинет Авито Рекламы запустили в июне 2025 года, команда могла читать отзывы вручную и использовать их для приоритизации бэклога. По мере роста числа пользователей и разделения продуктовых зон такой подход перестал масштабироваться. В комментариях нужно было находить дубли, выделять несколько тем, учитывать их вес и направлять обратную связь нужным командам.
Вместо одного универсального агента команда построила последовательный конвейер. ИИ отвечает за смысловые решения, а Python — за повторяемые операции, структуру данных и безопасную запись результата. Это не попытка заменить исследователя одной моделью, а способ разделить перегруженную задачу на понятные этапы.
Детали
Система начинает с сегментации: из полного комментария извлекаются самостоятельные смысловые темы, и для каждой сохраняется подтверждающий фрагмент. Например, жалоба на непонятную причину отклонения объявления, молчание поддержки и нехватку статистики по креативам — это три темы, а не одна общая претензия.
Затем отдельный проверяющий ищет пропущенные или случайно склеенные смыслы. Классификатор применяет таксономию консёрнов, независимый критик сверяет выбор с текстом и возможными альтернативами, а корректор один раз исправляет явную ошибку. Python выводит связанные теги из выбранных консёрнов и проверяет формат. Очередь делится на независимые бакеты до 50 комментариев, а манифест фиксирует их статусы и результаты.
Такой дизайн снижает риск, что длинная инструкция, похожие категории или усталость модели испортят всю обработку. При этом авторы отдельно предупреждают: самопроверка не полностью независима, а качество таксономии важнее бесконечного добавления промптов и проверок.
Контекст
Для бизнеса ценность конвейера не в эффектном слове «агенты», а в качестве решений, которые можно использовать в продуктовой работе. Если система не замечает вторую проблему в отзыве, команда теряет сигнал. Если выбирает широкую категорию вместо точного консёрна, приоритеты и распределение работы становятся менее надёжными.
Авторы проверяли систему на контрольной выборке из 196 вручную размеченных комментариев. Основная метрика — Micro F1 по консёрнам, потому что она учитывает и лишние назначения, и пропуски отдельных тем внутри длинного отзыва. В описании приведены показатели 83,87% по консёрнам и 90,27% по тегам. Эти числа полезно читать вместе с устройством проверки: эталон и спорные случаи тоже пересматриваются, а не принимаются как непогрешимая истина.
Что дальше
Практический вывод для небольшой команды — не начинать с десятка автономных агентов. Сначала стоит определить единицу анализа, описать границы категорий и сохранить исходный текст. Затем можно вынести в код то, что проверяется механически: очереди, форматы, статусы и связи между полями.
Полезно также заранее выбрать независимую проверку и ограничить число повторных кругов. Иначе автоматизация превратится в бесконечное исправление самой себя. Такой подход применим не только к рекламным отзывам: он помогает там, где один свободный текст влияет на продуктовые решения, поддержку или расходы команды.