Российские учёные научили нейросеть предсказывать события на видео
Исследователи МФТИ совместно с коллегами из Института AIRI и университета «Иннополис» представили метод DyGEnc, который позволяет большим языковым моделям (LLM — это генеративные модели, понимающие текст и отвечающие на вопросы) отвечать на сложные вопросы о происходящем на видео: кто за кем взял предмет, в какой последовательности шли действия и что произойдёт дальше. Технология прежде всего ориентирована на «умных» роботов, которые работают в меняющейся среде — на складах, заводах и в сервисной робототехнике.
Что именно сделали учёные?
Главная проблема современных систем компьютерного зрения — они хорошо распознают статичные объекты на картинке, но плохо понимают динамику. Когда нужно ответить на вопрос «у какого объекта сядет человек после того, как закроет холодильник», классические модели сбиваются. А LLM при попытке описать длинное видео либо «забывают» начало, либо начинают выдумывать детали — это называют галлюцинациями (когда модель уверенно генерирует неправду).
Метод DyGEnc решает обе проблемы сразу: видео сжимается в специальную структуру — граф событий (это схема, где объекты-вершины соединены рёбрами-действиями), а затем этот граф подаётся в языковую модель. «Общая картина как бы собирается из отдельных кусочков», — пояснил соавтор работы Дмитрий Юдин из лаборатории интеллектуального транспорта МФТИ.
Какие результаты показали тесты?
Эффективность метода проверили на международных бенчмарках — стандартных базах для сравнения разных AI-систем:
- На датасете STAR (9 тысяч видео с бытовыми сценами) алгоритм правильно ответил на 99% вопросов о взаимодействии объектов и на 97% вопросов о том, какое действие будет следующим.
- На более сложном AGQA (2,27 млн вопросов разного типа) после дообучения нейросеть стала понимать открытые вопросы с точностью 93% против 54% без использования DyGEnc — рост почти вдвое.
Важно, что метод испытали не только на записях, но и на реальном роботе — мобильной платформе с рукой-манипулятором. Робот получал задания на русском языке и корректно их выполнял. Это уже шаг к промышленному применению в AI-агентах, которые взаимодействуют с физическим миром.
Почему это важно для индустрии?
Сегодня большинство роботов на складах и заводах работают по жёстким сценариям: каждый шаг расписан заранее, любое отклонение ломает процесс. DyGEnc даёт машинам возможность понимать намерения и предсказывать, что будет дальше, — а значит, адаптироваться к нестандартным ситуациям. Это одно из ключевых звеньев на пути к по-настоящему автономной логистике и производству.
Кроме того, графовая структура решает проблему «забывания»: вместо того чтобы прогонять через модель каждый кадр, системе подают сжатую схему с самыми важными связями. Это радикально снижает требования к памяти и вычислениям — тему, которую AI Digest (ai-digest.ru) подробно разбирал в материале про инфраструктуру GPU для ИИ.
Где опубликовано исследование?
Работа вышла в рецензируемом научном журнале Technologies. Это означает, что результаты прошли независимую проверку экспертов и методику можно воспроизвести в других лабораториях. Соавторы — сотрудники МФТИ, Института AIRI (Artificial Intelligence Research Institute) и университета «Иннополис», то есть сразу три сильных российских центра компетенций в области ИИ.
Что дальше?
Следующий шаг команды — научить систему работать с ещё более длинными видео и сложными сценами, где одновременно взаимодействуют десятки объектов и людей. По словам разработчиков, технологию также можно адаптировать для беспилотного транспорта и сервисных роботов в быту. Если текущие темпы сохранятся, через 1–2 года подобные методы могут стать стандартом для российской робототехники и составят конкуренцию западным аналогам вроде Google Veo, о котором мы писали в материале про дешёвую генерацию видео.