Российские учёные научили нейросеть предсказывать события на видео

3 мин чтения 0
Российские учёные научили нейросеть предсказывать события на видео

Российские учёные научили нейросеть предсказывать события на видео

Исследователи МФТИ совместно с коллегами из Института AIRI и университета «Иннополис» представили метод DyGEnc, который позволяет большим языковым моделям (LLM — это генеративные модели, понимающие текст и отвечающие на вопросы) отвечать на сложные вопросы о происходящем на видео: кто за кем взял предмет, в какой последовательности шли действия и что произойдёт дальше. Технология прежде всего ориентирована на «умных» роботов, которые работают в меняющейся среде — на складах, заводах и в сервисной робототехнике.

Что именно сделали учёные?

Главная проблема современных систем компьютерного зрения — они хорошо распознают статичные объекты на картинке, но плохо понимают динамику. Когда нужно ответить на вопрос «у какого объекта сядет человек после того, как закроет холодильник», классические модели сбиваются. А LLM при попытке описать длинное видео либо «забывают» начало, либо начинают выдумывать детали — это называют галлюцинациями (когда модель уверенно генерирует неправду).

Метод DyGEnc решает обе проблемы сразу: видео сжимается в специальную структуру — граф событий (это схема, где объекты-вершины соединены рёбрами-действиями), а затем этот граф подаётся в языковую модель. «Общая картина как бы собирается из отдельных кусочков», — пояснил соавтор работы Дмитрий Юдин из лаборатории интеллектуального транспорта МФТИ.

Какие результаты показали тесты?

Эффективность метода проверили на международных бенчмарках — стандартных базах для сравнения разных AI-систем:

  • На датасете STAR (9 тысяч видео с бытовыми сценами) алгоритм правильно ответил на 99% вопросов о взаимодействии объектов и на 97% вопросов о том, какое действие будет следующим.
  • На более сложном AGQA (2,27 млн вопросов разного типа) после дообучения нейросеть стала понимать открытые вопросы с точностью 93% против 54% без использования DyGEnc — рост почти вдвое.

Важно, что метод испытали не только на записях, но и на реальном роботе — мобильной платформе с рукой-манипулятором. Робот получал задания на русском языке и корректно их выполнял. Это уже шаг к промышленному применению в AI-агентах, которые взаимодействуют с физическим миром.

Почему это важно для индустрии?

Сегодня большинство роботов на складах и заводах работают по жёстким сценариям: каждый шаг расписан заранее, любое отклонение ломает процесс. DyGEnc даёт машинам возможность понимать намерения и предсказывать, что будет дальше, — а значит, адаптироваться к нестандартным ситуациям. Это одно из ключевых звеньев на пути к по-настоящему автономной логистике и производству.

Кроме того, графовая структура решает проблему «забывания»: вместо того чтобы прогонять через модель каждый кадр, системе подают сжатую схему с самыми важными связями. Это радикально снижает требования к памяти и вычислениям — тему, которую AI Digest (ai-digest.ru) подробно разбирал в материале про инфраструктуру GPU для ИИ.

Где опубликовано исследование?

Работа вышла в рецензируемом научном журнале Technologies. Это означает, что результаты прошли независимую проверку экспертов и методику можно воспроизвести в других лабораториях. Соавторы — сотрудники МФТИ, Института AIRI (Artificial Intelligence Research Institute) и университета «Иннополис», то есть сразу три сильных российских центра компетенций в области ИИ.

Что дальше?

Следующий шаг команды — научить систему работать с ещё более длинными видео и сложными сценами, где одновременно взаимодействуют десятки объектов и людей. По словам разработчиков, технологию также можно адаптировать для беспилотного транспорта и сервисных роботов в быту. Если текущие темпы сохранятся, через 1–2 года подобные методы могут стать стандартом для российской робототехники и составят конкуренцию западным аналогам вроде Google Veo, о котором мы писали в материале про дешёвую генерацию видео.

Материал был полезен?
AI-инструменты без границ

Получите доступ к нужному AI-сервису уже сегодня

ChatGPT, Claude, Gemini, MiniMax и агенты для кода — предложения проверенных продавцов по доступным ценам. Оплата российскими картами, через СБП или криптовалютой.

Проверенные продавцы Быстрая выдача Доступные цены
Прокрутить вверх