
Google DeepMind показала GenCeption: видеогенератор научили решать задачи компьютерного зрения
Языковые модели стали универсальными системами почти случайно — побочный эффект обучения предсказывать следующее слово. Тот же фокус не удавалось повторить в компьютерном зрении: специализированные модели для каждой задачи (распознавание объектов, оценка глубины, сегментация) работали отдельно, каждая со своей архитектурой. Google DeepMind предлагает теперь иное решение — взять готовую видеогенеративную модель и перенаправить её возможности на классические задачи компьютерного зрения. Модель называется GenCeption, и она уже показывает результаты на уровне или лучше специализированных систем, используя в сотни раз меньше данных.
Почему видеогенерация оказалась полезна для зрения
Генерация реалистичного видео требует от модели глубокого понимания пространственной геометрии сцены, физики движения объектов и базовых законов мира. Модель также использует текстовые описания при обучении, что связывает визуальный контент с языком. И, что критически важно, такие данные относительно дёшево размечать — можно автоматически получать пары «описание — визуальный ряд».
Эти свойства делают видеогенеративные модели кандидатами на роль foundation model для компьютерного зрения — аналогично тому, как большие языковые модели стали основой для текстовых задач. До GenCeption подобная универсализация в зрении не удавалась.
Как устроен GenCeption
GenCeption построена на открытой видеомодели Wan2.1 с рядом изменений. Главное из них — архитектура, которая выдаёт предсказание за один проход (forward pass), а не через десятки итераций постепенной «очистки» шума. Это делает модель достаточно быстрой для практических задач.
Универсальность обеспечивается хитрым приёмом: любой результат — карта глубины, карта нормалей поверхности, маска сегментации, поза — представляется в виде стандартного RGB-изображения с тремя каналами. Текстовый промпт указывает модели, какую задачу выполнять: «определи глубину», «найди объекты», «оцени позу человека». Для задач, которые невозможно свести к картинке (например, 3D-ключевые точки), добавляются небольшие обучаемые модули.
Все задачи используют единую функцию потерь (loss function) при обучении. Это означает, что для добавления новой задачи не нужно менять архитектуру — достаточно по-другому подготовить данные.
Сколько данных нужно GenCeption для обучения
Основа обучающей выборки — синтетический датасет из 7500 видео. Исследователи скомбинировали 800 цифровых моделей людей и 200 последовательностей motion capture (захват движения), затем рендерили результаты в Blender с разными фонами и ракурсами камеры. Реальные видео использовались только для сегментации по текстовому описанию.
Для сравнения: специализированные модели D4RT и VGGT Omega обучаются на миллионах видео. GenCeption достигает сопоставимых результатов при в 7–500 раз меньшем объёме данных. При одинаковых условиях предобучение на видеогенерации также превзошло методы V-JEPA и VideoMAE V2, что подтверждает: именно задача генерации, а не объём данных, помогает модели научиться полезным представлениям пространства и движения.
По заявлению авторов, GenCeption соответствует или превосходит state-of-the-art результаты сразу в нескольких бенчмарках. Оценка глубины не уступает лучшим специализированным моделям. Поверхностные нормали лучше, чем у NormalCrafter и Lotus-2. Распознавание 3D-позы превосходит Genmo и TRAM. Сегментация по тексту соответствует комбинации Meta SAM 3 и Gemini 3.5 Flash.
Как GenCeption обобщает знания за пределами обучающей выборки
Модель обучалась почти исключительно на синтетических видео с одним человеком в кадре. Тем не менее она работает на реальных видео с несколькими людьми, а также на категориях, которых не видела при обучении: животные, человекоподобные роботы. Некоторые результаты содержат больше деталей, чем синтетические рендеры из обучающей выборки — модель способна сохранять отдельные волоски усов и контуры прядей шерсти у кошек.
Есть и ограничения. Совместное обучение для всех задач ухудшает точность 3D-ключевых точек — по всей видимости, дополнительные модули мешают механизмам, которые базовая модель развила при предобучении. Скорость также пока не оптимальна: маленькая версия обрабатывает 81 кадр за ~6 секунд, большая (14 млрд параметров) — за ~10 секунд.
Мир как генерация, а не как восприятие
Авторы статьи настаивают, что видеогенеративные модели уже содержат тип универсального «модели мира» (world model), необходимого для foundation computer vision model. Это противоречит позиции другой исследовательской группы, которая недавно предложила унифицированное определение world model и намеренно исключила text-to-video модели — за отсутствие обратной связи с реальным миром.
Фоновые агенты и инструменты Gemini API уже используют мультимодальные модели для решения сложных задач. Спор о том, является ли способность генерировать видео полноценным пониманием мира, остаётся открытым. Но практический результат GenCeption уже сейчас впечатляет: одна и та же модель решает задачи, для которых раньше требовались отдельные специализированные системы, и делает это на сопоставимом уровне с долей данных.
AI-инструменты, которые можно сразу взять в работу
Подборка доступов и подписок к популярным сервисам: быстро, с авто-выдачей и понятной оплатой.