Даже сильная видеомодель может показать нужного орла и нужное поле, но проигнорировать задуманный пролёт камеры. GPTunneL предложила практичный обход: сначала собрать простую 3D-сцену, а затем передать её Seedance 2.5 или Hailuo H3 как референс движения.
Суть события
В конструкторе GPTunneL появилась нода «3D-сцена» для предварительной постановки генеративного видео. Пользователь описывает сцену словами, ассистент расставляет примитивы, камеры и ключи анимации, а браузер рендерит черновой ролик. Этот превиз задаёт ракурс, тайминг, движение камеры и положение объектов; итоговый внешний вид видеомодель берёт из промпта и референсных изображений.
Подход решает неприятную и дорогую проблему: Seedance 2.5 и MiniMax Hailuo H3 хорошо рисуют кадр, но сложную режиссуру из одного текста воспроизводят непредсказуемо. Вместо серии попыток уговорить модель авторы предлагают показать ей операторскую работу на простых кубах, сферах и пирамидах. По их наблюдениям, движение и монтаж затем сохраняются почти покадрово.
Детали
Сцену можно собрать в чате, поправить мышью и подключить к видеомодели двумя выходами: video передаёт референс, prompt объясняет его роль. Короткая позитивная инструкция просит брать из видео камеру, планы, тайминг и расстановку, а объекты и атмосферу — из описания. Это важно: без пояснения модель способна просто превратить цветные примитивы в более красивые цветные примитивы.
Внутри редактора доступны камеры, свет, группы объектов, таймлайн, гизмо и отмена действий. Рендер идёт на устройстве пользователя: основной путь использует WebCodecs и аппаратное кодирование H.264, запасной — PNG-кадры и ffmpeg.wasm. Авторы также отказались от огромного JSON в ответах ассистента: компактный текстовый формат, патчи и макросы сократили типичный ответ примерно с 9500 до 300 токенов. Геометрический линтер ловит объект под полом или камеру в стене и даёт модели одну попытку исправления.
Контекст
Превиз давно используют в кино, но для генеративного видео он особенно полезен: каждый неудачный дубль оплачивается заново. По расчётам авторов, 15 секунд Seedance 2.5 в 720p стоят около 700 рублей за прогон, а десять попыток получить сложный пролёт — уже примерно 7 тысяч рублей. Сборка сцены ассистентом оценивается в 10–100 рублей, локальный рендер заготовки бесплатен. Для Hailuo H3 логика та же: несколько лишних дублей дороже управляемого референса.
Похожую задачу решает браузерный редактор Higgsfield 3D Jutsu, однако GPTunneL делает ставку на встроенную ноду рядом с генерацией видео и монтажом. Пока здесь только базовые фигуры и группы, зато результат не нужно переносить между сервисами. Это не обещание идеального видео с первого раза, а способ отделить режиссуру от стилизации и сделать число итераций предсказуемее.
Экономика генерации особенно заметна на фоне стоимости вычислительной инфраструктуры: о том, почему цена ускорителей влияет на весь рынок AI, мы рассказывали в материале о росте Nvidia до оценки в $5 трлн.
Что дальше
Практический сценарий такой: сначала заблокировать движение камеры и объектов в грубой сцене, проверить тайминг, затем добавить изображения персонажей и коротко назначить роль видеореференса. Если модель ошиблась в композиции, дешевле передвинуть примитив или ключ анимации, чем снова оплачивать случайный дубль.
Главный вопрос теперь — насколько стабильно этот способ работает на разных сюжетах и версиях моделей. Цены и возможности сервисов меняются, поэтому перед большим роликом разумно провести короткий тест: один превиз, один и тот же промпт и по одному прогону в доступных моделях. Так быстро станет ясно, окупает ли управляемая 3D-постановка время на конкретном проекте.