Что показали
Компании Volvo и Google на конференции Google I/O продемонстрировали экспериментальную функцию голосового помощника Gemini в автомобиле. Водитель задаёт вопрос о том, что происходит за окном, — и ИИ отвечает, анализируя видеопоток с фронтальной камеры машины в реальном времени. Это первый в мире опыт интеграции большой мультимодальной языковой модели непосредственно в бортовую камеру автомобиля. Демонстрация проходила на Volvo EX60 — модель ещё не поступила в продажу.
Как это работает
Функция не требует смартфона. Фронтальная камера автомобиля становится «глазами» Gemini. Водитель активирует помощника голосовой командой и задаёт вопрос: «Что это за здание слева?» или «Какие достопримечательности мы проезжаем?». Система передаёт видеопоток в облако, где работает языковая модель, — и возвращает голосовой ответ. После ответа доступ к камере автоматически закрывается. Демонстрация показала, что Gemini способен корректно идентифицировать объекты вокруг кампуса Google в Маунтин-Вью. При этом сама демонстрация сопровождалась заметными задержками: между вопросом и ответом проходило несколько секунд. На экране информационно-развлекательной системы при этом не отображается трансляция того, что видит камера, — водитель только слышит голосовой ответ. Это отличается от привычного режима Gemini Live на смартфоне, где картинка с камеры дублируется на экран.
Что с приватностью
По словам президента подразделения Android Самира Самата, система спроектирована с оглядкой на конфиденциальность. Камера не ведёт непрерывную запись и не анализирует поездку целиком. Доступ к видеопотоку предоставляется только в момент явного запроса — когда водитель произносит команду и задаёт вопрос. После ответа соединение обрывается. Тем не менее сам факт передачи видеоданных в облако для обработки уже вызывает вопросы у тех, кто следит за приватностью. Пока неясно, хранятся ли какие-либо данные и сколько времени. Архитектурно это похоже на то, как работает Gemini Live на Android — смартфон отправляет видеопоток в облако, где его обрабатывает языковая модель. В автомобиле та же схема, только вместо камеры телефона — бортовая камера машины, и нет необходимости доставать телефон.
Почему это важно
Google ищет способы расширить возможности Gemini за пределы смартфона. Навигационные системы и бортовые информационно-развлекательные комплексы (IVI — in-vehicle infotainment) постепенно превращаются из экранов с картами в полноценных голосовых помощников. Раньше автомобильные ассистенты могли отвечать только на вопросы, заложенные разработчиками: «включи кондиционер», «позвони маме». Теперь языковая модель позволяет спрашивать что угодно и получать ответы с учётом реального окружения. Это принципиально другой уровень взаимодействия — не по сценарию, а свободным языком. В перспективе водитель сможет спросить: «Покажи отзывы о ресторане, мимо которого мы сейчас проезжаем» или «Объясни, что за архитектурный стиль у этого здания». До сих пор такие сценарии обсуждались только в виде концепций и прототипов.
Когда появится
Пока это только прототип. Самат не назвал конкретных сроков и не озвучил планов по расширению доступности. Volvo EX60, на которой проходила демонстрация, ещё даже не вышла в продажу. По всей видимости, Google изучает спрос и технические нюансы — задержки в демонстрации говорят о том, что оптимизация под реальные условия ещё не завершена. Но сама идея — Gemini, который видит мир через камеру автомобиля и отвечает на вопросы о нём — уже привлекает внимание индустрии. Следующий шаг: научиться обрабатывать видео локально, без облака, чтобы сократить задержку и решить вопросы приватности. По мере того как на рынке появляются более мощные автомобильные процессоры, локальная обработка видео на базе LLM становится всё более реалистичным сценарием.