Что именно произошло
Google DeepMind перевела Interactions API в статус общедоступного интерфейса для моделей Gemini и AI-агентов. API находился в открытой бете с декабря 2025 года, а теперь заменил прежний интерфейс generateContent в Google AI Studio и во всей официальной документации. Старый способ вызова продолжает работать, но все новые функции для агентов будут выходить только через Interactions API. Для разработчиков уже опубликован отдельный гайд по миграции.
Глава developer relations Google Логан Килпатрик описал переход фразой «Interactions задаёт сцену для новой эры агентов». С технической точки зрения это означает не просто обновление SDK, а смену модели взаимодействия с моделью: вместо простого запроса-ответа приложение получает структурированный лог шагов, который проще отлаживать и собирать в более сложные цепочки.
Какие новые возможности появились
С момента запуска бета-версии Google добавила в Interactions API несколько ключевых блоков. Управляемые агенты получили собственную изолированную Linux-среду, в которой можно запускать код и системные утилиты. Появилась фоновая обработка для долгих задач, которые не укладываются в один запрос. Инструменты Google Search и Maps теперь можно объединять в цепочки внутри одного вызова, а генерация изображений, музыки и речи вынесена в отдельные медиа-шаги.
Параллельно Google упростила саму схему данных. Прежняя ролевая структура с метками «user» и «model» уступила место типизированным шагам: каждое действие — будь то ввод пользователя, ответ модели, вызов функции или результат инструмента — описывается как отдельный объект. Это делает диалог детерминированным с точки зрения разбора и проще поддаётся логированию и аудиту.
Почему это важно для разработчиков
Главное следствие — экономика вызовов. Google ввела два режима выполнения: Flex снижает стоимость примерно на 50 процентов за счёт использования свободных мощностей, а Priority оптимизирует задержку для чувствительных к скорости сценариев. Для коммерческих приложений это означает прямой рычаг управления cost-per-token без потери доступа к модели.
Структура шагов и фоновые задачи дают ещё одно преимущество — нативную поддержку агентных сценариев. Когда модель должна сделать несколько вызовов инструментов подряд, держать длинный контекст и периодически уходить в фон, разработчику больше не нужно собирать эту логику вручную: API сам нормализует шаги и возвращает их в читаемом виде. Это снижает порог входа для команд, которые раньше обходили LLM-агентов из-за сложности оркестрации.
Чем это отличается от прежнего подхода
Старый generateContent оставался интерфейсом «один запрос — один ответ»: разработчик отправлял текст и картинки, получал сгенерированный текст и не видел, как модель разбила работу внутри. Для чат-ботов этого хватало, но для агентских задач быстро выяснилось, что чёрный ящик вызова плохо отлаживается и плохо логируется.
Interactions API сознательно проектировали под workflow, в которых один запрос распадается на цепочку шагов: пользовательский ввод, планирование, вызовы внешних сервисов, фоновая обработка, финальный ответ. Логирование каждого шага отдельно позволяет строить поверх надёжные агенты для продакшена — с понятным временем выполнения, воспроизводимыми сценариями и контролем расходов.
Что дальше
Следующие месяцы покажут, насколько быстро экосистема перейдёт на Interactions API: библиотеки вроде LangChain и LlamaIndex, а также крупные фреймворки для AI-агентов будут добавлять нативные адаптеры, чтобы разработчики не писали миграцию руками. Дополнительный фактор — будущие функции Gemini: Google уже намекнула, что новые мультимодальные возможности и более длинный контекст будут появляться только через Interactions. Это делает миграцию не рекомендацией, а требованием для команд, которые хотят оставаться на актуальной версии платформы.
Тема связана с развитием AI-агентов и архитектурой внутренних моделей безопасности Google DeepMind. Общую картину того, как устроены современные большие языковые модели, разбирали в базовом материале.