Cached input растёт квадратично: почему длинный AI-агент становится дороже

3 мин чтения 0
Cached input растёт квадратично: почему длинный AI-агент становится дороже

В многошаговом AI-агенте стоимость растёт не только вместе с объёмом текста. Каждый новый ход повторно читает предыдущую историю из кэша, поэтому длинный сценарий может заметно увеличить счёт даже при низкой цене cached input.

Суть события

Ключевой вывод разбора прост: в типичном агентском сценарии объём чтения из кэша растёт квадратично относительно числа ходов. Агент делает запрос, получает ответ, вызывает инструмент или читает файл, а затем возвращается к модели с расширенной историей. На следующем шаге модель снова видит прежний контекст. Поэтому каждый новый ход добавляет не только свои токены, но и всё больший объём уже накопленной сессии.

Для пользователя это означает, что короткая задача и длинная цепочка действий расходуют бюджет по-разному. Цена одного миллиона токенов cached input может выглядеть небольшой, но повторное чтение истории на десятках шагов становится главным фактором расходов.

Детали

KV-кэш — это сохранённое представление предыдущего контекста, которое ускоряет генерацию следующего токена. Он экономит вычисления, но занимает память ускорителя. Когда пользовательская сессия прерывается на секунды или минуты, провайдеру приходится перемещать кэш между памятью GPU, оперативной памятью и постоянным хранилищем. Чтение из кэша поэтому тарифицируется: для инфраструктуры это не бесплатная операция.

В сессии с K примерно одинаковыми шагами суммарное чтение истории имеет порядок K², тогда как новый вход и вывод растут ближе к линейному масштабу. Каждый tool call, чтение файла и возврат управления клиентскому коду добавляют очередной шаг. Мелкие действия удобны для агента, но их сумма может стать дорогой.

Контекст

Обычно расходы оценивают по цене входящих и исходящих токенов или смотрят на высокую долю кэшированного чтения в отчёте. Оба взгляда неполны: доля кэша зависит от длины сценария и числа промежуточных действий. Стратегия, которая кажется эффективной в локальном запуске, не обязательно выгодна в облаке, где провайдер распределяет ускорители между множеством параллельных сессий.

Для малого бизнеса и команд, которые платят за облачный инференс, это практический вопрос. Оптимизировать нужно не только промпт, но и маршрут задачи: объединять независимые операции, не дробить чтение без причины и измерять стоимость каждого шага. Полезный контекст о том, как меняется цена цифрового спроса, есть в материале «CTR растёт, а показов меньше: как AI Overviews могут менять Shopping-рекламу».

Что дальше

Перед запуском длинного агента стоит записать число ходов, средний размер истории и стоимость cached input. Затем сравнить последовательный и объединённый сценарии на одной задаче. Иногда один более содержательный запрос дешевле нескольких аккуратных уточнений, даже если локально каждый отдельный шаг выглядит экономным.

Главный ориентир — не минимальная цена одного шага, а стоимость всей цепочки до результата. Чем дальше агент уходит по истории, тем сильнее повторное чтение влияет на итоговый счёт.

Материал был полезен?
AI-инструменты без границ

Получите доступ к нужному AI-сервису уже сегодня

ChatGPT, Claude, Gemini, MiniMax и агенты для кода — предложения проверенных продавцов по доступным ценам. Оплата российскими картами, через СБП или криптовалютой.

Проверенные продавцы Быстрая выдача Доступные цены
Прокрутить вверх