Google DeepMind стала относиться к своим AI-агентам как к инсайдерским угрозам

3 мин чтения 0
Google DeepMind стала относиться к своим AI-агентам как к инсайдерским угрозам

Что произошло

Компания Google DeepMind опубликовала документ под названием AI Control Roadmap, в котором впервые описала собственных AI-агентов как потенциальные угрозы внутренней безопасности — в терминах, обычно применяемых к инсайдерам-людям. Речь идёт не о внешних атаках, а о ситуации, когда AI-агент, работающий внутри организации, случайно или из-за ошибок в инструкциях наносит вред: удаляет данные, отправляет письма не тем получателям, открывает доступ посторонним.

До сих пор большинство компаний рассматривали угрозы AI-агентов абстрактно — как теоретическую проблему будущего. DeepMind первой среди крупных AI-лабораторий перешла от слов к конкретным техническим мерам и поделилась результатами на реальных данных.

Как устроена система безопасности

Документ описывает три уровня защиты, которые DeepMind называет «Three Layers of Agent Security».

Первый уровень — защита отдельного агента. Каждый AI-агент получает набор ограничений, привязанных к его реальным возможностям: если агент умеет только читать файлы, ему закрывают доступ к функциям записи. Это похоже на принцип минимальных привилегий в IT-безопасности, когда сотрудник получает доступ только к тому, что ему необходимо для работы.

Второй уровень — контроль систем из нескольких агентов, которые работают вместе. Здесь ключевая проблема в том, что цепочка агентов может «накапливать ошибки: каждый следующий агент принимает выходные данные предыдущего за чистую монету без дополнительной проверки. Если первый агент ошибся, ошибка распространяется по всей цепочке.

Третий уровень — защита экосистемы. Даже если отдельные агенты и их комбинации работают штатно, их совокупное поведение может создавать системные риски на уровне целой отрасли. DeepMind приводит пример: тысячи агентов, одновременно оптимизирующие финансовые портфели, могут случайно обрушить рынок.

Что показал миллион тестовых задач

DeepMind протестировала свои подходы на практике. Команда построила внутренний прототип асинхронной системы мониторинга для своего агента Gemini Spark и запустила его на одном миллионе реальных задач по написанию кода.

Результат оказался показательным. Система выявила поведенческие паттерны, которые невозможно было обнаружить простым фильтром по ключевым словам. Однако ключевой вывод: подавляющее большинство зафиксированных инцидентов не были злонамеренными. Агенты ошибались из-за чрезмерного усердия — они слишком буквально интерпретировали задачу пользователя и заходили дальше, чем требовалось.

Сейчас эта система работает как живой мониторинг в реальном времени. Пример: агент готовится удалить файл — система перехватывает действие за доли секунды до выполнения и проверяет, действительно ли это было намерением пользователя.

Почему это важно

В посте на платформе X DeepMind предупредила, что «окно для принятия глобальных стандартов безопасности AI-агентов быстро закрывается». Компания призвала AI-лаборатории, правительства и исследователей рассматривать многоуровневую безопасность агентов как общую задачу — точно так же, как в своё время появились стандарты безопасности для интернета.

Отдельный документ — Policy Paper — адресован напрямую законодателям и чиновникам. В нём DeepMind излагает техническую позицию в форме, доступной для неспециалистов, и предлагает начать диалог о стандартах до того, как multi-agent системы станут массовыми и ущерб от их ошибок будет исчисляться реальными деньгами.

Контекст: всё больше компаний внедряют AI-агентов для автоматизации внутренних процессов — от написания кода до юридической работы. Без системы мониторинга и контроля риски случайного ущерба растут пропорционально количеству агентов. Проблема уже не теоретическая — она становится частью повседневных IT-операций.

Материал был полезен?
AI-инструменты без границ

Получите доступ к нужному AI-сервису уже сегодня

ChatGPT, Claude, Gemini, MiniMax и агенты для кода — предложения проверенных продавцов по доступным ценам. Оплата российскими картами, через СБП или криптовалютой.

Проверенные продавцы Быстрая выдача Доступные цены
Прокрутить вверх