
Anthropic утверждает, что Opus 5 практически неуязвим для prompt injection — и приводит данные
В режиме Auto Mode модель показала 0% успешных атак prompt injection в браузерных сценариях. Для сравнения: OpenAI ещё в декабре признавала, что проблема может быть нерешаемой.
Prompt injection — это техника, при которой злоумышленник внедряет скрытые инструкции в данные, которые AI-модель обрабатывает: текст на веб-странице, PDF, изображение. Цель — заставить модель нарушить свои исходные инструкции: украсть данные, обойти ограничения, выполнить неавторизованные действия. Это считается одной из главных угроз для AI-агентов, которые активно взаимодействуют с внешним контентом.
Новое исследование Anthropic показывает, что Claude Opus 5 практически не поддаётся таким атакам в собственном программном обеспечении компании. Согласно system card модели, при активированном Auto Mode в продуктах вроде Claude Cowork показатель успешных атак prompt injection составил 0% на выборке из 129 тестовых сценариев. Это касается именно браузерных агентов — ситуаций, когда модель читает веб-страницы и выполняет действия на их основе.
Как Opus 5 добивается нулевого показателя?
Защита строится на двух уровнях. Первый — превентивный сканер: входящие данные проверяются на наличие скрытых инструкций до того, как их обработает языковая модель. Второй — блокировщик опасных действий: даже если модель получила вредоносный запрос, исполнительный слой не даёт выполнить деструктивные команды.
Без Auto Mode Opus 5 показывает 3,7% успешных атак — что уже значительно лучше предшественников. Примечательно, что Sonnet 5 без Auto Mode (0,93%) обгоняет Opus 5 без Auto Mode. Получается, что именно комбинация модели и защитного ПО даёт стопроцентный результат. Сама по себе модель — не панацея.
Подробнее о том, как устроены AI-агенты и какие угрозы для них существуют, читайте в нашем обзоре состояния AI-агентов в 2026 году.
Что показал независимый тест от Gray Swan?
Оценку Anthropic подтвердила независимая проверка от security-фирмы Gray Swan. Opus 5 лидирует в бенчмарке IPI (Implicit Prompt Injection): при 15 попытках атаки успешными оказались лишь 2,0%. Для сравнения, Opus 4.8 показывал 5,5%. Следом идут Mythos 5 (2,6%) и Fable 5 (2,8%).
Результаты Gray Swan означают, что улучшение касается не только специфических браузерных сценариев Auto Mode, но и более широкого класса prompt injection атак. Подробнее об этом читайте в нашем материале о 5 runtime-сигналах prompt injection.
Почему это важно для рынка AI-агентов?
Prompt injection долгое время считался «ахилессовой пятой» AI-агентов. OpenAI ещё в декабре публично признала, что проблема может никогда не быть решена полностью. Если Opus 5 действительно свел риск к нулю в контролируемой среде — это меняет экономику безопасности автономных AI-систем.
Бизнес, который хочет использовать AI-агентов для работы с внешними данными (CRM, веб-скрапинг, автоматизация документооборота), теперь может рассматривать Opus 5 как платформу с доказанным уровнем защиты. Ранее мы подробно разбирали, как выбрать AI coding agent, и безопасность там была одним из ключевых критериев.
Ограничения: Auto Mode — это не только модель
Стоит учитывать: Auto Mode — это не просто настройка модели, а комплексное программное решение, которое добавляет два дополнительных слоя защиты вокруг языковой модели. Для внешних разработчиков, которые используют API Opus 5 без Auto Mode, эти слои недоступны. Без них модель всё ещё уязвима — хотя и значительно меньше, чем предыдущие версии.
Подберите сервис под задачу и начните работать сегодня
ChatGPT, Claude, Gemini, MiniMax и другие инструменты для текстов, кода, изображений и автоматизации — без долгого поиска вариантов.