Что показали исследователи
Авторы работы PTP предложили восстанавливать исходную инструкцию модели по уже полученному ответу. Обычно языковая модель предсказывает следующий токен, то есть небольшой фрагмент текста. Исследователи развернули логику назад и обучили отдельную модель предсказывать предыдущие токены. В результате ответ становится цепочкой улик, по которой можно приблизиться к скрытому запросу.
Почему метод отличается от прежних
Ранее восстановление промптов часто рассматривали как поиск текста с похожим смыслом. Такие методы могли требовать доступа к весам модели, вероятностям токенов или большим внешним наборам данных. PTP работает в чёрном ящике и обучается на синтетических парах, созданных самой целевой моделью. Авторы сообщают, что подход превосходит прежние решения по набору токеновых метрик и переносится между разными моделями.
Где возникает риск
Для обычного пользователя это не означает, что любой ответ мгновенно раскрывает секрет слово в слово. Однако для компаний вывод серьёзный: системный промпт нельзя считать надёжным хранилищем паролей, внутренних правил или коммерческих секретов. Если сервис выдаёт много ответов, атакующий может собрать примеры и попытаться восстановить устойчивые части инструкции. Практические меры разобраны в материале о том, как защищать системные инструкции AI-сервиса.
Как снизить ущерб
Секреты следует хранить вне промпта, выдавать инструментам минимальные права и фильтровать данные на входе и выходе. Важно также тестировать модель на утечки и ограничивать массовый сбор ответов. Для понимания механики полезны полное руководство по prompt engineering и материал, где дано простое объяснение устройства LLM. Исследование PTP ещё требует независимой проверки в разных продуктах, но направление ясно: скрытая инструкция не равна защищённой инструкции.
Практический вывод
Новость важна не сама по себе, а как сигнал для проверки собственных процессов. Не стоит принимать решение по одному заголовку или заявлению разработчика. Зафиксируйте исходные показатели, проведите ограниченный тест и заранее определите условие остановки. Сравнивайте результат с текущим способом работы, учитывайте время специалистов и документируйте неожиданные ошибки. Такой подход позволяет получить пользу от новой технологии, не перенося экспериментальный риск на пользователей, данные и ключевые рабочие операции.