Новый тест PerceptionBench проверил базовое визуальное восприятие 16 современных мультимодальных моделей. Ни одна не достигла точности 60%, а самой слабой областью стали галлюцинации, связанные с тем, что система неверно видит детали изображения.
Суть события
Moonshot AI собрала PerceptionBench из 3000 проверенных вопросов по десяти базовым визуальным способностям. В тест вошли задачи на форму, положение, количество, пространственные отношения и другие элементы, которые человек обычно воспринимает до сложного рассуждения.
Результаты показывают, что высокий общий уровень модели ещё не гарантирует надёжного зрения. Лучшие системы не дошли до 60%, а модели с похожим итоговым баллом ошибались в разных типах восприятия.
Детали
Из 3000 вопросов 1800 были выделены из реальных ошибок на других тестах, ещё 1200 авторы подготовили на дополнительных изображениях. Такой дизайн помогает отделить проблему восприятия от знания фактов и длинных рассуждений.
Слабее всего в среднем оказались задачи, связанные с визуальными галлюцинациями: модель уверенно описывает деталь, которой нет, или неверно связывает объекты. Это особенно опасно при анализе документов, фотографий оборудования и изображений с камер.
Контекст
Мультимодальные модели всё чаще получают доступ к экрану и физическому миру. Например, системы управления роботами зависят от правильного определения объектов и расстояний. Ошибка на первом этапе делает последующее логичное рассуждение бесполезным.
Для пользователя вывод практический: важные цифры, подписи и объекты на изображении нужно перепроверять. Наш материал о безопасной работе с AI объясняет, где человеческая проверка остаётся обязательной.
Что дальше
Авторы открыли набор данных и результаты, поэтому разработчики смогут сравнивать новые версии моделей по отдельным способностям, а не только по общему баллу. Это должно помочь точнее находить узкие места обучения. Повторные испытания также покажут, улучшает ли обновление реальное восприятие или лишь поднимает средний результат за счёт знакомых форматов вопросов.
До заметного улучшения AI стоит использовать как помощника первичного анализа, а не единственного наблюдателя. В медицине, производстве, безопасности и финансах решение по изображению должно опираться на исходный материал и проверку специалиста. В интерфейсе полезно показывать пользователю исходный фрагмент, на котором основан ответ, чтобы ошибку можно было заметить до автоматического действия.