
ИИ-модели ставят ошибочные диагнозы по рентгену с высокой уверенностью — исследование RadLE 2.0
Нейросети для анализа медицинских снимков ошибаются не как люди — они дают неверный диагноз и при этом полностью уверены в себе. Международная исследовательская группа Crash Lab опубликовала результаты теста RadLE 2.0 (Radiology Language model Evaluation), в котором сравнила 16 крупнейших языковых моделей с группой практикующих радиологов. Результат для ИИ удручающий: ни одна модель не превзошла человеческих специалистов по показателю, который учитывает не только точность, но и способность вовремя признать неопределённость.
Как оценивали модели и людей
Тест RadLE 2.0 охватил 200 клинических случаев из реальной практики. Участникам — как ИИ-моделям, так и радиологам — предлагалось по рентгеновским и другим медицинским снимкам поставить диагноз или определить, требуется ли направление к специалисту. Затем ответы проверяли эксперты.
Система оценки была построена нетривиально: полные баллы начислялись за правильный ответ, подкреплённый высокой уверенностью. Если модель ошибалась, но при этом заявляла о своей уверенности — она теряла столько же баллов, сколько получила бы за правильный ответ. Ответ «не знаю» давал ноль, но не штрафовался. По сути, тест измерял не только точность, но и калибровку уверенности — способность системы отличать то, в чём она действительно компетентна, от того, где её знаний недостаточно.
Лучший показатель среди людей — 988,7 балла из 2000 возможных. Ни одна из 16 протестированных моделей не смогла к нему приблизиться. При этом чисто по доле правильных ответов (без учёта уверенности) многие коммерческие модели уже вплотную приближаются к уровню опытных резидентов-радиологов.
Какие модели показали лучшие результаты в тесте RadLE 2.0
Среди коммерческих моделей лидером по надёжности и безопасности ответов стала Claude Fable 5 от Anthropic — она реже других выдавала уверенные, но неверные заключения. Gemini 3 Pro от Google показал самую высокую raw-точность (долю правильных ответов), но при этом чаще других крупных моделей допускал уверенные ошибки.
Отдельно выделилась Meta Muse Spark 1.1: она лучше всех определяла момент, когда случай следует передать человеку. Meta недавно сократила частоту галлюцинаций Muse Spark почти вдвое — модель стала чаще отвечать «не знаю» вместо того, чтобы уверенно выдумывать диагноз. Для большинства других моделей характерен обратный тренд: чем увереннее модель, тем чаще эта уверенность оказывается ложной.
Почему это опасно уже сейчас
Проблема носит не только теоретический характер. Всё больше пациентов загружают свои снимки в чат-ботов на основе ИИ и принимают на их основе решения о здоровье. Исследование, опубликованное в npj Digital Medicine, показало, что популярные ИИ-системы регулярно дают недостоверные ответы на медицинские вопросы. При этом модель может быть уверена в неверном диагнозе на 95%, что создаёт у пациента ложное чувство надёжности.
Исследователи указывают на системную проблему: текущие бенчмарки оценивают только точность, поэтому разработчики оптимизируют модели именно под неё. Модель, которая отвечает на всё с высокой уверенностью, получает лучшие оценки на большинстве тестов — даже если значительная часть этих уверенных ответов неверна. Для медицины такой подход может быть опасен: уверенный неверный диагноз наносит больше вреда, чем честное признание неопределённости.
Отдельный повод для беспокойства — так называемый «эффект Google Maps». Польское исследование 2025 года показало, что врачи, регулярно использующие ИИ при колоноскопии, обнаруживают значительно меньше предраковых образований, когда работают без assistance. Показатель снизился с 28,4% до 22,4%. Привыкая к «навигатору», специалисты теряют навык самостоятельной работы.
Что дальше
Авторы RadLE 2.0 планируют расширять тест на постоянной основе, добавляя новые модели по мере их выхода. До конца года обещана полноценная научная публикация с анализом стоимости использования моделей и подробной таксономией ошибок.
Пока же вывод однозначен: даже самые передовые модели не готовы к самостоятельной клинической работе. Прежде чем искусственный интеллект сможет принимать диагностические решения без участия человека, ему необходимо научиться главному — вовремя молчать.
AI-инструменты, которые можно сразу взять в работу
Подборка доступов и подписок к популярным сервисам: быстро, с авто-выдачей и понятной оплатой.