Асимметрия в тестировании моделей: почему 94% на бенчмарке ничего не доказывают

4 мин чтения 1
Асимметрия в тестировании моделей: почему 94% на бенчмарке ничего не доказывают

На habr вышла развернутая методологическая статья, которая ставит под сомнение привычное чтение бенчмарков: высокий процент верных ответов — это не доказательство рассуждения, а лишь набор подтверждающих случаев, и одна хорошо подобранная фраза в условии задачи роняет точность сильных моделей на 17–40 пунктов.

Суть события

Автор разбирает старый логический принцип: доказать общее утверждение подтверждающими примерами нельзя, а опровергнуть его можно одним контрпримером. В тестировании ИИ это значит, что бенчмарк с 94,3% у Gemini 3.1 Pro на GPQA Diamond — это не «рассуждение на уровне PhD», а статистическая граница для конкретной выборки.

Конкретный удар по этой логике — работа Apple GSM-Simbolic. На школьной математике GSM8K сильные модели держались выше 90%, но стоило добавить одну незначащую фразу вроде «пять из собранных киви были чуть меньше обычного», как точность падала на 17–40 процентных пунктов. Сбой наступал там, где индуктивное накопление обещало уверенность.

Для читателя это меняет правила обращения с красивыми цифрами в отчётах вендоров. Высокий балл перестаёт быть доказательством компетенции и становится оценкой поведения на одном распределении — со всеми оговорками про утечку задач в обучающие данные и насыщение бенчмарка.

Детали

Методологически статья предлагает три режима проверки. Для рутинных свойств остаётся тестирование, но с перевёрнутым критерием успеха: цель — найти сбой и передать его в структурированный баг-репорт с логами и артефактами воспроизведения. Для количественных рисков работает статистическая гарантия — «правило трех» и конформное предсказание дают верхнюю границу ошибки. Для критичных свойств остаётся только формальное доказательство.

Особенно практична часть про валидный контрпример. Контрпример обязан быть воспроизводимым, задача — корректной и разрешимой, эталонный ответ — проверенным, а сбой должен относиться к модели, а не к её окружению: промпту, лимиту токенов или системе оценки. История с Apple «The Illusion of Thinking» 2025 года показывает обратное: часть «нулевых» результатов рассуждающих моделей на сложных головоломках оказалась артефактом постановки — в задачах не было решения или ответ не помещался в лимит токенов.

В практике разработки эта логика давно оформлена. Фаззинг-тестирование и метаморфное тестирование ищут именно опровергающие случаи. Платформа Dynabench устроена так, что входы, на которых система ошибается, ищут люди или отдельная модель. Нейросимволический подход идёт дальше: для каждого выданного моделью результата запускается формальный верификатор, и так появляется верикодинг для кода.

Метафора весов: на одной чаше 94% верных ответов, на другой — один воспроизводимый контрпример, перевешивающий всю выборку.
Один воспроизводимый контрпример перевешивает тысячу подтверждений — это и есть асимметрия тестирования.

Контекст

Ситуация хорошо ложится в общую картину последних месяцев. Урсула фон дер Ляйен отдельно предупреждала, что выход AI-агентов за пределы тестовой среды — это сигнал, а не доказательство их надёжности. Microsoft закрепила принцип, что человек остаётся важнее возможностей ИИ в продуктовых сценариях. Голосовые модели вроде Gemini 3.8 Live дешевле сравнимых аналогов именно потому, что их поведение проверяется в узких доменах, а не преподносится как универсальная компетенция.

Асимметрия полезна и в редакционной работе: прежде чем цитировать «94% на бенчмарке», стоит спросить, какие именно задачи попали в выборку, не утекли ли они в обучающие данные, и какие контрпримеры уже зафиксированы. Бенчмарки остаются рабочим инструментом для сравнения моделей и отлова регрессий, но перестают быть аргументом в пользу «понимания».

Здесь же проходит водораздел между методологией и инфраструктурой. Бенчмарки накапливают свидетельства и упираются в асимметрию, нейросимволические методы эту асимметрию обходят. Спорить о том, какой подход «правильнее», бессмысленно: у каждого своя область применения, и смешивать их — типичная ошибка при чтении маркетинговых отчётов вендоров.

Что дальше

Если вы выбираете модель для рабочего процесса, отталкивайтесь от контрпримеров в вашей предметной области, а не от общего процента на бенчмарке. Соберите 20–50 типичных задач с известным эталонным ответом и следите за тем, на каких именно формулировках модель ломается. Это дешевле, чем доверять топовому показателю, и точнее отражает риск внедрения.

Полезный следующий шаг — завести у себя «карту сбоев» по аналогии с фаззингом: журнал воспроизводимых контрпримеров с указанием, какое именно допущение нарушено. Такая карта превращает асимметрию из философского замечания в рабочий инструмент принятия решений о релизе модели и бюджете на её доработку.

Материал был полезен?
AI-инструменты без границ

Получите доступ к нужному AI-сервису уже сегодня

ChatGPT, Claude, Gemini, MiniMax и агенты для кода — предложения проверенных продавцов по доступным ценам. Оплата российскими картами, через СБП или криптовалютой.

Проверенные продавцы Быстрая выдача Доступные цены
Прокрутить вверх