Анализ 857 релизов девяти китайских лабораторий за период с 2021 года по сентябрь 2026-го показал редкую практику: только 3,6% выпусков сопровождались опубликованными результатами проверки безопасности от разработчика, а при самом запуске — лишь 1,1%. Данные приводит SemiAnalysis. Для компаний и пользователей это означает простой риск: заявленная готовность новой модели ещё не равна понятной проверке её поведения.
Суть события
SemiAnalysis изучила 857 выпусков от девяти китайских лабораторий и отдельно посмотрела, публиковали ли разработчики результаты оценки безопасности. В общей выборке такие результаты появились только у 3,6% релизов. Если считать именно момент запуска, доля снизилась до 1,1%.
Речь не о том, что остальные модели обязательно небезопасны. Источник показывает другое: публичного подтверждения проверки в большинстве случаев нет. Для читателя это важное различие — отсутствие отчёта не доказывает проблему, но оставляет её без понятного ответа.
Почему момент запуска имеет значение
Проверка после публикации и проверка до неё — не одно и то же. Когда результаты появляются одновременно с релизом, пользователи и компании получают хотя бы базовое представление о том, какие ограничения разработчик уже проверил. При доле 1,1% такая информация остаётся скорее исключением.
Особенно заметно это в ситуациях, где модель сразу встраивают в рабочий процесс: обработку документов, поддержку клиентов или написание кода. Команда может оценить точность на своих примерах, но не должна считать такой тест заменой независимой оценке рисков. Для общего понимания темы пригодится материал о том, как AI-компании пытаются удерживать модели под контролем.
Что именно можно заключить из данных
Анализ описывает публичность результатов безопасности, а не измеряет фактическое качество каждой модели. Он не позволяет утверждать, что 96,4% релизов не проходили никаких внутренних проверок. Разработчики могли проводить их без публикации, использовать другую методику или раскрывать сведения в формате, который не попал в подсчёт.
Поэтому цифры лучше читать как показатель прозрачности отрасли. Пользователь видит не только саму модель, но и то, насколько легко проверить заявления о её надёжности. Здесь нас смущает не одна конкретная лаборатория, а разрыв между скоростью выпусков и доступностью сопроводительных данных.
Что дальше
Для компаний практический вывод осторожный: при выборе новой модели нужно отдельно спрашивать, какие проверки проведены, какие ограничения известны и опубликованы ли результаты. Если ответа нет, это не повод автоматически отказаться от инструмента, но причина заложить собственное тестирование и ограничить доступ к чувствительным данным на старте.
Для разработчиков публикация краткого отчёта безопасности вместе с релизом стала бы понятным сигналом зрелости. Пока анализ SemiAnalysis показывает, что такая практика в китайской экосистеме остаётся редкой. Дальнейшее сравнение лабораторий потребует более подробных открытых данных о методиках, а их в исходном сообщении нет.