Автор собрал русскоязычную модель решений на базе Qwen3.5-4B и обучил её на арендованной RTX 4090. На задачах, похожих на учебные, она забирает в автоматику почти две трети потока, но на незнакомых примерах остаётся среди сильных, а не первой. Для бизнеса это важнее красивой цифры точности: модель должна уметь честно сказать, когда решение лучше передать человеку.
Суть события
Модель решений не пишет ответ абзацем. Она получает данные, вопрос и ограниченный список вариантов — например, к какому отделу направить обращение или кто согласует командировку — и за один проход выдаёт вероятности этих вариантов. Такой подход рассчитан на быстрые повторяющиеся решения, где текстовая импровизация не нужна.
В описанном эксперименте открытая модель на 4 миллиарда параметров была дообучена для русскоязычных задач. Автор сравнивал её с открытыми аналогами, а также с YandexGPT и GigaChat, хотя последние не относятся к моделям решений. Для проверки использовались и задачи, которых модели не видели во время обучения.
Детали
Основой стала Qwen3.5-4B с лицензией Apache 2.0. Обучение шло через LoRA: к исходной модели добавляется небольшая насадка примерно на 130 МБ, а базовые веса не меняются. В набор вошли 100 112 задач: русские открытые данные, синтетические регламенты, англоязычные примеры и задачи Open-Jev с письмами, счетами и инцидентами.
Вместо одного показателя точности автор предлагает смотреть на три вещи. Первая — доля решений, которые можно отдать автоматике при заранее заданной точности. Вторая — уверенные ошибки, когда модель ошибается при вероятности выше 90%. Третья — калибровка: если система говорит «80%», она должна быть права примерно в восьми случаях из десяти. Для практического внедрения пригодится и разбор способов ускорить работу модели без покупки новых видеокарт, особенно если стоимость вычислений становится ограничением.
Контекст
Поводом для эксперимента стала Jev от TypeSafe AI, выпущенная в сентябре 2026 года. Jev задумана как «Система 1»: быстро выбирать из заданных вариантов, а не вести длинный диалог. По описанию автора, один ответ занимает 70–500 мс, а цена для разработчика указана как 0,042 доллара за миллион входных токенов; сам ответ не тарифицируется отдельно.
У такого подхода есть и слабые места. У Jev закрыты веса, отдельное решение трудно объяснить, а независимых проверок на старте не было. Для российских компаний добавляются передача данных внешнему сервису, требования 152-ФЗ и вопрос доступности. Открытая русская модель снимает часть зависимости от поставщика, но не отменяет проверку качества на собственных обращениях и правилах.
Что дальше
Практический вывод для команды простой: сначала собрать небольшой набор реальных задач с правильными ответами, затем измерить не только точность, но и долю безопасной автоматизации. Уверенные ответы можно направлять в рабочий процесс, а сомнительные — сотруднику. Порог нельзя выбирать по красивому результату на учебных данных.
Эксперимент показывает рабочее направление, а не готовую замену специалистам. Модель сильнее всего там, где варианты заранее известны и ошибку можно обнаружить по низкой уверенности. Для новых типов обращений, спорных решений и чувствительных процессов человеческая проверка остаётся необходимой.