Thomson Reuters за два с лишним года вложила около $40 млн в создание собственной языковой модели для юридической работы. Публике обычно показывают цифру $450 000 — но это лишь стоимость финального запуска, а не проект целиком. Разбираем на ai-digest.ru.
Суть события
Thomson Reuters создала первую полностью собственную языковую модель — на базе открытого Qwen от Alibaba (Qwen3.5-397B). Промежуточная версия после переобучения на безопасность и этику получила кодовое имя Snowdon — в честь горы в Уэльсе. Затем модель дообучали на контенте компании (Westlaw, Practical Law, Checkpoint, Reuters) и настраивали совместно с сотнями профильных экспертов. Пока задействовано меньше 10% доступного массива данных.
На старте модель взяла на себя функцию Tabular Analysis в продукте CoCounsel Legal — там, где нужен быстрый и дешёвый ответ на высоконагруженных задачах вроде проверки цитирования. Модель не является оркестратором; она выполняет узкие подзадачи. Данные клиентов в обучение не идут. Позже компания обещает выложить уменьшенную версию на Hugging Face под некоммерческой лицензией.
Детали
CTO Joel Hron описывает это как «покупку дома, а не аренду»: каждый экспертный разбор в ходе обновления продукта становится частью обучающих данных, и эта ценность накапливается. С провайдерскими моделями ничего не остаётся. Microsoft пошла по схожему пути, заменив OpenAI и Anthropic на собственные MAI в продуктах Copilot — и тренд на «своё» вместо «арендованного» только набирает обороты. Главная находка — не столько конкретная модель, сколько «фабрика моделей», которую построили в компании: исследовательский директор Jonathan Schwartz называет это ключевым результатом.
На собственных бенчмарках Thomson Reuters впереди при доступе к внутреннему контенту (0,83 против 0,82 у GPT 5.4), но с обычным веб-доступом отстаёт (0,53 против 0,65). На Stanford LegalBench компания уступает Gemini 3.1 Pro и GPT-5.5, на кодировании — заметно слабее. Оценщик Andrew Bean честно признаёт: «в пределах досягаемости других моделей, но точно не лидер». При этом GPT 5.4 получает почти такой же прирост от доступа к контенту Thomson — значит, данные решают больше, чем специализированное обучение.
Компания утверждает, что это окупается на задачах высокого объёма вроде ревью документов, где счёт идёт на тысячи операций. Для более широких сценариев провайдерские модели пока выгоднее.
Контекст
Thomson Reuters — не первая компания, которая задумалась о собственной модели. Но у неё есть три редких актива: эксклюзивные данные (десятилетия контента из юридических и налоговых баз), эксперты, способные оценивать качество объективно, и измеримые рабочие процессы. Именно это сочетание делает эксперимент реалистичным, а не умозрительным. Для компаний без таких активов собирать свою модель — значит в основном оплачивать текущую поддержку.
При этомopensource-сообщество догоняет лидеров рынка всего за несколько месяцев. $40 млн — достаточная сумма для конкурентной специализированной модели, если у вас есть данные и экспертиза. Для остальных — аренда у OpenAI или Anthropic остаётся прагматичным выбором.
Что дальше
Следующий конкурентный шаг, по словам Hron, — научиться «оркестрировать» модели и понимать, какую интеллектуальную работу имеет смысл держать у себя. Thomson Reuters планирует нарастить долю задействованного контента, перейти на более мощный Qwen3.8 и ведёт предварительные переговоры о прямом лицензировании модели юридическим фирмам. Если модель продолжит улучшаться, она может стать реальной альтернативой для задач, где сейчас доминирует OpenAI.