Стартап TypeSafe AI представил Jev — модель, которая не сочиняет ответы, а выбирает из заранее заданных вариантов и указывает вероятность оценки. Для интернет-магазинов, отделов продаж и поддержки это может означать более быструю и дешёвую сортировку обращений. Однако модель не проверяет факты сама: допустимый по форме ответ всё ещё может оказаться ошибочным.
Суть события
Jev встраивается в программу и выносит узкие суждения. Разработчик задаёт вопрос и перечень допустимых ответов, а модель оценивает варианты. Например, сообщение покупателя можно отнести к проблеме с оплатой, доставкой или возвратом и отдельно определить вероятность того, что человек требует вернуть деньги.
Такой подход рассчитан на фоновые операции, где не нужен красивый текст. Программа получает метку и вероятность, после чего применяет обычные правила: отправляет платёжный вопрос в бухгалтерию, помечает запрос на возврат или передаёт сомнительный случай сотруднику. Клиентский ответ при необходимости формирует уже другой инструмент.
Детали
TypeSafe AI заявляет время ответа от 70 до 500 миллисекунд. Миллисекунда — тысячная доля секунды. По объяснению компании, Jev не создаёт текст шаг за шагом и может вычислять несколько оценок параллельно, поэтому добавление вопросов в один вызов почти не увеличивает задержку.
Заявленная цена составляет $0,042 за миллион входных токенов, а за выходные данные компания, по её словам, не берёт плату. Токен — небольшой фрагмент текста, который модель обрабатывает как единицу. Для бизнеса с большим потоком однотипных обращений такая цена выглядит привлекательно: классификацию можно запускать чаще, например перед каждым ответом AI-ассистента, чтобы проверить, не противоречит ли черновик истории диалога.
Разработчики получают доступ через список ожидания. Основатель и глава TypeSafe AI Диогу Алмейда раньше работал в OpenAI и был среди авторов исследования InstructGPT, которое стало одной из основ ChatGPT.
Контекст
Главное ограничение скрыто в формулировке «без галлюцинаций». Галлюцинацией называют уверенный, но выдуманный ответ модели. Jev не выйдет за пределы заданного списка, однако вполне может выбрать неверный пункт внутри него. Если покупатель пишет о двойном списании, метка «возврат» ещё не доказывает, что платёж действительно прошёл дважды. Это нужно сверять с транзакциями.
Обычные языковые модели тоже умеют возвращать заданные категории и структурированные данные — например, OpenAI предлагает Structured Outputs, то есть ответы по заранее установленной схеме. Поэтому преимущество Jev придётся доказывать сочетанием скорости, цены и точности. Опубликованные тесты пока ограничены: компания сравнила четыре собственных сценария, а эталоном служили ответы других моделей, не независимо проверенные решения. Похожую проблему оценки AI-прогнозов мы разбирали в материале «Модель Anthropic отвела жёсткий прогноз Амодея в крайний сценарий».
Что дальше
Компаниям стоит начинать с задачи, где ошибка обратима: сортировки лидов, определения темы обращения или сигнала о необходимости подключить человека. Затем — собрать собственную проверочную выборку, сравнить точность с текущим процессом и посчитать стоимость одной верной классификации, а не только цену миллиона токенов.
Автоматически подтверждать возврат денег или менять статус платежа по одной оценке рискованно. Практичная схема выглядит так: Jev предлагает категорию, фиксированные правила ограничивают действие, а человек разбирает случаи с низкой уверенностью. Если независимые испытания подтвердят качество, такая узкая модель может стать дешёвым слоем контроля внутри продаж и поддержки. Пока скорость обещана убедительно, а надёжность каждому бизнесу предстоит измерить самостоятельно.