Ай Дайджест - категория calibration

Я не знаю: явное моделирование неопределенности с помощью токена [IDK]

Большие языковые модели известны тем, что они захватывают знания о реальном мире, что позволяет им преуспевать во многих последующих задачах. Несмотря на недавние достижения, эти модели все еще подвержены тому, что обычно называют «галлюцинациями», что приводит к тому, что они выдают нежелательный и фактически неправильный текст. В этой работе мы предлагаем новый метод калибровки, который можно использовать для борьбы с галлюцинациями. Мы добавляем специальный токен [IDK] ("Я не знаю") в словарь модели и вводим целевую функцию, которая перемещает массу вероятностей к токену [IDK] для неправильных предсказаний. Этот подход позволяет модели явно выражать неопределенность в своих выходных данных. Мы оцениваем наш предложенный метод на нескольких архитектурах модели и фактических задачах. Мы обнаруживаем, что модели, обученные с нашим методом, способны выражать неопределенность в местах, где ранее они допускали ошибки, при этом теряя только небольшую часть закодированных знаний. Кроме того, мы проводим обширные аблационные исследования нескольких вариаций нашего подхода и предоставляем детальный анализ компромисса между точностью и полнотой нашего метода.

2024-12-12evaluation calibration hallucinations