Оценка уверенности почти не калибрована
Попросить модель приписать ответу «уверенность 85%» легко. Считать это число вероятностью нельзя: оно отражает уверенность формулировки, а не знания.
Приём выглядит убедительно: пусть модель к каждому ответу добавляет оценку уверенности, а мы отправим на ручную проверку всё, что ниже порога.
Проблема в том, что число берётся не оттуда, откуда кажется.
Модель порождает его так же, как остальной текст, — как правдоподобное продолжение. Оно коррелирует с тем, насколько уверенно звучит сформулированный ответ, а не с тем, насколько он верен. Аккуратно изложенная выдумка получает высокую оценку, потому что выглядит как текст, рядом с которым в обучающей выборке стояли высокие оценки.
Практическое следствие неприятное: фильтр по порогу отсеивает осторожные ответы и пропускает уверенные ошибки. То есть работает ровно против того, ради чего ставился.
Что даёт больше при том же усилии — просить не число, а основание. «Приведи цитату из документа, на которой держится ответ» проверяется за секунду: цитата либо есть в исходнике, либо её там нет. Это уже не самооценка, а ссылка, и её можно сверить механически.
Второй работающий вариант — спросить, чего не хватает. «Какие данные изменили бы ответ» — вопрос, на который модель отвечает содержательно, потому что он про текст, а не про её внутреннее состояние.
Оговорка: как относительная величина внутри одной задачи оценка иногда полезна — отсортировать сотню ответов и посмотреть на хвост. Как абсолютная вероятность — нет.