Алексей Маркин рабочий журнал

ищет по заголовкам и тексту записей и заметок

заметка 3 сентября 2026 г. · 1 мин
Все заметки

Оценка уверенности почти не калибрована

Попросить модель приписать ответу «уверенность 85%» легко. Считать это число вероятностью нельзя: оно отражает уверенность формулировки, а не знания.

Приём выглядит убедительно: пусть модель к каждому ответу добавляет оценку уверенности, а мы отправим на ручную проверку всё, что ниже порога.

Проблема в том, что число берётся не оттуда, откуда кажется.

Модель порождает его так же, как остальной текст, — как правдоподобное продолжение. Оно коррелирует с тем, насколько уверенно звучит сформулированный ответ, а не с тем, насколько он верен. Аккуратно изложенная выдумка получает высокую оценку, потому что выглядит как текст, рядом с которым в обучающей выборке стояли высокие оценки.

Практическое следствие неприятное: фильтр по порогу отсеивает осторожные ответы и пропускает уверенные ошибки. То есть работает ровно против того, ради чего ставился.

Что даёт больше при том же усилии — просить не число, а основание. «Приведи цитату из документа, на которой держится ответ» проверяется за секунду: цитата либо есть в исходнике, либо её там нет. Это уже не самооценка, а ссылка, и её можно сверить механически.

Второй работающий вариант — спросить, чего не хватает. «Какие данные изменили бы ответ» — вопрос, на который модель отвечает содержательно, потому что он про текст, а не про её внутреннее состояние.

Оговорка: как относительная величина внутри одной задачи оценка иногда полезна — отсортировать сотню ответов и посмотреть на хвост. Как абсолютная вероятность — нет.