Регрессии в промптах: сравнивать надо свойства, а не текст
Промпт — это код, у которого по умолчанию нет ни тестов, ни диффа. Разбираю, почему обычное сравнение ответов не работает и что класть в журнал прогона вместо него.
Длинные разборы того, что я собирал сам: устройство, места отказа и выводы, которые пережили практику.
Промпт — это код, у которого по умолчанию нет ни тестов, ни диффа. Разбираю, почему обычное сравнение ответов не работает и что класть в журнал прогона вместо него.
Метрика растёт, ответы не улучшаются. Разбираю, почему считать надо по кускам, и показываю на измерении собственного корпуса, что делает с текстом фиксированная нарезка.
Судья совпадает с человеком примерно так же часто, как человек совпадает с человеком. Проблема не в проценте совпадений, а в том, что его ошибки систематические.
Совет «соберите двадцать примеров для оценки» звучит как выдумка. Я посчитал: он верен, но по причине, которую обычно не называют, — и у него есть слепая зона.
Цена за миллион токенов — наименее информативное число в счёте. Разбираю, из чего складывается стоимость задачи: многословность, разреженная активация, кеш, кадры и язык. С измерениями.
Почему «ответь в JSON» ненадёжно, что дают схемы и структурированный вывод, и как обращаться с полем, которого модель не знает.
Близость векторов — это не близость смысла в том виде, в каком её понимает человек. Разбираю, где расходится, почему поиск находит не то и что с этим делать.
Как модель на самом деле выбирает следующий токен, что делают ручки сэмплирования и почему нулевая температура не даёт гарантии повторяемости.