Какую нейросеть выбрать под задачу
Процедура выбора из четырёх шагов вместо сравнения бенчмарков: что должно быть решено до модели, по какому признаку сравнивать и когда переходить на другую.
Короткий ответ: выбор модели — последнее решение, а не первое. Пока не описаны вход, проверка результата и стандарт готовности, сравнивать нечего: на неопределённой задаче любая модель выглядит приемлемой, а разница между ними тонет в разбросе формулировок.
Когда это описано, выбор занимает полдня и делается по процедуре из четырёх шагов, а не по таблицам бенчмарков.
Почему бенчмарки почти не помогают
Публичные рейтинги отвечают на вопрос «какая модель в среднем сильнее», а вам нужен ответ на «какая справится с этим».
Три причины расхождения, и все три встречаются постоянно.
Вашей задачи в наборе нет. Разбор счетов-фактур, извлечение полей из ГОСТовской документации, ответы по внутреннему регламенту — ничего подобного в общих бенчмарках не измеряется.
Язык. Большинство наборов англоязычные. На русском расстановка мест меняется, и предсказать это по общей таблице нельзя.
Многословность не учтена в цене. Модель, которая пишет в полтора раза больше на ту же задачу, стоит в полтора раза дороже при том же тарифе — считал это отдельно.
Бенчмарки полезны ровно для одного: сузить список до трёх-четырёх кандидатов. Дальше — только свой замер.
Процедура
Шаг 1. Описать задачу так, чтобы её можно было провалить. Что приходит на вход, что считается готовым результатом, кто это принимает. Без этого дальше идти некуда — рабочий контур вместо «внедрить ИИ» ровно про это.
Шаг 2. Собрать двадцать примеров. Из реальных провалов и пограничных случаев, а не из удачных. Двадцати хватает, потому что сравнение будет парным — одни и те же входы на всех кандидатах; почему именно двадцать.
Шаг 3. Взять трёх кандидатов из разных ценовых классов. Дешёвый, средний, верхний. Смысл не в том, чтобы найти лучший, а в том, чтобы понять форму кривой: если дешёвый справляется, верхний брать незачем; если не справляется даже верхний — проблема не в модели.
Шаг 4. Прогнать по три раза каждого. Три прогона показывают разброс: если ответы одного кандидата расходятся по существу, он для этой задачи неустойчив, каким бы ни был средний результат.
По какому признаку сравнивать
Не «какой ответ лучше» — это вкусовщина, которая не воспроизводится через неделю. Сравниваются проверяемые свойства: разобрался ли ответ по схеме, совпало ли значение поля, есть ли цитата-основание в исходнике, уложился ли объём в заданный. Как это устроено — в «Регрессиях в промптах».
Отдельно фиксируется цена: токены на входе и выходе. На этом шаге часто и происходит разворот — кандидат, который отвечает чуть хуже, но втрое дешевле, оказывается правильным выбором, потому что разница уходит в проверку, а она всё равно нужна.
Когда менять модель
Смена оправдана в трёх случаях, и «вышла новая» в их число не входит:
- качество упёрлось, и промпт с примерами доведены до конца;
- счёт вырос сильнее, чем польза, и есть кандидат дешевле того же класса;
- изменились требования — например, данные больше нельзя отдавать наружу, и вопрос переходит в плоскость локальной модели.
Во всех трёх у вас уже есть набор примеров с прошлого выбора, и проверка нового кандидата занимает час.
Условие несогласия
Всё описанное — про задачу, которая выполняется многократно. Для разового разбора берите модель, которая под рукой: время на процедуру дороже любой разницы в качестве на одном прогоне.
Граница та же, что и в остальных решениях этого рода — число повторений.
Чего я делать не стал бы
Не стал бы выбирать по цене входа. Выход стоит в четыре-пять раз дороже, и на прайсе это видно хуже.
Не стал бы сравнивать модели на разных промптах. Промпт, подобранный под одну, систематически занижает другую — сравнение превращается в сравнение вашей усидчивости.
Не стал бы переносить выбор с одной задачи на другую внутри проекта. Разные шаги требуют разного: там, где нужно зрение, и там, где нужен короткий структурированный вызов, выигрывают разные модели — и это нормально, что в системе их несколько.
Открытый вопрос
Процедура даёт ответ на сегодня. Модели обновляются под теми же именами, и выбор, сделанный три месяца назад, может уже не быть верным — причём без единого признака снаружи.
Правильно было бы прогонять набор примеров по расписанию на всех кандидатах и следить за расстановкой. На практике этого почти никто не делает, включая меня: набор есть, дисциплины гонять его без повода — нет. Пока лучшее, до чего я дошёл, — перепроверять при каждом заметном изменении счёта, потому что счёт меняется раньше, чем качество.