Алексей Маркин рабочий журнал

ищет по заголовкам и тексту записей и заметок

запись 6 сентября 2026 г. · 4 мин
Все статьи

Какую нейросеть выбрать под задачу

Процедура выбора из четырёх шагов вместо сравнения бенчмарков: что должно быть решено до модели, по какому признаку сравнивать и когда переходить на другую.

Короткий ответ: выбор модели — последнее решение, а не первое. Пока не описаны вход, проверка результата и стандарт готовности, сравнивать нечего: на неопределённой задаче любая модель выглядит приемлемой, а разница между ними тонет в разбросе формулировок.

Когда это описано, выбор занимает полдня и делается по процедуре из четырёх шагов, а не по таблицам бенчмарков.

Почему бенчмарки почти не помогают

Публичные рейтинги отвечают на вопрос «какая модель в среднем сильнее», а вам нужен ответ на «какая справится с этим».

Три причины расхождения, и все три встречаются постоянно.

Вашей задачи в наборе нет. Разбор счетов-фактур, извлечение полей из ГОСТовской документации, ответы по внутреннему регламенту — ничего подобного в общих бенчмарках не измеряется.

Язык. Большинство наборов англоязычные. На русском расстановка мест меняется, и предсказать это по общей таблице нельзя.

Многословность не учтена в цене. Модель, которая пишет в полтора раза больше на ту же задачу, стоит в полтора раза дороже при том же тарифе — считал это отдельно.

Бенчмарки полезны ровно для одного: сузить список до трёх-четырёх кандидатов. Дальше — только свой замер.

Процедура

1. Задачавход, выход, проверка2. Двадцать примеровиз провалов, не из удач3. Три кандидатаразных ценовых классов4. Замерсвои примеры, три прогонашаги 1—2 занимают день и переиспользуются при любой смене модели
рис. 1 Порядок решений. Три верхних шага не про модель вообще — и пропуск любого из них делает четвёртый бессмысленным.

Шаг 1. Описать задачу так, чтобы её можно было провалить. Что приходит на вход, что считается готовым результатом, кто это принимает. Без этого дальше идти некуда — рабочий контур вместо «внедрить ИИ» ровно про это.

Шаг 2. Собрать двадцать примеров. Из реальных провалов и пограничных случаев, а не из удачных. Двадцати хватает, потому что сравнение будет парным — одни и те же входы на всех кандидатах; почему именно двадцать.

Шаг 3. Взять трёх кандидатов из разных ценовых классов. Дешёвый, средний, верхний. Смысл не в том, чтобы найти лучший, а в том, чтобы понять форму кривой: если дешёвый справляется, верхний брать незачем; если не справляется даже верхний — проблема не в модели.

Шаг 4. Прогнать по три раза каждого. Три прогона показывают разброс: если ответы одного кандидата расходятся по существу, он для этой задачи неустойчив, каким бы ни был средний результат.

По какому признаку сравнивать

Не «какой ответ лучше» — это вкусовщина, которая не воспроизводится через неделю. Сравниваются проверяемые свойства: разобрался ли ответ по схеме, совпало ли значение поля, есть ли цитата-основание в исходнике, уложился ли объём в заданный. Как это устроено — в «Регрессиях в промптах».

Отдельно фиксируется цена: токены на входе и выходе. На этом шаге часто и происходит разворот — кандидат, который отвечает чуть хуже, но втрое дешевле, оказывается правильным выбором, потому что разница уходит в проверку, а она всё равно нужна.

Когда менять модель

Смена оправдана в трёх случаях, и «вышла новая» в их число не входит:

  • качество упёрлось, и промпт с примерами доведены до конца;
  • счёт вырос сильнее, чем польза, и есть кандидат дешевле того же класса;
  • изменились требования — например, данные больше нельзя отдавать наружу, и вопрос переходит в плоскость локальной модели.

Во всех трёх у вас уже есть набор примеров с прошлого выбора, и проверка нового кандидата занимает час.

Условие несогласия

Всё описанное — про задачу, которая выполняется многократно. Для разового разбора берите модель, которая под рукой: время на процедуру дороже любой разницы в качестве на одном прогоне.

Граница та же, что и в остальных решениях этого рода — число повторений.

Чего я делать не стал бы

Не стал бы выбирать по цене входа. Выход стоит в четыре-пять раз дороже, и на прайсе это видно хуже.

Не стал бы сравнивать модели на разных промптах. Промпт, подобранный под одну, систематически занижает другую — сравнение превращается в сравнение вашей усидчивости.

Не стал бы переносить выбор с одной задачи на другую внутри проекта. Разные шаги требуют разного: там, где нужно зрение, и там, где нужен короткий структурированный вызов, выигрывают разные модели — и это нормально, что в системе их несколько.

Открытый вопрос

Процедура даёт ответ на сегодня. Модели обновляются под теми же именами, и выбор, сделанный три месяца назад, может уже не быть верным — причём без единого признака снаружи.

Правильно было бы прогонять набор примеров по расписанию на всех кандидатах и следить за расстановкой. На практике этого почти никто не делает, включая меня: набор есть, дисциплины гонять его без повода — нет. Пока лучшее, до чего я дошёл, — перепроверять при каждом заметном изменении счёта, потому что счёт меняется раньше, чем качество.