Алексей Маркин рабочий журнал

ищет по заголовкам и тексту записей и заметок

заметка 15 сентября 2026 г. · 2 мин
Все заметки

Рассуждающие модели: что это и когда платить за размышление

Модель с размышлением пишет цепочку шагов до ответа, и эти токены оплачиваются как выход. Окупается на многошаговых задачах с проверяемым ответом, почти не помогает с фактами и переписыванием.

Короткий ответ: рассуждающая модель перед ответом пишет цепочку промежуточных шагов и только потом выдаёт результат. Эти шаги — обычные токены: их оплачивают по цене выхода и их ждут, даже если пользователь видит лишь краткую выжимку или не видит ничего. Окупается это на многошаговых задачах с проверяемым ответом.

Практическое следствие: размышление — не столько свойство модели, сколько режим расхода. У OpenAI и Anthropic его глубину задают параметром усилия, и на нижних уровнях модель думает мало или пропускает размышление совсем, особенно на простом запросе. Вопрос поэтому не «брать ли модель с размышлением», а сколько размышления давать этой задаче.

Где окупается. Математика, код, планирование, отладка — всё, где ошибка на третьем шаге ломает десятый, а итог проверяется тестом или подстановкой. Лишние токены здесь дешевле повторного прогона после проваленной проверки.

Где почти не помогает. Извлечь поля из документа, ответить по приложенному тексту, переписать абзац. Многошагового вывода там нет, есть чтение и формулировка, и размышление добавляет задержку почти без прибавки качества. На фактах бывает хуже: рассуждение о несуществующем пункте регламента получается стройным и от этого убедительным.

Больше — не значит лучше. Есть опубликованные замеры, где удлинение рассуждения снижало точность: на простом подсчёте с отвлекающими деталями часть моделей начинала учитывать лишнее. Поэтому максимальное усилие я по умолчанию не ставлю.

Моё правило: сравнивать на своих примерах, а не по названию. Беру двадцать задач из реальных провалов, прогоняю на двух уровнях усилия и смотрю долю верных ответов, выходные токены на задачу и время до ответа. Токены размышления оба провайдера отдают отдельным числом в output_tokens_details, и без него счёт за выход не объяснить. Часто выигрывает не одна конфигурация, а две: план строит модель с размышлением, рутинные шаги исполняет быстрая — модель под задачу, а не одна на всё.

Граница правила — агент. Там размышление умножается на число шагов, а у части моделей размышления прошлых ходов остаются в контексте и оплачиваются ещё раз как вход. Замерять приходится цикл целиком, а не отдельный вызов.