Алексей Маркин рабочий журнал

ищет по заголовкам и тексту записей и заметок

запись 5 сентября 2026 г. · 5 мин
Все статьи

Локальная нейросеть: когда своя модель дешевле облака

Посчитал стоимость миллиона токенов на арендованной видеокарте и сравнил с ценами API. Результат неожиданный: по деньгам локальная модель почти никогда не выигрывает.

Короткий ответ: по деньгам локальная модель выигрывает редко и только при высокой круглосуточной загрузке. При обычном режиме — запросы приходят неравномерно, видеокарта простаивает — миллион токенов обходится дороже, чем у большинства облачных провайдеров, включая недешёвые.

Я посчитал это на реальных ценах, а не на ощущениях. Ниже расчёт, потом вывод: локальная модель окупается, но не деньгами.

Расчёт

Исходные данные. Аренда видеокарты у российских провайдеров на сентябрь 2026: RTX 4090 — около 83 ₽/час, A100 80GB — от 223 ₽/час, H100 — от 353 ₽/час. Курс ЦБ на 5 сентября — 86.59 ₽ за доллар. Цены API беру в смеси 80% вход / 20% выход, характерной для задач с длинным контекстом.

Цена миллиона токенов у API:

Модель₽ за 1M токенов
Qwen3.7 Flash4.3
GPT-5.6 Luna34.6
Gemini 3.7 Flash116.9
Claude Sonnet 5311.7
Claude Opus 5779.3

Цена миллиона токенов на своей видеокарте. Здесь всё решает не тариф, а пропускная способность: аренда идёт за час, а не за токен, поэтому простаивающая карта стоит столько же, сколько загруженная.

ЗагрузкаТокенов в месяцRTX 4090A100 80GB
Один поток (~50 ток/с)130 млн461 ₽1239 ₽
Пакетно, средняя (~300 ток/с)778 млн77 ₽207 ₽
Пакетно, высокая (~800 ток/с)2074 млн29 ₽77 ₽

Круглосуточно, 30 дней. Пропускная способность взята консервативно и на вашей модели будет другой — важен порядок, а не третий знак.

4090, один поток461 ₽Claude Sonnet 5312 ₽Gemini 3.7 Flash117 ₽4090, пакетно средне77 ₽GPT-5.6 Luna35 ₽4090, пакетно плотно29 ₽Qwen3.7 Flash4.3 ₽
рис. 1 Стоимость миллиона токенов. Локальная видеокарта в режиме одиночного потока дороже почти всего облака; выигрыш появляется только при плотной пакетной загрузке.

Что из расчёта следует

Одиночный поток — худший режим из возможных. 461 ₽ за миллион токенов дороже, чем Sonnet 5, и в сто раз дороже дешёвого тарифа. А именно так локальную модель обычно и запускают: поставили, шлём запросы по мере надобности, карта девяносто процентов времени греет воздух.

Провайдер выигрывает не тарифом, а упаковкой. Он складывает запросы тысяч клиентов в один пакет и держит карту загруженной постоянно. Повторить это у себя можно только при собственном постоянном потоке — а он есть у единиц.

Сравнивать надо в одном классе. На RTX 4090 помещается модель на 7–14 миллиардов параметров. Это класс дешёвых облачных тарифов, а не Opus 5. И в своём классе локальная модель проигрывает даже в лучшем режиме: 29 ₽ против 4.3 ₽ — почти в семь раз.

Сравнение «моя карта дешевле, чем Opus» некорректно ровно потому, что модель на карте не делает того, что делает Opus.

Тогда зачем локальные модели

Затем, что деньги — не единственное требование, и остальные четыре закрываются только так.

Данные не уходят наружу. Для персональных данных, коммерческой тайны и медицинских записей это не оптимизация, а условие допуска. При работе с персональными данными это ещё и вопрос локализации по части 5 статьи 18 закона 152-ФЗ: обработка должна идти на территории России. Локальная модель снимает вопрос целиком, облачная — переносит его в плоскость договора и уведомлений.

Предсказуемый счёт. Аренда карты стоит фиксированную сумму независимо от нагрузки. Для планирования бюджета это иногда важнее, чем средняя цена: счёт, который нельзя случайно утроить неудачным ретраем, стоит переплаты.

Независимость от провайдера. Модель не обновится под тем же именем, не подорожает и не будет снята с обслуживания. Про то, как обновление модели на стороне провайдера ломает работающий контур, я писал в «Регрессиях в промптах».

Работа без интернета. Редкое, но абсолютное требование.

Если ни одного из четырёх нет — считайте деньги, и расчёт выше отвечает на вопрос.

Условие несогласия

Расчёт сделан для аренды. Если карта уже куплена и стоит, предельная стоимость токена падает почти до электричества, и картина меняется: неиспользуемая мощность, за которую уже заплачено, — это другая экономика.

Но и здесь стоит считать честно: покупка сервера с двумя RTX 4090 начинается от 450 000 ₽, что при цене дешёвого API покрывает более ста миллиардов токенов. Окупаемость по деньгам получается за горизонтом, на котором и видеокарта, и модель успеют устареть.

Чего я делать не стал бы

Не стал бы поднимать локальную модель, чтобы «сэкономить», не посчитав загрузку. Экономия появляется только из плотной пакетной обработки, и если у вас её нет, вы платите за простой.

Не стал бы недооценивать эксплуатацию. Облако — это счёт; своя карта — это обновления драйверов, мониторинг, дежурство и вопрос, что делать, когда она отвалится в пятницу вечером. В расчёте выше этих часов нет, а в жизни они есть.

Не стал бы ставить локальную модель на задачу, где нужно качество верхнего класса. Разрыв между тем, что помещается на одну карту, и тем, что отдаёт облако, сейчас велик, и промптами он не закрывается.

Открытый вопрос

Расчёт держится на предположении о пропускной способности, а она сильно зависит от модели, квантования и движка. Разброс между аккуратной конфигурацией и настроенной по умолчанию — кратный, и это ровно тот множитель, который решает, выгодно или нет.

Честного способа оценить его заранее, не развернув стенд, я не знаю. Получается замкнутый круг: чтобы понять, окупится ли локальная модель, надо сначала потратить неделю на её разворачивание — а эта неделя в расчёт окупаемости обычно не попадает.