Локальная нейросеть: когда своя модель дешевле облака
Посчитал стоимость миллиона токенов на арендованной видеокарте и сравнил с ценами API. Результат неожиданный: по деньгам локальная модель почти никогда не выигрывает.
Короткий ответ: по деньгам локальная модель выигрывает редко и только при высокой круглосуточной загрузке. При обычном режиме — запросы приходят неравномерно, видеокарта простаивает — миллион токенов обходится дороже, чем у большинства облачных провайдеров, включая недешёвые.
Я посчитал это на реальных ценах, а не на ощущениях. Ниже расчёт, потом вывод: локальная модель окупается, но не деньгами.
Расчёт
Исходные данные. Аренда видеокарты у российских провайдеров на сентябрь 2026: RTX 4090 — около 83 ₽/час, A100 80GB — от 223 ₽/час, H100 — от 353 ₽/час. Курс ЦБ на 5 сентября — 86.59 ₽ за доллар. Цены API беру в смеси 80% вход / 20% выход, характерной для задач с длинным контекстом.
Цена миллиона токенов у API:
| Модель | ₽ за 1M токенов |
|---|---|
| Qwen3.7 Flash | 4.3 |
| GPT-5.6 Luna | 34.6 |
| Gemini 3.7 Flash | 116.9 |
| Claude Sonnet 5 | 311.7 |
| Claude Opus 5 | 779.3 |
Цена миллиона токенов на своей видеокарте. Здесь всё решает не тариф, а пропускная способность: аренда идёт за час, а не за токен, поэтому простаивающая карта стоит столько же, сколько загруженная.
| Загрузка | Токенов в месяц | RTX 4090 | A100 80GB |
|---|---|---|---|
| Один поток (~50 ток/с) | 130 млн | 461 ₽ | 1239 ₽ |
| Пакетно, средняя (~300 ток/с) | 778 млн | 77 ₽ | 207 ₽ |
| Пакетно, высокая (~800 ток/с) | 2074 млн | 29 ₽ | 77 ₽ |
Круглосуточно, 30 дней. Пропускная способность взята консервативно и на вашей модели будет другой — важен порядок, а не третий знак.
Что из расчёта следует
Одиночный поток — худший режим из возможных. 461 ₽ за миллион токенов дороже, чем Sonnet 5, и в сто раз дороже дешёвого тарифа. А именно так локальную модель обычно и запускают: поставили, шлём запросы по мере надобности, карта девяносто процентов времени греет воздух.
Провайдер выигрывает не тарифом, а упаковкой. Он складывает запросы тысяч клиентов в один пакет и держит карту загруженной постоянно. Повторить это у себя можно только при собственном постоянном потоке — а он есть у единиц.
Сравнивать надо в одном классе. На RTX 4090 помещается модель на 7–14 миллиардов параметров. Это класс дешёвых облачных тарифов, а не Opus 5. И в своём классе локальная модель проигрывает даже в лучшем режиме: 29 ₽ против 4.3 ₽ — почти в семь раз.
Сравнение «моя карта дешевле, чем Opus» некорректно ровно потому, что модель на карте не делает того, что делает Opus.
Тогда зачем локальные модели
Затем, что деньги — не единственное требование, и остальные четыре закрываются только так.
Данные не уходят наружу. Для персональных данных, коммерческой тайны и медицинских записей это не оптимизация, а условие допуска. При работе с персональными данными это ещё и вопрос локализации по части 5 статьи 18 закона 152-ФЗ: обработка должна идти на территории России. Локальная модель снимает вопрос целиком, облачная — переносит его в плоскость договора и уведомлений.
Предсказуемый счёт. Аренда карты стоит фиксированную сумму независимо от нагрузки. Для планирования бюджета это иногда важнее, чем средняя цена: счёт, который нельзя случайно утроить неудачным ретраем, стоит переплаты.
Независимость от провайдера. Модель не обновится под тем же именем, не подорожает и не будет снята с обслуживания. Про то, как обновление модели на стороне провайдера ломает работающий контур, я писал в «Регрессиях в промптах».
Работа без интернета. Редкое, но абсолютное требование.
Если ни одного из четырёх нет — считайте деньги, и расчёт выше отвечает на вопрос.
Условие несогласия
Расчёт сделан для аренды. Если карта уже куплена и стоит, предельная стоимость токена падает почти до электричества, и картина меняется: неиспользуемая мощность, за которую уже заплачено, — это другая экономика.
Но и здесь стоит считать честно: покупка сервера с двумя RTX 4090 начинается от 450 000 ₽, что при цене дешёвого API покрывает более ста миллиардов токенов. Окупаемость по деньгам получается за горизонтом, на котором и видеокарта, и модель успеют устареть.
Чего я делать не стал бы
Не стал бы поднимать локальную модель, чтобы «сэкономить», не посчитав загрузку. Экономия появляется только из плотной пакетной обработки, и если у вас её нет, вы платите за простой.
Не стал бы недооценивать эксплуатацию. Облако — это счёт; своя карта — это обновления драйверов, мониторинг, дежурство и вопрос, что делать, когда она отвалится в пятницу вечером. В расчёте выше этих часов нет, а в жизни они есть.
Не стал бы ставить локальную модель на задачу, где нужно качество верхнего класса. Разрыв между тем, что помещается на одну карту, и тем, что отдаёт облако, сейчас велик, и промптами он не закрывается.
Открытый вопрос
Расчёт держится на предположении о пропускной способности, а она сильно зависит от модели, квантования и движка. Разброс между аккуратной конфигурацией и настроенной по умолчанию — кратный, и это ровно тот множитель, который решает, выгодно или нет.
Честного способа оценить его заранее, не развернув стенд, я не знаю. Получается замкнутый круг: чтобы понять, окупится ли локальная модель, надо сначала потратить неделю на её разворачивание — а эта неделя в расчёт окупаемости обычно не попадает.