Локальная нейросеть: когда своя модель дешевле облака
Посчитал стоимость миллиона токенов на арендованной видеокарте и сравнил с ценами API. Результат неожиданный: по деньгам локальная модель почти никогда не выигрывает.
Кодовые агенты, MCP, CLI-обвязка и то, как это меняет ежедневную инженерную работу.
Посчитал стоимость миллиона токенов на арендованной видеокарте и сравнил с ценами API. Результат неожиданный: по деньгам локальная модель почти никогда не выигрывает.
Разбор приёмов по величине эффекта: что действительно меняет ответ, что меняет только его форму и что попало в подборки по инерции. С проверяемыми признаками.
Что меняется, когда агент выходит из терминала на десктоп и получает доступ к файлам, командам и чужим окнам: по какому признаку делить права, чем эти права обеспечены на самом деле, что подтверждать и что журналировать. На примере Faber — программы, которую я строю сам.
Промпт — это код, у которого по умолчанию нет ни тестов, ни диффа. Разбираю, почему обычное сравнение ответов не работает и что класть в журнал прогона вместо него.
Почему «ответь в JSON» ненадёжно, что дают схемы и структурированный вывод, и как обращаться с полем, которого модель не знает.
Как модель на самом деле выбирает следующий токен, что делают ручки сэмплирования и почему нулевая температура не даёт гарантии повторяемости.
Где ускорение от кодовых агентов реальное, где мнимое, почему граница проходит по стоимости приёмки и какой навык становится дефицитным.
Агент читает ваш код как контекст. Переменная `data2` и функция `process()` говорят ему ровно столько же, сколько вам, — то есть ничего.
Ответ в переписке нельзя ни продиффить, ни прокомментировать построчно. Файл превращает разговор в работу с версиями.
Почему один хорошо написанный файл с правилами проекта даёт больший прирост качества, чем переход на модель поновее — и когда это перестаёт быть правдой.
Не «протокол для подключения инструментов», а место, где вы решаете, что агенту можно, а что нет — и почему такая рамка ускоряет принятие решений.