Локальная нейросеть: когда своя модель дешевле облака
Посчитал стоимость миллиона токенов на арендованной видеокарте и сравнил с ценами API. Результат неожиданный: по деньгам локальная модель почти никогда не выигрывает.
Длинные разборы того, что я собирал сам: устройство, места отказа и выводы, которые пережили практику.
Посчитал стоимость миллиона токенов на арендованной видеокарте и сравнил с ценами API. Результат неожиданный: по деньгам локальная модель почти никогда не выигрывает.
Разбор приёмов по величине эффекта: что действительно меняет ответ, что меняет только его форму и что попало в подборки по инерции. С проверяемыми признаками.
Три способа получить от модели нужное поведение решают разные задачи и путать их дорого. Разбираю, что меняет каждый, и почему дообучение почти никогда не про факты.
RAG — это поиск плюс подстановка найденного в запрос. Разбираю, из чего он состоит, где ломается каждое звено и почему на небольшой базе он только вредит.
Модель не отличает знание от правдоподобия — она продолжает текст. Разбираю три источника выдумок, приёмы, которые работают, и просьбу «не выдумывай», которая не работает.
Разбор travel-каталога, где нейросеть подбирает места и порядок обхода, но ни одного числа не считает: почему роли разделены именно так, чем доказывается фотография места, как проверяется вид транспорта на отрезке и что из этого ломалось на проде.
Что меняется, когда агент выходит из терминала на десктоп и получает доступ к файлам, командам и чужим окнам: по какому признаку делить права, чем эти права обеспечены на самом деле, что подтверждать и что журналировать. На примере Faber — программы, которую я строю сам.
Автоматика измеряет то, что вы уже придумали измерять. Разбираю, почему двадцать минут чтения выдачи руками не заменяются метриками и как читать, чтобы это было работой, а не ритуалом.