Внедрение ИИ в компании: с чего начать
Разбор с обратной стороны: почему пилоты не доживают до продакшена, какой процесс брать первым и по какому признаку понять, что внедрять пока нечего.
Как встроить ИИ в работу команды: регламенты, проверки, точки остановки, приёмка.
Разбор с обратной стороны: почему пилоты не доживают до продакшена, какой процесс брать первым и по какому признаку понять, что внедрять пока нечего.
Процедура выбора из четырёх шагов вместо сравнения бенчмарков: что должно быть решено до модели, по какому признаку сравнивать и когда переходить на другую.
Инструкции и данные едут в модель одной строкой, и различить их она не умеет. Разбираю, почему фильтры дают ложное спокойствие и что реально ограничивает ущерб.
Разбор приёмов по величине эффекта: что действительно меняет ответ, что меняет только его форму и что попало в подборки по инерции. С проверяемыми признаками.
Три способа получить от модели нужное поведение решают разные задачи и путать их дорого. Разбираю, что меняет каждый, и почему дообучение почти никогда не про факты.
Модель не отличает знание от правдоподобия — она продолжает текст. Разбираю три источника выдумок, приёмы, которые работают, и просьбу «не выдумывай», которая не работает.
Автоматика измеряет то, что вы уже придумали измерять. Разбираю, почему двадцать минут чтения выдачи руками не заменяются метриками и как читать, чтобы это было работой, а не ритуалом.
Промпт — это код, у которого по умолчанию нет ни тестов, ни диффа. Разбираю, почему обычное сравнение ответов не работает и что класть в журнал прогона вместо него.
Метрика растёт, ответы не улучшаются. Разбираю, почему считать надо по кускам, и показываю на измерении собственного корпуса, что делает с текстом фиксированная нарезка.
Судья совпадает с человеком примерно так же часто, как человек совпадает с человеком. Проблема не в проценте совпадений, а в том, что его ошибки систематические.
Совет «соберите двадцать примеров для оценки» звучит как выдумка. Я посчитал: он верен, но по причине, которую обычно не называют, — и у него есть слепая зона.
Цена за миллион токенов — наименее информативное число в счёте. Разбираю, из чего складывается стоимость задачи: многословность, разреженная активация, кеш, кадры и язык. С измерениями.
Почему «ответь в JSON» ненадёжно, что дают схемы и структурированный вывод, и как обращаться с полем, которого модель не знает.
Близость векторов — это не близость смысла в том виде, в каком её понимает человек. Разбираю, где расходится, почему поиск находит не то и что с этим делать.
Как модель на самом деле выбирает следующий токен, что делают ручки сэмплирования и почему нулевая температура не даёт гарантии повторяемости.
Модель не помнит прошлый разговор и не читает контекст равномерно. Разбираю, что она видит на самом деле и как из этого следуют вполне практические правила.
Один и тот же текст на русском обходится в заметно большее число токенов, чем на английском. Разбираю, откуда берётся разница, во что она обходится и что с ней делать.
Почему просьба «внедрить ИИ» не превращается в задачу, что приходит ей на замену и как выглядит проверка, которую контур может провалить.
Ответственность не делится с инструментом. Разбираю рабочую модель: владелец результата, журнал действий, точка принятия — и что писать в регламенте, чтобы это не осталось словами.
Почему семантический поиск не спасает плохо устроенную базу: где теряется качество, что делает нарезка, зачем нужен реранкер и как измерять, стало ли лучше.
Признаки, по которым процесс лучше оставить человеку, почему упрощение обычно выигрывает у интеграции и как считать стоимость владения до начала работ.
Отправка персональных данных в зарубежный сервис — это трансграничная передача со своими требованиями. Разбираю практическую границу и что делать, если данные всё-таки нужны.
Инструкция на английском занимает вдвое меньше токенов, чем на русском. На системной части это заметные деньги — и заметный риск для регистра ответа.
Попросить модель приписать ответу «уверенность 85%» легко. Считать это число вероятностью нельзя: оно отражает уверенность формулировки, а не знания.
Подтверждение стоит пять секунд ожидания. Разбор последствий необратимой операции стоит вечер. Симметрии между ними нет и не будет.
Ответ в переписке нельзя ни продиффить, ни прокомментировать построчно. Файл превращает разговор в работу с версиями.
Самая дешёвая диагностика, которая существует. Разброс между тремя ответами говорит о задаче больше, чем любой из них по отдельности.
Он растёт незаметно: правило за правилом, случай за случаем. Через полгода половина его содержимого относится к ситуациям, которых больше не бывает.
«Не пиши вводных абзацев» модель выполняет через раз. «Начни с первого факта» — почти всегда. Разница в том, что во втором случае у неё есть что делать.
Описание формата словами модель понимает приблизительно. Пара примеров — точно. И третий пример почти ничего не добавляет ко второму.
«Ты — опытный архитектор с двадцатилетним стажем» занимает место в контексте и почти не меняет ответ. Работает не роль, а требования к результату.
Уточняющие вопросы до ответа, явное разделение фактов и предположений и стандарт результата прямо в запросе. Первый работает сильнее двух остальных вместе.
Самый быстрый способ закончить спор «хорошо или плохо отвечает модель» — разметить руками два десятка случаев. И самая частая находка при этом не про модель.