Обучение нейросети на своих данных: что это значит на практике
За одной фразой стоят три разные работы разной стоимости. Разбираю, какая из них вам нужна, сколько примеров требуется и почему «загрузить документы» — не обучение.
Короткий ответ: за фразой «обучить нейросеть на своих данных» скрываются три разные работы, и почти всегда имеется в виду не обучение.
- Подстановка документов в запрос. Модель отвечает по приложенному тексту. День работы, обновление мгновенное. Это нужно почти всем.
- Дообучение. Веса модели сдвигаются под ваши примеры. Недели, деньги, обновление — новый цикл. Это нужно единицам.
- Обучение с нуля. Не нужно никому, кроме тех, кто делает модели.
Путаница дорого стоит: люди закладывают в план недели дообучения там, где задача решается подстановкой за день.
Почему «загрузить документы» — не обучение
Модель не запоминает то, что вы ей показали. Каждый вызов независим, и знания о вашей компании берутся из текста, который вы положили в запрос, — контекстное окно не является памятью.
Когда вам обещают «обучим на ваших документах за час» — почти наверняка речь о том, что документы нарежут, проиндексируют и будут подставлять подходящие куски в запрос. Это нормальная и правильная работа. Просто она называется иначе, и обновляется правкой одного файла, а не переобучением.
Когда дообучение действительно нужно
Три случая, и «модель не знает про нашу компанию» в их число не входит — это нехватка знаний, а не формы.
Устойчивый формат, который трудно описать словами. Специфическая разметка, жанр ответа, принятая у вас структура документа. Проще показать двести примеров, чем написать инструкцию.
Удешевление. Маленькая модель, обученная повторять поведение большой на одной узкой задаче, может стоить в разы меньше при том же качестве. Здесь недели окупаются, потому что экономия постоянная.
Домен, которого модель почти не видела. Узкая терминология, редкий язык, специфические сокращения.
Признак, что вы на верном основании: у вас уже есть несколько сотен примеров правильных ответов, и они появились из работы, а не написаны специально. Если примеры придётся сочинять — это ещё не тот случай.
Развёрнутое сравнение — в «Дообучение, RAG или промпт».
Сколько данных нужно
Порядки величин, чтобы план не строился на догадках:
| Работа | Объём | Что это в реальности |
|---|---|---|
| Подстановка | от одного документа | папка регламентов |
| Дообучение формы | сотни примеров | выгрузка из рабочей системы |
| Дообучение домена | тысячи примеров | год накопленной переписки |
| С нуля | терабайты | не ваш случай |
Важнее объёма — однородность. Двести примеров одного формата дают больше, чем две тысячи разнородных: модель учится тому, что повторяется, а разнобой она усредняет.
Условие несогласия
Если ответ модели уходит человеку, который его правит, вся эта развилка неважна: берите подстановку и не думайте. Разница между вариантами проявляется там, где результат уходит дальше без правки.
Чего я делать не стал бы
Не стал бы дообучать до того, как доведён промпт. Дообучение на плохо поставленной задаче закрепит именно ту постановку — и обойдётся дороже, чем её исправление.
Не стал бы учить модель фактам. Факт, встреченный при дообучении несколько раз, не превращается в надёжную запись: он размывается по весам. Факты живут в подстановке, где их можно исправить за минуту.
Не стал бы начинать без набора для оценки. Иначе единственным способом сравнить «до» и «после» останется ощущение — почему двадцати примеров хватает.
Открытый вопрос
Граница между «формой» и «знанием» на практике мутнее, чем в любой схеме. Терминология предметной области — это форма или знание? Модель, дообученная на юридических текстах, начинает не только писать как юрист, но и чаще попадать в верные формулировки норм.
Похоже, чистого разделения нет, есть градиент. Практическое правило «факты через подстановку» работает не потому, что оно точное, а потому что ошибаться в эту сторону дешевле: неверный факт правится за минуту, а неверно закреплённая форма — новым циклом обучения.