RAG простыми словами: что это и когда он не нужен
RAG — это поиск плюс подстановка найденного в запрос. Разбираю, из чего он состоит, где ломается каждое звено и почему на небольшой базе он только вредит.
Как хранить контекст, чтобы он находился: графы, заметки, семантический поиск, память моделей.
RAG — это поиск плюс подстановка найденного в запрос. Разбираю, из чего он состоит, где ломается каждое звено и почему на небольшой базе он только вредит.
Модель не отличает знание от правдоподобия — она продолжает текст. Разбираю три источника выдумок, приёмы, которые работают, и просьбу «не выдумывай», которая не работает.
Метрика растёт, ответы не улучшаются. Разбираю, почему считать надо по кускам, и показываю на измерении собственного корпуса, что делает с текстом фиксированная нарезка.
Близость векторов — это не близость смысла в том виде, в каком её понимает человек. Разбираю, где расходится, почему поиск находит не то и что с этим делать.
Один и тот же текст на русском обходится в заметно большее число токенов, чем на английском. Разбираю, откуда берётся разница, во что она обходится и что с ней делать.
Почему семантический поиск не спасает плохо устроенную базу: где теряется качество, что делает нарезка, зачем нужен реранкер и как измерять, стало ли лучше.
Векторный поиск сравнивает вопрос и фрагмент по отдельности, реранкер смотрит на них вместе. Отсюда и разница: он видит отрицание, которое вектор не видит.
Самый быстрый способ закончить спор «хорошо или плохо отвечает модель» — разметить руками два десятка случаев. И самая частая находка при этом не про модель.