Мультимодальные модели: что меняется, когда модель видит
Картинка превращается в те же токены, что и текст, — отсюда и возможности, и ограничения. Разбираю, что модель со зрением делает хорошо, что плохо и во что это обходится.
Короткий ответ: изображение превращается в токены и попадает в тот же вход, что и текст. Никакого отдельного «зрения» нет — есть кодировщик, который переводит картинку в последовательность векторов, и дальше всё как обычно.
Из этого следует и то, что модель со зрением умеет, и то, чего от неё ждать не стоит.
Сколько это стоит
Первое практическое, потому что застаёт врасплох.
Картинка превращается в токены по формуле провайдера: у одного плитками
по 512×512 примерно по 170 токенов плюс базовые 85, итого около 765
на изображение 1024×1024; у другого примерно ширина × высота / 750;
у третьего 258 токенов за плитку 768×768. Порядок один — сотни-тысячи
токенов за кадр.
Само по себе немного. Опасно то, что зрение почти никогда не бывает одним вызовом: контур управления интерфейсом снимает кадр на каждом шаге, и двадцать четыре шага превращаются в двадцать четыре изображения — как считать такой бюджет.
Что получается хорошо
Чтение текста с изображения. Скриншоты, сканы, фотографии документов. Здесь модель заметно превосходит классическое распознавание, потому что понимает контекст: восстанавливает смысл там, где символы распознались плохо.
Описание и классификация. Что на картинке, к какой категории относится, есть ли на ней нужный объект.
Понимание интерфейса. Где кнопка, что означает это окно, изменилось ли состояние после действия. На этом стоят контуры управления приложениями.
Разбор графиков и таблиц-картинок. Достать числа из диаграммы — работает, хотя и требует проверки.
Что получается плохо
Точный счёт. Сколько людей на фото, сколько строк в таблице. Модель даёт правдоподобное число, и оно часто неверное. Причина та же, что и везде: она продолжает вероятно, а не пересчитывает.
Точные координаты и измерения. «На сколько пикселей сдвинуть» — не к ней. Отсюда, кстати, приём с сеткой поверх кадра в контурах управления интерфейсом.
Мелкий текст и низкий контраст. Разрешение кодировщика ограничено; то, что человек прочитает, прищурившись, модель домыслит.
Уверенность в том, чего нет. Спросите «есть ли на схеме блок авторизации» — на многих схемах получите «да» независимо от факта. Это та же галлюцинация, просто на изображении её труднее заметить.
Как снизить расход и ошибки
Уменьшать кадр до нужного. Не весь экран, а окно; не окно, а область. Меньше пикселей — меньше токенов и меньше отвлекающего.
Не копить кадры в контексте. Если каждый шаг добавляет изображение, стоимость растёт квадратично. Свежий контекст с одним текущим кадром дороже по смыслу, но дешевле по деньгам — и на длинных задачах это решает.
Давать текстовую опору рядом. Дерево доступности, распознанный текст, подпись. Модель на них опирается охотнее, чем на пиксели, и ошибается реже.
Просить цитату с картинки. «Приведи текст, на котором основан ответ» — проверяется взглядом за секунду.
Условие несогласия
Если задача сводится к распознаванию текста на однотипных документах, специализированное решение будет дешевле и точнее. Модель со зрением выигрывает на разнородном входе, где заранее неизвестно, что придёт.
Признак: если у вас один формат документа и их тысячи в день — берите специализированное. Если форматов десятки и объём небольшой — модель.
Чего я делать не стал бы
Не стал бы полагаться на счёт и на числа, взятые с картинки, без сверки. Это ровно тот класс, где ответ выглядит уверенно и оказывается неверным.
Не стал бы отправлять в облако снимки экрана с персональными данными. Кадр рабочего стола — это часто чужие ФИО, адреса и переписка; что нельзя отправлять наружу.
Не стал бы поднимать разрешение «на всякий случай». Это прямой рост счёта без роста качества: кодировщик всё равно ужимает.
Открытый вопрос
Проверить ответ по изображению труднее, чем по тексту. Для текста есть дешёвый приём — цитата-основание, которую можно механически сверить с исходником. Для картинки аналога нет: модель может указать область, но соответствие области и вывода проверяет опять человек глазами.
Получается, что самый дорогой по токенам вход остаётся и самым дорогим по проверке. На больших объёмах это, а не цена токенов, становится настоящим ограничением.