Алексей Маркин рабочий журнал

ищет по заголовкам и тексту записей и заметок

запись 9 сентября 2026 г. · 4 мин
Все статьи

Мультимодальные модели: что меняется, когда модель видит

Картинка превращается в те же токены, что и текст, — отсюда и возможности, и ограничения. Разбираю, что модель со зрением делает хорошо, что плохо и во что это обходится.

Короткий ответ: изображение превращается в токены и попадает в тот же вход, что и текст. Никакого отдельного «зрения» нет — есть кодировщик, который переводит картинку в последовательность векторов, и дальше всё как обычно.

Из этого следует и то, что модель со зрением умеет, и то, чего от неё ждать не стоит.

Сколько это стоит

Первое практическое, потому что застаёт врасплох.

Картинка превращается в токены по формуле провайдера: у одного плитками по 512×512 примерно по 170 токенов плюс базовые 85, итого около 765 на изображение 1024×1024; у другого примерно ширина × высота / 750; у третьего 258 токенов за плитку 768×768. Порядок один — сотни-тысячи токенов за кадр.

Само по себе немного. Опасно то, что зрение почти никогда не бывает одним вызовом: контур управления интерфейсом снимает кадр на каждом шаге, и двадцать четыре шага превращаются в двадцать четыре изображения — как считать такой бюджет.

изображениетекстодна последовательностьтокеновмоделькадр 1024×1024 ≈ 765 токенов — как страница текста
рис. 1 Изображение на входе. Оно не «просматривается» отдельным механизмом — оно становится теми же токенами, что и текст, и делит с ним контекстное окно.

Что получается хорошо

Чтение текста с изображения. Скриншоты, сканы, фотографии документов. Здесь модель заметно превосходит классическое распознавание, потому что понимает контекст: восстанавливает смысл там, где символы распознались плохо.

Описание и классификация. Что на картинке, к какой категории относится, есть ли на ней нужный объект.

Понимание интерфейса. Где кнопка, что означает это окно, изменилось ли состояние после действия. На этом стоят контуры управления приложениями.

Разбор графиков и таблиц-картинок. Достать числа из диаграммы — работает, хотя и требует проверки.

Что получается плохо

Точный счёт. Сколько людей на фото, сколько строк в таблице. Модель даёт правдоподобное число, и оно часто неверное. Причина та же, что и везде: она продолжает вероятно, а не пересчитывает.

Точные координаты и измерения. «На сколько пикселей сдвинуть» — не к ней. Отсюда, кстати, приём с сеткой поверх кадра в контурах управления интерфейсом.

Мелкий текст и низкий контраст. Разрешение кодировщика ограничено; то, что человек прочитает, прищурившись, модель домыслит.

Уверенность в том, чего нет. Спросите «есть ли на схеме блок авторизации» — на многих схемах получите «да» независимо от факта. Это та же галлюцинация, просто на изображении её труднее заметить.

Как снизить расход и ошибки

Уменьшать кадр до нужного. Не весь экран, а окно; не окно, а область. Меньше пикселей — меньше токенов и меньше отвлекающего.

Не копить кадры в контексте. Если каждый шаг добавляет изображение, стоимость растёт квадратично. Свежий контекст с одним текущим кадром дороже по смыслу, но дешевле по деньгам — и на длинных задачах это решает.

Давать текстовую опору рядом. Дерево доступности, распознанный текст, подпись. Модель на них опирается охотнее, чем на пиксели, и ошибается реже.

Просить цитату с картинки. «Приведи текст, на котором основан ответ» — проверяется взглядом за секунду.

Условие несогласия

Если задача сводится к распознаванию текста на однотипных документах, специализированное решение будет дешевле и точнее. Модель со зрением выигрывает на разнородном входе, где заранее неизвестно, что придёт.

Признак: если у вас один формат документа и их тысячи в день — берите специализированное. Если форматов десятки и объём небольшой — модель.

Чего я делать не стал бы

Не стал бы полагаться на счёт и на числа, взятые с картинки, без сверки. Это ровно тот класс, где ответ выглядит уверенно и оказывается неверным.

Не стал бы отправлять в облако снимки экрана с персональными данными. Кадр рабочего стола — это часто чужие ФИО, адреса и переписка; что нельзя отправлять наружу.

Не стал бы поднимать разрешение «на всякий случай». Это прямой рост счёта без роста качества: кодировщик всё равно ужимает.

Открытый вопрос

Проверить ответ по изображению труднее, чем по тексту. Для текста есть дешёвый приём — цитата-основание, которую можно механически сверить с исходником. Для картинки аналога нет: модель может указать область, но соответствие области и вывода проверяет опять человек глазами.

Получается, что самый дорогой по токенам вход остаётся и самым дорогим по проверке. На больших объёмах это, а не цена токенов, становится настоящим ограничением.