Алексей Маркин рабочий журнал

ищет по заголовкам и тексту записей и заметок

запись 15 сентября 2026 г. · 10 мин
Все статьи

Нейросеть для генерации изображений в работе: где выручает, а где подводит

Генерация картинок нейросетью хороша на черновиках, вариантах и иллюстрациях настроения. Разбираю, где она подводит — текст в кадре, точные схемы, серия в одном стиле, узнаваемые люди — и чем её там заменить.

Короткий ответ: нейросеть для генерации изображений выручает там, где нужен не точный кадр, а много правдоподобных вариантов: черновик обложки, направление для дизайнера, фон слайда, иллюстрация настроения. Подводит там, где картинка несёт точную информацию, — текст внутри кадра, схема со связями, серия в едином стиле, конкретный человек.

Рабочее правило у меня одно: если результат будут проверять по букве, по стрелке или по лицу, генерация — не тот инструмент.

Сразу уточню направление. Здесь речь про изображение на выходе модели. Обратный случай, когда модель смотрит на картинку и что-то о ней сообщает, — другая задача с другими ошибками.

Где выручает

У всех удачных случаев общее одно: результат оценивается целиком, одним взглядом — подходит или нет. Проверка занимает секунды, а неудачный кадр выбрасывают без сожаления.

Черновик вместо описания словами. «Обложка в холодных тонах, что-то про порядок в документах» — фраза, которую дизайнер и заказчик понимают по-разному. Три сгенерированных наброска снимают это расхождение за один разговор, до того как кто-то сел рисовать всерьёз. В дело набросок потом не идёт, и это нормально: он был вопросом, а не ответом.

Варианты для отбора. Ценность здесь не в отдельной картинке, а в ширине ряда. Человек выбирает из направлений, которые сам не успел бы придумать, и отбор остаётся за ним.

Иллюстрация настроения. Обложка заметки, фон титульного слайда, заставка рассылки. Никто не станет считать окна в доме на заднем плане — поэтому модель, которая не умеет их считать, здесь не мешает.

Замена стоковой фотографии, когда нужен «офис вообще» или «склад вообще», без конкретного товара и конкретного человека.

Из опыта о том, как ставить такую задачу. Описывать лучше то, что в кадре и где, а не стиль громкими словами: «стол у окна, на столе стопка папок, свет слева, много пустого места сверху под заголовок» даёт предсказуемее, чем «минимализм, премиально». Пустое место под текст надо просить заранее — вырезать его из готового кадра почти всегда хуже.

И закладывать время не на генерацию, а на отбор. Сама картинка дешёвая, дорог взгляд человека, который перебирает варианты и говорит «вот этот». Если отбирать некому или некогда, выигрыш пропадает: в дело идёт первый попавшийся кадр, и он заметно хуже того, что можно было выбрать.

Где подводит

Четыре класса задач. Общее у них одно: картинку проверяют не взглядом целиком, а по детали — букве, стрелке, повторяемости, лицу.

Текст внутри изображения. Модель рисует буквы как форму, а не как последовательность символов. Короткое слово иногда получается; заголовок в строку, цена или номер телефона — лотерея. Свежие модели пишут заметно лучше прежних, но у меня кириллица до сих пор ломается чаще латиницы: пропущенная буква, лишний штрих, «н» вместо «и».

Решение скучное и надёжное: генерировать фон без надписей, а текст накладывать слоем — в редакторе, в вёрстке, в шаблоне слайда. Тогда опечатку правят в одном месте, а не перегенерируют кадр в надежде, что в этот раз повезёт.

Точные схемы и диаграммы. Здесь ошибку труднее всего заметить. Сгенерированная схема выглядит как схема: блоки, стрелки, подписи, ровная сетка. Но связи в ней произвольные, а столбцы графика не соответствуют никаким данным — модель воспроизводит вид диаграммы, а не её смысл. Читатель при этом доверяет схеме больше, чем абзацу, потому что она похожа на результат анализа.

Ошибку в такой схеме не видит как раз тот, кто её заказал: он знает, как устроен процесс, и глаз достраивает правильные связи поверх нарисованных. Замечает посторонний читатель — уже после публикации, когда схема разошлась по презентациям. Проверить её можно только одним способом: пройти каждую стрелку и сверить с источником, и это дольше, чем нарисовать заново.

Серия в одном стиле. Каждая генерация — новый бросок. Толщина линии, оттенок, пропорции персонажа от кадра к кадру уплывают: на одной иллюстрации этого не видно, на десяти слайдах подряд — сразу. Опорные изображения помогают, но вопрос не закрывают. В документации Midjourney к функции опорного изображения прямо сказано, что мелкие детали вроде веснушек или логотипа на одежде могут не совпасть с образцом. Для фирменного стиля мелкие детали и есть стиль.

Работает другое разделение. Постоянное — рамка, палитра, шрифт, место заголовка — задаётся вручную один раз. Генерация отвечает только за сменную часть внутри рамки, и её расхождения уже не бросаются в глаза.

Рядом с этим живёт родственная беда — правка одной детали. Просишь убрать лишний предмет со стола, а вместе с ним меняются свет, лицо и угол съёмки. Правка выделенной области, которая есть во многих сервисах, помогает, но на границе области часто остаётся шов, и его всё равно заделывает человек в редакторе. Если кадр требует уже не первой точечной правки подряд, я перестаю править и генерирую заново или отдаю дизайнеру.

Узнаваемые люди. Здесь две проблемы, и юридическая не самая частая, но самая дорогая.

Статья 152.1 Гражданского кодекса допускает обнародование и использование изображения гражданина только с его согласия, кроме перечисленных в ней случаев, причём прямо называет не только фотографии, но и видеозаписи и произведения изобразительного искусства, в которых он изображён. О сгенерированных изображениях там отдельно не сказано. Я исхожу из того, что узнаваемое лицо, полученное генерацией, попадает под ту же логику, и проверять обратное на себе не собираюсь. Это инженерная осторожность, а не юридическая консультация.

Вторая проблема — доверие. «Сотрудник» на странице команды или «довольный клиент» рядом с отзывом, которых не существует, рано или поздно обнаруживаются. Есть и мелочь, о которой забывают: чтобы персонаж походил на реального человека, его снимок загружают в сервис как образец, а это отправка сведений о человеке в чужой сервис, и на неё нужны те же основания, что и на любую другую передачу персональных данных.

Схемы — кодом

Для схем и графиков у меня другой путь: модель пишет не картинку, а код, из которого картинка собирается, — svg, описание для Mermaid, вызов библиотеки графиков. Схемы в этом журнале — тоже код, а не картинки.

Разница не эстетическая. Код читается и проверяется: стрелка из блока «А» в блок «Б» либо записана, либо нет. Подпись правится одной строкой, а при изменении данных график пересобирается, а не рисуется заново. Для модели же это текстовая задача с опорой, где формат задан явно, а не пожеланием, — и справляется она с ней, по моему опыту, заметно надёжнее, чем с рисованием стрелок пикселями.

Честно о цене этого пути: схема из кода выглядит строже и беднее сгенерированной. Для иллюстрации идеи, где важно настроение, а не связи, он не заменитель. Бывает и смешанный вариант — сгенерированный фон, поверх которого код кладёт точные подписи и числа; тогда каждая часть делает то, что у неё получается.

Ту же логику я применяю ко всей развилке: прежде чем генерировать, спросить, что изображение несёт.

что несёт изображениечем делатьв кадре важен текст?дафон генерацией, текст — слоемнеткартинка передаёт данные или связи?дасхема кодом, а не картинкойнетнужна серия в едином стиле?дарамка вручную, генерация внутринетв кадре узнаваемый человек?дасъёмка с согласиемнетгенерация: черновики, варианты, настроениеточное по букве, стрелке или лицу — не генерацией
рис. 1 Развилка перед генерацией. Каждое «да» забирает у генерации точную часть работы; целиком ей остаётся только то, что оценивают одним взглядом.

Права и маркировка

Про права на сам результат я писал отдельно: у чистой генерации охраны может не оказаться вовсе. Здесь добавлю то, что касается именно картинок, — пометку о происхождении.

С 2 августа 2026 года применяется статья 50 регламента Евросоюза об искусственном интеллекте. Поставщики генеративных систем должны помечать созданные изображения в машиночитаемом виде, а те, кто публикует дипфейки, — сообщать об этом зрителю. Отсрочка есть только у первого требования: поставщики систем, выпущенных на рынок до 2 августа 2026 года, могут ввести машиночитаемую пометку до 2 декабря 2026 года. Раскрытие дипфейков действует без отсрочки. Если вы публикуете для аудитории в Евросоюзе сгенерированное изображение, которое можно принять за настоящий снимок реального человека, места или события, раскрыть это уже рабочее требование; пометку в самом файле обязан ставить поставщик генератора.

Техническая сторона скромнее, чем выглядит в новостях. OpenAI прикладывает к изображениям метаданные по стандарту C2PA и в собственной справке признаёт, что они могут пропасть при редактировании, конвертации, загрузке на площадки или распространении файла, — поэтому добавляет ещё невидимый водяной знак SynthID. Для практики из этого следует простое: пометка внутри файла не доказывает ничего тому, кто получил файл через мессенджер. Если важно сообщить, что изображение сгенерировано, я пишу это словами рядом с ним.

В России 26 июля 2026 года подписан закон № 243-ФЗ, статья 9 которого даёт автору право пометить материалы в аудио- и (или) визуальной форме, созданные с применением больших фундаментальных моделей, а крупные площадки обязывает дать для этого техническую возможность. «Визуальная форма» по буквальному смыслу шире видео и накрывает статичные картинки, но полный текст статьи я не видел, а формат и порядок пометки закон отдаёт на соглашение сторон. Это, как и всё выше про право, не юридическая консультация: под конкретный случай формулировки проверяет юрист.

Условие несогласия

Раскладка из этой статьи держится на двух слабостях моделей — тексте в кадре и повторяемости серии. Обе с каждым поколением меньше, и однажды раскладка станет лишней.

Проверять это стоит на своих задачах, а не на чужих демонстрациях. Возьмите двадцать реальных случаев — обложки с настоящими русскими заголовками, серию слайдов с одним персонажем — и прогоните их без ручной правки. Признак несогласия конкретный: все надписи верны до буквы, а серия не расходится при просмотре подряд. Тогда «фон отдельно, текст отдельно» для вас избыточно.

Есть и второй случай — внутренние материалы, которые никто не разглядывает. Черновая презентация для своей команды переживёт и кривую надпись.

Чего я делать не стал бы

Не стал бы вставлять сгенерированную схему или график в отчёт, даже «для наглядности». Выглядит как результат анализа, а связи на ней случайные — и спорить потом будут с картинкой, а не с данными.

Не стал бы ставить генерацию прямо в публикацию, например картинки к карточкам товаров без просмотра человеком. Искажённый товар или лишний палец уходит клиенту, и замечает это он. Что оставить человеку, решается до запуска, а не после жалоб.

Не стал бы генерировать людей, которые выдаются за настоящих: сотрудников, клиентов, авторов отзывов. Раскрытие одного такого лица обесценивает всё остальное на странице, включая настоящие отзывы.

Открытый вопрос

Самое неприятное в генерации людей — случайное сходство. Модель может выдать лицо, которое никто не просил делать похожим, но которое узнаваемо похоже на реального человека. Обратный поиск по изображению находит копии и близкие снимки, а не сходство с кем-то, чьих фотографий в сети нет.

Как проверять это на потоке, я не знаю. Не знаю и того, считается ли случайное сходство использованием изображения гражданина: устоявшегося ответа я не встречал. Пока держусь грубого правила — не генерировать лица крупным планом для публичных материалов — и понимаю, что оно продиктовано незнанием, а не пониманием.