Почему ИИ научился писать текст на картинках и запоминать лицо

Обновлено: 8 мин чтения
Почему ИИ научился писать текст на картинках и запоминать лицо
Мари Вельс
Мари Вельс

Автор и практик в сфере генеративных технологий, специализирующийся на создании визуального контента с помощью нейросетей. В своих материалах она простым языком объясняет, как работает генерация изображений и как применять её для задач маркетинга, дизайна и digital-проектов. Ключевое направление — генерация изображений по фото (image-to-image), разработка точных промптов и управление визуальным стилем. Мари показывает, как получать предсказуемый результат: настраивать композицию, освещение, детализацию и адаптировать изображения под разные форматы — от соцсетей до рекламных баннеров. Контент автора помогает не просто разобраться в технологии, а встроить генерацию изображений в рабочие процессы: ускорить создание креативов, снизить затраты и повысить эффективность визуального контента.

Попросить нейросеть написать «С днём рождения» на открытке — и получить «С дньём рожднея» с кривыми символами, которые только отдалённо напоминают буквы. Знакомо? До недавнего времени это было нормой. Нейросети великолепно рисовали небо, лица, фактуры. Но стоило попросить добавить простую надпись, как на экране появлялась абракадабра.

Сегодня картина изменилась: ИИ пишет читаемый текст, сохраняет лицо узнаваемым и удерживает сходство через серию изображений. Разберём, почему это стало возможным — и как этим пользоваться прямо сейчас.

Почему раньше нейросети не умели писать текст

Нейросети раньше не умели писать текст на картинках, потому что их архитектура не была предназначена для работы с отдельными символами.

Когда вы вводили промпт «добавь надпись Happy Birthday», модель знала: где-то должны быть буквы, похожие на эти. Но воспроизвести их точно, в нужном порядке, она не могла. Результат — «псевдотекст»: визуально похожие на буквы закорючки без смысла.

Почему получалась абракадабра

Модель видела текст как узор, а не как буквы

Ранние нейросети видели текст как визуальный узор, а не последовательность букв


Диффузионная модель (diffusion model) обучается, восстанавливая изображения из шума. Модель училась на миллионах примеров: вот так выглядит трава, вот так — человеческое лицо, а вот так — что-то похожее на текст. Именно «похожее на текст» — потому что для модели текст был просто ещё одной текстурой.

Технически проблема кроется в том, как работает текстовый энкодер (text encoder) — компонент, который переводит ваш запрос в понятный для нейросети язык. То есть в набор числовых векторов (эмбеддингов, embeddings).

Эмбеддинг — это числовое представление смысла вашего запроса. Когда энкодер переводит слово в эмбеддинг, он фиксирует смысл («поздравление», «праздник»), но теряет точную последовательность символов. Модель «знала», что текст должен быть — но не знала, из каких именно букв он состоит.

Почему буквы сложнее, чем лицо

Это не очевидный факт, но логичный. Человеческое лицо допускает вариации: слегка изменённый нос всё равно остаётся носом, чуть другой разрез глаз — всё равно глазом. Буква такой гибкости не имеет.

Чуть искажённая «А» перестаёт читаться как «А» — и превращается в случайный символ. Порядок букв критичен: «STOP» и «POTS» — совершенно разные слова, хотя состоят из одних букв. А одно и то же слово должно выглядеть совершенно по-разному на неоновой вывеске, рукописной открытке и на книжной странице.

«Системы рендеринга текста сталкиваются с уникальной проблемой: в отличие от других визуальных элементов, текст требует одновременно точного воспроизведения формы и строгого соблюдения порядка — малейшее отклонение делает слово нечитаемым».

— По материалам исследования о рендеринге текста в генеративных моделях

Именно поэтому нейросети долго справлялись с портретами лучше, чем с вывесками.

Что изменилось: как ИИ научился писать текст

Character-aware энкодеры и диффузионные трансформеры изменили подход к генерации текста

Character-aware энкодеры: модель теперь «знает» буквы

Переломным моментом стало появление character-aware энкодеров — энкодеров, осознающих символы. В отличие от character-blind предшественников, они обрабатывают текст на уровне отдельных букв, а не только смысловых единиц.

Исследование «Character-Aware Models Improve Visual Text Rendering» (arxiv.org, 2022) показало: модели с таким энкодером достигают надёжного «правописания» на существенно меньших масштабах обучения, чем character-blind аналоги. Проще говоря, модели не нужно смотреть на миллиард примеров с текстом — ей достаточно «понять» структуру букв.

Переход к DiT и единое пространство текста и картинки

Второй сдвиг — архитектурный. Диффузионный трансформер (DiT, Diffusion Transformer) заменил архитектуру U-Net в большинстве современных моделей.

Что это изменило? U-Net обрабатывал текст и изображение по отдельности: сначала разбирался с картинкой, потом «вспоминал», что туда нужно добавить. DiT работает в едином пространстве — текстовые и визуальные элементы существуют в одной математической системе координат.

«Переход от U-Net к архитектуре трансформеров позволил моделям обрабатывать текст и визуальный контент в едином семантическом пространстве — вместо того чтобы накладывать текстовые условия поверх уже обработанного изображения».

— По материалам ICLR Blogposts 2026, «From U-Nets to DiTs»

Почему стилизованный и мелкий текст всё ещё хромает

Честная оговорка: несмотря на прогресс, ИИ по-прежнему делает это хуже всего остального.

Прямой печатный текст крупным кеглем — сегодня уже вполне надёжно. Но:

  • Рукописный и каллиграфический текст — связные лигатуры, нестандартные наклоны, художественные завитки — модель часто «ломает», потому что в её обучающих данных таких примеров меньше и они более вариативны.
  • Мелкий кегль — при уменьшении буквы теряют чёткость: модель не успевает воспроизвести детали в ограниченном пространстве пикселей.
  • Текст поверх сложного фона — когда фон сам по себе «шумный» (орнамент, трава, ткань), контраст теряется и буквы «растворяются».
  • Длинные фразы — чем длиннее надпись, тем больше вероятность ошибки. Каждый символ — это отдельная задача, и вероятность ошибки в слове из 20 букв выше, чем в слове из 5.

Знать эти ограничения полезно: они подсказывают, как правильно формулировать задачу (об этом — в разделе про лайфхаки).

Почему по-русски сложнее, чем по-английски

Нейросети точнее воспроизводят латиницу, чем кириллицу. Причина прозаична: большинство моделей обучены преимущественно на англоязычных данных.

Когда модель видит миллиард примеров с латинскими надписями и несравнимо меньше — с кирилличными, она просто лучше «знает» латиницу.

На практике это означает:

  • Русский текст на ИИ-картинках чаще содержит ошибки и смешанные символы
  • Кириллические буквы иногда заменяются похожими латинскими (о/o, а/a, с/c)
  • Сложные слова с ь, ъ, ж, щ воспроизводятся хуже коротких

Как ИИ научился запоминать и сохранять лицо

Face embedding и технологии сохранения идентичности позволяют ИИ запоминать лицо

Почему лицо «уплывало»

Ранние диффузионные модели генерировали каждое изображение с нуля — без памяти о том, как выглядел конкретный человек. Если вы просили нарисовать Анну в трёх разных нарядах, на каждой картинке была немного другая Анна: другой разрез глаз, другой нос, другая форма лица.

Сохранение идентичности (identity preservation)

Сохранение идентичности (identity preservation) — способность модели удерживать уникальные черты конкретного лица через генерации. Это стало возможным благодаря нескольким технологиям.

Face embedding — векторное представление лица. Специальная нейросеть «кодирует» лицо в числовой вектор, фиксируя пропорции, форму черт, расположение элементов. Этот вектор становится «отпечатком» — его передают в генеративную модель как дополнительное условие.

IP-Adapter и InstantID — инструменты, которые позволяют «вшить» это условие в процесс генерации. IP-Adapter работает как переходник: принимает визуальный эмбеддинг лица и передаёт его в модель, не меняя базовую архитектуру. InstantID идёт дальше и позволяет точнее сохранять индивидуальность при смене стиля или позы.

LoRA (Low-Rank Adaptation) — метод точной настройки модели на конкретное лицо. Вместо полного переобучения LoRA добавляет небольшой «модуль памяти», который говорит модели: «вот как выглядит этот человек». Результат — модель генерирует узнаваемое лицо даже в новых контекстах.

ControlNet управляет позой и структурой изображения, не давая лицу «поехать» при смене ракурса.

Современные модели — в том числе Nano Banana — используют эти технологии в комплексе.

Консистентность персонажа — прорыв 2026 года

Консистентность персонажа (character consistency) — возможность сохранить одно лицо, узнаваемое на серии картинок: в разных позах, нарядах, освещении, стилях.

До 2025 года это была сложная задача даже для профессиональных пайплайнов. Сегодня в продуктах вроде AVALAVA это доступно без технических знаний: достаточно загрузить фото и описать сцену. Используйте объединение фото с ИИ онлайн, чтобы поместить конкретного человека в нужный контекст с сохранением черт лица.

Как добавить или изменить текст на фото через ИИ

Пошаговый процесс добавления текста на фото с помощью ИИ


Пошаговый процесс проще, чем кажется:

  1. Загрузите фото — выберите изображение, на которое хотите добавить надпись. Чем лучше исходное качество, тем точнее результат. Если нужно сначала улучшить качество фото — сделайте это перед добавлением текста.
  2. Опишите надпись в промпте — укажите точный текст в кавычках: добавь надпись "С днём рождения, Аня!". Чем конкретнее формулировка, тем лучше.
  3. Укажите место и стиль — «белыми буквами в нижней части», «рукописным шрифтом в центре», «крупными красными буквами вверху». Это сильно влияет на результат.
  4. Запустите генерацию — нажмите кнопку и дождитесь результата. Первая попытка не всегда идеальна — это нормально.
  5. Отредактируйте при необходимости — если текст получился с ошибкой или не там, уточните промпт: «текст должен быть на белом фоне», «буквы крупнее», «без засечек».
  6. Сохраните результат — когда надпись читается правильно, скачайте изображение.

Для поздравительных открыток и фото на день рождения удобно использовать категорию открыток AVALAVA — там собраны шаблоны с готовыми стилями текста.

Как получить читаемый текст с первого раза

Делайте

Избегайте

Короткие фразы (1–3 слова)

Длинные абзацы на картинке

Указывайте текст в кавычках

Расплывчатые формулировки «сделай надпись»

Простой прямой шрифт

Сложную рукопись и мелкий кегль

Указывайте цвет и позицию

Текст поверх пёстрого фона без уточнений

Проверяйте каждую букву в результате

Принимать первый вариант без вычитки

💡 Совет от команды AVALAVA

Самая частая ошибка — писать в промпте просто «добавь поздравление» без указания точного текста. Нейросеть тогда сама придумывает слова — и часто ошибается. Всегда пишите так: добавь надпись “Текст в точности как здесь” — в кавычках, без лишних слов вокруг. Короткие фразы из 2–4 слов воспроизводятся почти безошибочно; фразы длиннее 6–7 слов лучше разбить на несколько отдельных надписей.

— AVALAVA

Какие нейросети хорошо пишут текст в 2026 году

Модель

Чем известна по тексту

Оговорка

Nano Banana / Nano Banana Pro

Точечное редактирование, читаемые надписи, сохранение остального изображения

Справляется с кириллицей хуже латиницы

GPT Image (OpenAI)

Понимает запрос на естественном языке, хорошо справляется с коротким текстом

Может добавлять характерный «шум» на мелкие элементы

Seedream

Хорош в стилизации

Справляется с кириллицей значительно хуже латиницы

Nano Banana — модель, на которой работает AVALAVA — стала одной из первых, где улучшенный рендеринг текста внутри изображений был выделен как ключевое достоинство. Попробовать её в деле можно на странице модели.

Для глубокого сравнения всех актуальных инструментов смотрите нашу статью топ нейросетей для работы с фото.

Где это пригодится

Открытки и поздравления. Именно здесь запрос «текст для ии фото на день рождения» становится практическим инструментом: вы загружаете фото, просите добавить имя и пожелание — и получаете персональную открытку за минуту. Загляните в раздел открыток — там готовые форматы под разные поводы.

Обложки и афиши. Название мероприятия, дата, имя автора — всё это теперь можно вписать в изображение, не открывая графический редактор.

Мемы. Классический формат «картинка + подпись» теперь генерируется целиком, а не собирается по частям.

Товарные фото с надписями. Продукт с лейблом, упаковка с текстом, баннер с ценой — для e-commerce это экономия времени дизайнера.

Консистентный персонаж в нескольких сценах. Одно и то же лицо на серии иллюстраций — для stories, комиксов, рекламных кампаний. Используйте объединение фото с ИИ онлайн для таких задач.

Попробуйте сами

Теперь вы знаете, почему это работает — и как это использовать. Загрузите фото, напишите точный текст в кавычках и посмотрите результат.

Попробовать бесплатно →

Все статьи
Поделиться:

Часто задаваемые вопросы

Читайте также

Другие материалы из нашего блога

Попробуйте ИИ-эффекты

Создавайте уникальные изображения с помощью наших ИИ-эффектов

Попробовать бесплатно