惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

月光博客
月光博客
Martin Fowler
Martin Fowler
Last Week in AI
Last Week in AI
罗磊的独立博客
阮一峰的网络日志
阮一峰的网络日志
博客园 - 【当耐特】
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
博客园 - 三生石上(FineUI控件)
S
SegmentFault 最新的问题
V
Visual Studio Blog
Hugging Face - Blog
Hugging Face - Blog
雷峰网
雷峰网
博客园_首页
人人都是产品经理
人人都是产品经理
量子位
美团技术团队
The Cloudflare Blog
小众软件
小众软件
WordPress大学
WordPress大学
有赞技术团队
有赞技术团队
M
MIT News - Artificial intelligence
Microsoft Security Blog
Microsoft Security Blog
D
DataBreaches.Net
博客园 - Franky

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
Почему нейросети рисуют иероглифы на картинках вместо тек...
TehnoBlog (S · 2026-04-29 · via Все публикации подряд на Хабре

Вы попросили нейросеть сделать красивый баннер с надписью. Получили потрясающую картинку — и размытые закорючки там, где должен был быть текст.

Или того хуже: буквы есть, но они перепутаны местами, слеплены друг с другом, наполовину превратились в иероглифы. Иногда похоже на арабский. Иногда на выдуманный алфавит несуществующей цивилизации.

Это не баг и не случайность. У этого явления есть конкретная техническая причина. И есть нейросеть, которая эту проблему решила.

Ошибки в текстах на картинках

Ошибки в текстах на картинках

Как нейросеть вообще рисует картинки

Чтобы понять почему текст не получается — нужно понять как работает генерация изображений в принципе.

Большинство современных генераторов — Stable Diffusion, Midjourney, DALL-E — работают по принципу диффузии. Грубо говоря, это выглядит так:

  1. Берётся случайный шум — картинка из случайных пикселей.

  2. Нейросеть постепенно «убирает» шум, делая изображение более осмысленным.

  3. Каждый шаг она сверяется с промтом: «похоже ли то, что получается, на описание?»

  4. После нескольких десятков шагов из шума появляется изображение.

Ключевое слово здесь — похоже. Нейросеть не рисует в привычном смысле. Она не знает что такое «буква А» как отдельная сущность. Она знает как выглядит «изображение с текстом» статистически — по миллиардам картинок, на которых она обучалась.

Иероглифы вместо текста на картинках нейросети

Иероглифы вместо текста на картинках нейросети

Почему получаются иероглифы

Вот здесь самое интересное.

Когда нейросеть обучалась, она видела огромное количество изображений с текстом. Вывески, плакаты, обложки книг, баннеры, скриншоты. Она научилась имитировать визуальный паттерн текста — то есть то, как текст выглядит на изображении в целом.

Но есть проблема. Нейросеть работает с пикселями, а не с символами. Для неё буква «А» — это не знак с конкретным значением. Это просто определённое распределение пикселей, которое часто встречается рядом с другими похожими распределениями.

Она не «пишет» — она имитирует внешний вид письма.

Отсюда всё и вытекает:

Откуда иероглифы. В обучающей выборке были картинки с китайским, японским, арабским, хинди текстом. Модель не различает «это русские буквы» и «это иероглифы» на уровне смысла. Она различает паттерны. И когда не уверена — мешает всё подряд.

Почему буквы плывут и слипаются. Диффузионная модель оптимизирует общий вид изображения, а не поэлементную точность символов. Буква может выглядеть «достаточно похоже» на уровне всей картинки — и при этом быть нечитаемой вблизи.

Почему длинные слова хуже коротких. Чем длиннее надпись, тем больше отдельных символов нужно воспроизвести точно и последовательно. Вероятность ошибки в каждом символе накапливается — и к пятой-шестой букве всё разваливается.

Почему кириллица хуже латиницы. Большинство обучающих данных — на английском. Латинские буквы встречались в выборке в десятки раз чаще, чем русские. Поэтому с латиницей результат чуть лучше — но и там ненадёжно.

По сути, нейросеть делает то же, что человек, который никогда не учил китайский, но попытался бы перерисовать иероглиф от руки по памяти. Внешнее сходство есть, смысла нет.

Почему это вообще не починили

Резонный вопрос. Если проблема известна — почему большинство моделей до сих пор рисует иероглифы?

Потому что архитектура диффузионных моделей изначально не предназначена для точной работы с символами. Это как спросить почему кисть не рисует идеальные прямые линии — инструмент создавался для другого.

Решить это по-настоящему — значит переосмыслить как модель обрабатывает текстовые элементы. Не просто лучше имитировать, а понимать что такое символ, строка, шрифт. Это другой уровень архитектуры.

Большинство команд эту задачу не ставили в приоритет — им важнее была общая визуальная красота. Пока не появились задачи где текст на картинке критически важен: баннеры, обложки, рекламные материалы, превью для YouTube.

Ошибки нейросети в текстах

Ошибки нейросети в текстах

Nano Banana Pro: нейросеть которая умеет писать

Nano Banana Pro решила эту проблему архитектурно — а не просто «больше примеров текста в обучении».

Модель работает с текстом на изображении как с отдельным слоем с собственной логикой. Она понимает разницу между визуальным элементом и текстовым, знает что символы должны быть последовательными и читаемыми, умеет работать с кириллицей, латиницей и цифрами одновременно. Может писать на любом языке, в том числе на разных языках на одной картинке!

Результат: надписи получаются чёткими, буквы на месте, слова читаются.

Нано Банана Про: надписи на разных языках на одной картинке

Нано Банана Про: надписи на разных языках на одной картинке

Это открывает задачи, которые раньше были недоступны для нейросетей:

Баннеры для сайтов и соцсетей. Нано Банана про может поместить текст поверх красивого визуала — без PhotoShop и без дизайнера.

Обложки для YouTube и Reels. Заголовок прямо на картинке, с правильными буквами и нужным стилем шрифта.

Рекламные материалы. Акционная плашка, цена, призыв к действию — всё в одной генерации.

Карточки для маркетплейсов. Нано Банана про отлично сделает карточку любого товара, где будет и объект, и текст, и все это с подходящим дизайном.

Превью для статей и постов. Заголовок, подзаголовок, минимализм — быстро и без верстальщика.

Сравнение: Stable Diffusion vs Nano Banana Pro

Одна задача. Два инструмента. Смотрим разницу.

Задача: баннер для акции кофейни. Надпись «Кофе дня — 199 ₽» на тёмном фоне с чашкой кофе.

Промт (одинаковый для обоих):

Coffee shop promotional banner. Dark moody background, 
a cup of coffee with steam. Large clear text: 
"Кофе дня — 199 ₽". Clean modern design.

Stable Diffusion — результат:

Красивый тёмный фон. Атмосферная чашка с паром. И надпись — конечно с ошибками, даже учитывая то, что текст небольшой. Знак рубля тоже неправильный. Использовать для рекламы невозможно — надо доделывать в редакторе.

Nano Banana Pro — результат:

Тот же тёмный фон, та же чашка. Надпись «Кофе дня — 199 ₽» — чёткая, читаемая, правильные буквы, символ рубля на месте. Готово к публикации без дополнительной обработки. Есть нюанс - ИИ добавил надпись "каждый день". смотрится хорошо, но если она не нужна можно сгенерировать еще раз.

Второй тест. Задача сложнее.

Промт (одинаковый для обоих):

YouTube thumbnail. Bold vivid background with dramatic lighting, 
business theme. Large bold headline text: 
"10 ошибок которые убивают ваш бизнес". 
High contrast, attention-grabbing design, 16:9 format.

Задача: обложка для YouTube-видео. Заголовок «10 ошибок которые убивают ваш бизнес» на ярком фоне.

Stable Diffusion: слово «ошибок» превращается в «олувок» . Вместо текста микс кириллицы и латиницы. Цветовое решение тоже не самое лучшее.

Nano Banana Pro: заголовок полностью, все буквы правильные, строки выровнены. Готовая обложка.

Как правильно просить Nano Banana Pro нарисовать текст

Несколько правил, которые улучшают результат генерации в Нано Банана про.

Выносите текст в кавычки. Пишите text: "Заголовок здесь" — это сигнал модели что именно нужно воспроизвести буквально.

Указывайте стиль шрифта. «Bold sans-serif», «elegant serif», «handwritten» — модель адаптирует под описание.

Не перегружайте. Одна-две строки текста — надёжно. Три-четыре — уже сложнее. Если нужно много текста — лучше сделать несколько генераций.

Уточняйте позицию. «Text in the center», «headline at the top», «price tag in the bottom right» — это помогает с композицией.

Используйте английский для промта. Даже если сам текст на баннере будет русским — описание задачи на английском работает точнее.

Итог

Иероглифы вместо букв — не случайность. Это логичное следствие того, как устроены диффузионные модели. Они имитируют текст визуально, не понимая его как систему символов.

Nano Banana Pro подошла к задаче иначе — и закрыла целый класс задач, которые раньше требовали дизайнера или дополнительной работы в редакторе.

Попробовать можно на Study AI — там Nano Banana Pro доступна вместе с остальными инструментами в одном интерфейсе.

Попробовать Nano Banana Pro на Study AI