惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 【当耐特】
L
Lohrmann on Cybersecurity
Google DeepMind News
Google DeepMind News
Schneier on Security
Schneier on Security
Recent Commits to openclaw:main
Recent Commits to openclaw:main
The Last Watchdog
The Last Watchdog
Application and Cybersecurity Blog
Application and Cybersecurity Blog
N
News and Events Feed by Topic
P
Proofpoint News Feed
H
Heimdal Security Blog
云风的 BLOG
云风的 BLOG
H
Hacker News: Front Page
量子位
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
L
LINUX DO - 最新话题
F
Full Disclosure
小众软件
小众软件
Martin Fowler
Martin Fowler
Security Latest
Security Latest
The Cloudflare Blog
Hacker News: Ask HN
Hacker News: Ask HN
C
Check Point Blog
Security Archives - TechRepublic
Security Archives - TechRepublic
I
InfoQ
AI
AI
Blog — PlanetScale
Blog — PlanetScale
I
Intezer
H
Hackread – Cybersecurity News, Data Breaches, AI and More
M
MIT News - Artificial intelligence
V
Vulnerabilities – Threatpost
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
www.infosecurity-magazine.com
www.infosecurity-magazine.com
V
V2EX
N
News and Events Feed by Topic
C
Cybersecurity and Infrastructure Security Agency CISA
T
Troy Hunt's Blog
大猫的无限游戏
大猫的无限游戏
Hacker News - Newest:
Hacker News - Newest: "LLM"
The Register - Security
The Register - Security
Forbes - Security
Forbes - Security
Recent Announcements
Recent Announcements
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
Cisco Talos Blog
Cisco Talos Blog
Microsoft Azure Blog
Microsoft Azure Blog
A
About on SuperTechFans
S
SegmentFault 最新的问题
S
Securelist
Cloudbric
Cloudbric
T
Tenable Blog
D
Docker

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания Автономность как точка невозврата: кто будет субъектом в цифровом будущем Обучение ИИ в «диких» условиях: как рутинные действия превращаются в датасеты Как измерить LLM для задач кибербеза: обзор открытых бенчмарков Где хранить код? Сравнение GitHub, GitLab и Bitbucket Математика объясняет, почему нормальное распределение встречается повсюду Почему ваш FinOps не работает: 12 тезисов от практиков Как подписать проектную документацию УКЭП с использованием бесплатных лицензий Pilot Адаптивное администрирование Sigla Vision Я грузил уран в бочки, а потом 20 лет строил ИТ в атомной отрасли Чем позвонить с Эвереста? История и обзор спутниковой связи. Часть 2 Как языковая модель помогает контролировать качество инструктажей по охране труда в металлургии Как не передать на desktop свой IP в РКН Анатомия SAP Privileges: как устроено управление правами в macOS MoneyDev: Сказка про три главных слова Обновлённый токенизатор видео K-VAE 2.0 от Сбера Как сделать диспетчеризацию дома на 1284 квартиры почти бесплатно Как мы разогнали железную дорогу Мы дали агентам рутину. Теперь надо решить — что делать с освободившимся временем Токсичный контент, промпт-хакинг и защита ИИ — всё о Guardrails для LLM Умный город начинается с точного взгляда: как «Фалькон Тех» меняет пространство к лучшему Навайбкодил приложение для анализа графов Почему Дюну так интересно читать? Упрощаем работу с рутиной или как стать Гендальфом Белым Деконструкция Go: CPU, RAM и что там происходит. Go Assembler база. Часть 1.1 Какие профессии исчезнут из-за ИИ, а какие появятся? И что с этим делать Как мы построили IT-отдел, где хочется расти: архитектурные встречи, прозрачные метрики и книжные подарки Rufler: Делаем из Claude Code автономный рой через один YAML-конфиг Sing-box и белый список приложений Как построить надёжный обмен сообщениями в микросервисах: лучшие практики для enterprise OpenAI строит MLM-пирамиду, а McKinsey и Accenture помогают ей в этом Дом, который не построил Фишер (Часть 2) «Сверхзвуковой математик» против «Вдумчивого логиста»: битва алгоритмов 3D-упаковки Мультимодальные модели – грубый и дорогой инструмент Разговоры ничего не стоят. Код тоже Проверки физических лиц: с кого начнет ФНС Топ-10 бесплатных нейросетей для создания видео в 2026 году Первые слои кода: как наши решения сегодня определяют архитектуру ИИ на десятилетия Разработка нового статического анализатора: PVS-Studio JavaScript Поиск уязвимостей ПО: базовый минимум или роскошный максимум Почему оценка персонала не работает как инструмент управления Как мы разработали ИИ-ассистента и сократили рутину продуктовой команды на 50% Как я ушел из найма, нажарил косточек и продал на маркетплейсах на 168 млн в год Когда 1С:ERP уже внедрена, а нормального производственного плана всё ещё нет Как я сделал Claude мультимодальным, подключив к нему Qwen Omni Как приглашение на вакансию мечты превращается в атаку Infrastructure as Code: философия и лучшие практики IaC Тестируем Yandex Code Assistant на задаче, в которой нужно хранить секреты nxs-universal-chart v3.0: новое поколение универсального Helm-чарта Callback Injection: Техника, которая отправила Microsoft Defender в глухой нокаут «Все идеи на стол»: митап как способ вывести проект из тупика Сегодня я узнал нечто новое о GPU благодаря багу в своей игре Как заставить LLM ̶ ̶г̶а̶л̶л̶ю̶ ̶ эволюционировать Карта событий как фундамент аналитики: практический кейс для E-commerce Что выбрать для AI: x86, ARM или RISC-V? Дайджест железа за март Роль соматических мутаций в развитии аутоиммунных заболеваний: путь к избирательной терапии Mythos от Anthropic — тревожный сигнал для всех, а не только для банков Guardrails для LLM на Java: как приручить промпт‑инъекции и токсичные ответы Green-VLA: как мы собрали VLA-модель для реального антропоморфного робота и не потеряли обобщение Финансовая гонка вооружений: почему умные люди добровольно в ней участвуют Эра ИИ-агентов наступила: выбираем лучшего цифрового сотрудника # Практический опыт внедрения WinCC Redundancy на производственном предприятии Сделал MVP за 3 дня, а потом неделю прикручивал оплату. Оно того стоило? Физика против Маска: почему Starship V3 может оказаться ещё одной катастрофой Нефть Венесуэлы: крупнейшие запасы в мире, но не крупнейшая нефтяная держава JPA 4. Переосмысление Hibernate Почему зеркальная фотокамера Nikon D5 десятилетней давности идеально подошла для миссии «Артемида-2» Проект «Уровень-Спутник» или как мы сделали платформу для гидрологов «Замедлиться, чтобы ускориться»: почему ИИ повышает цену ошибок в требованиях и архитектуре Как с нуля поднять трафик IT-компании на 1657% при бюджете 55 тыс. и выжить Pixel-perfect Downsampling — идеальная отрисовка 50 миллионов точек без потерь
ChatGPT Image 2 (Чат GPT 2) для фото и изображений: что изменилось в новой модели OpenAI?
VisionSoul ( · 2026-04-30 · via Все публикации подряд на Хабре

Время на прочтение8 мин

Охват и читатели696

Обзор

В 2026 году OpenAI выпустила новую модель генерации изображений в ChatGPT, а в программном интерфейсе закрепила её как актуальную модель для генерации и редактирования графики. Это обновление стало продолжением курса на нативную мультимодальность, где система работает не только с текстом, но и с изображениями как с полноценной частью общего контекста.

Визуальная линия развивается в сторону более тесной связки между анализом входных изображений, генерацией новых кадров и многошаговым редактированием. В более раннем описании этого направления OpenAI связывала прогресс с нативно мультимодальной архитектурой, совместным обучением на тексте и изображениях и единым стеком дообучения.

Попробовать ChatGPT Image 2 в разделе для генерации изображений

Основные изменения в новой версии

Первое заметное изменение — рост общего качества генерации. OpenAI прямо относит gpt-image-2 к флагманской модели изображений и рекомендует её как основной вариант для новых сценариев, особенно там, где важны фотореализм, редактирование и высокая точность результата.

Второе изменение связано с управляемостью сцены. Ещё на этапе развития нативной генерации OpenAI отдельно показывала улучшение следования сложным инструкциям и более жёсткую привязку объектов к их свойствам и отношениям, а в свежих примерах для Чат GPT Images 2.0 это проявляется в сложных композициях, многообъектных сценах и макетах с большим числом смысловых элементов.

Третье изменение — заметно более уверенная работа с текстом внутри изображения и с разными письменностями. Акцент сделан на улучшенной отрисовке текста, многоязычной типографике и работе с насыщенными информацией макетами, хотя сама компания отдельно оговаривает, что точное размещение мелкого текста всё ещё остаётся чувствительным местом.

Новые возможности работы с изображениями

Новая версия усиливает связку между пониманием изображения и его последующей генерацией. В руководстве OpenAI по визуальным задачам прямо сказано, что современные модели могут принимать изображения на вход, анализировать их и использовать либо для текстового вывода, либо для создания новых изображений.

В практическом сценарии это означает, что модель может опираться на загруженные пользователем изображения как на контекст или визуальный референс. OpenAI отдельно показывала такой режим как обучение по контексту: система извлекает детали из входных картинок и использует их при генерации следующего изображения.

Сильно изменилась и механика редактирования. Через диалоговый интерфейс модель поддерживает многошаговые правки, а через программный интерфейс — частичное и полное редактирование, работу по маске и использование входных изображений с автоматически высоким уровнем сохранения деталей; кроме того, в Chat GPT появился режим, где перед генерацией изображение может дополнительно планироваться и уточняться при увеличенном времени на обдумывание.

Технические улучшения модели

На высоком уровне OpenAI описывает текущее поколение визуальных моделей как движение к нативной мультимодальности. Этот подход предполагает, что текст и изображение обрабатываются не как два слабо связанных режима, а как единая среда, где модель умеет переносить знания между модальностями и использовать общий контекст для более точного визуального вывода.

Для gpt-image-2 важным техническим изменением стала автоматическая работа с входными изображениями в высоком качестве. Параметр сохранения точности входа для этой модели вручную не настраивается, потому что входные изображения и так обрабатываются с высоким уровнем точности по умолчанию.

Отдельно обновлён контур генерации результата. Модель поддерживает гибкий выбор размера изображения с ограничениями по длине стороны, соотношению сторон и общему числу пикселей, несколько уровней качества и автоматический подбор параметров под запрос; при этом прозрачный фон для этой модели пока не поддерживается.

Примеры задач, которые теперь решаются лучше

Один из самых заметных классов задач — создание не просто отдельных иллюстраций, а содержательных визуальных материалов. В примерах OpenAI для новой версии есть инфографика, учебные постеры, журнальные развороты, комиксные страницы, карточки с многоязычной типографикой и композиции, где изображение выполняет роль носителя информации, а не только декоративного элемента.

Лучше выглядят и сценарии с фотореалистичными объектами и сложными сценами. В описании возможностей нативной генерации OpenAI отдельно подчёркивала фотореализм, точное следование запросу и способность удерживать большое число объектов в одной сцене, а для ChatGPT Images 2.0 показывает примеры сложных уличных, интерьерных и редакционных композиций.

Сильнее стали и прикладные задачи вокруг фотографий и графики: локальные правки по маске, перенос стиля, сборка композиции из исходных материалов, генерация надписей и макетов с текстом внутри кадра. Для рабочих процессов это особенно важно там, где требуется не разовая картинка, а последовательная доработка изображения в несколько шагов.

Примеры промтов для генерации изображений в Чат GPT Image2

Кинематографичный портрет

Создай фотореалистичный кинематографичный портрет молодой женщины в мягком золотом свете на закате, крупный план, естественная кожа, выразительный взгляд, легкий ветер в волосах, малая глубина резкости, детализированное лицо, реалистичная фотография.

Современный интерьер

Создай стильный современный интерьер гостиной в скандинавском стиле: светлое дерево, бежевые и молочные оттенки, большой диван, минималистичный декор, мягкий дневной свет из панорамных окон, аккуратные текстуры ткани и дерева, фотореализм, архитектурная визуализация, ultra detailed, clean composition, cozy atmosphere.

Фэнтези-сцена

Создай эпическую фэнтези-сцену: древний город на скалах над облаками, огромные водопады, парящие мосты, магические огни, путешественник в длинном плаще на переднем плане, драматичное небо, масштаб, атмосфера приключения, concept art, ultra detailed, cinematic lighting, majestic fantasy world.

Товарная съемка

Создай премиальную предметную съемку флакона духов на темном глянцевом фоне с отражением, мягкие направленные блики, дорогая люксовая эстетика, чистая композиция, акцент на стекле, металлической крышке и каплях конденсата, студийный свет, macro product photography, ultra realistic, high-end advertising style.

Аниме-иллюстрация

Создай яркую аниме-иллюстрацию: девушка на крыше города ночью под неоновыми вывесками, легкий дождь, отражения на асфальте, динамичная композиция, выразительные глаза, ветер развевает одежду и волосы, насыщенные сине-розовые оттенки.

Ограничения и нюансы

Несмотря на обновление, модель не стала безошибочной. В OpenAI существуют ограничения: сложные запросы могут обрабатываться заметно дольше, а в отдельных случаях время генерации может доходить до двух минут.

Проблемной зоной остаётся текст внутри изображения. Его качество выросло, но точное позиционирование, мелкие подписи, плотная информационная вёрстка и повторяемость элементов от кадра к кадру всё ещё могут давать нестабильный результат.

Есть и другие нюансы: длинные плакаты могут обрезаться слишком агрессивно, в структурных макетах остаются трудности с точным размещением элементов, а слишком крупные размеры изображения считаются экспериментальными и могут вести себя менее предсказуемо. На практике это означает, что неоднозначные или конфликтующие инструкции по композиции, тексту и расположению объектов по-прежнему лучше разбивать на несколько последовательных шагов.

Дополнительные возможности в одном сервисе Ranvik

Генерация изображений ИИ — генерируйте уникальные изображения с нуля, повышайте разрешение снимков, редактируйте детали и удаляйте фон в один клик.

Нейросети для работы с текстами — создавайте статьи, сценарии и посты. ИИ поможет с редактурой, профессиональным переводом и поиском свежих идей для ваших проектов.

ИИ генерация видео — превращайте текстовые описания в полноценные ролики. Добавляйте спецэффекты, анимацию и автоматические субтитры без сложного софта.

Бесплатная нейросеть Ranvik — это доступ к возможностям искусственного интеллекта для комплексной работы с текстом, графикой, аудио и видео на единой площадке.

ИИ-возможности для аудио — пишите авторские треки и полноценные песни, настраивая каждый параметр под свои задачи.

Оживить фото — функция «оживления» превращает статичные портреты в динамичные видео с естественной мимикой и движениями.

Озвучивание текста с помощью ИИ — превращайте текст в живую речь. На выбор доступны десятки реалистичных голосов с настройкой эмоций и интонаций.

FAQ

1. Чем ChatGPT Image 2 отличается от предыдущей версии?

Главное отличие связано с качеством и управляемостью генерации. Новая модель лучше следует сложным инструкциям, точнее работает с композицией сцены, увереннее передаёт текст внутри изображения и поддерживает более широкий набор прикладных сценариев — от иллюстраций до многошагового редактирования.

В ChatGPT обновление представлено как ChatGPT Images 2.0, а в API — как модель gpt-image-2. OpenAI относит её к флагманской линейке генерации изображений и рекомендует для новых задач, где важны качество, редактирование и точность результата.

2. Можно ли в ChatGPT Image 2 не только генерировать, но и редактировать изображения?

Да. Новая версия поддерживает не только создание изображения по текстовому описанию, но и редактирование уже существующих файлов. В ChatGPT можно изменять загруженные изображения через диалог, а в API доступны сценарии частичного редактирования и работы с входными изображениями как с контекстом.

Это особенно важно для задач, где требуется не один результат, а серия последовательных правок: изменить фон, скорректировать объект, переработать стиль, уточнить композицию или сохранить общую структуру сцены. В таком режиме модель работает ближе к инструменту визуальной доработки, а не только к генератору картинок «с нуля».

3. Насколько лучше модель справляется с текстом на изображениях?

Работа с текстом стала одним из заметных направлений обновления. В материалах OpenAI отдельно отмечены улучшенная отрисовка текста, поддержка нескольких языков и более уверенная работа с макетами, где надписи являются частью композиции.

При этом ограничение полностью не исчезло. Мелкие подписи, плотная вёрстка, очень длинные текстовые блоки и точное позиционирование элементов по-прежнему могут давать нестабильный результат, особенно в сложных постерах и насыщенных информацией изображениях.

4. Подходит ли ChatGPT Image 2 для рабочих задач, а не только для иллюстраций?

Да, модель ориентирована не только на творческие, но и на прикладные сценарии. OpenAI показывает её использование для инфографики, редакционных макетов, многостраничных визуальных композиций, материалов с типографикой и изображений, которые должны сохранять структуру и логическую связность.

Это делает модель более применимой в задачах контент-производства, подготовки визуальных материалов, прототипирования, оформления карточек и адаптации графики под разные форматы. Отдельно отмечается поддержка гибких размеров изображения и режимов качества, что важно для производственных сценариев.

5. Какие ограничения у ChatGPT Image 2 всё ещё остаются?

Даже после обновления модель не исключает ошибок в сложных сценах. Трудности могут возникать при конфликтующих инструкциях, в композициях с большим количеством мелких деталей, при нестандартных ракурсах и в задачах, где нужно строгое совпадение всех элементов макета.

Есть и технические нюансы. Генерация сложного изображения может занимать до двух минут, а прозрачный фон для gpt-image-2 в текущей реализации не поддерживается. Поэтому в ряде задач по-прежнему полезно разбивать запрос на несколько последовательных шагов, а не пытаться получить финальный результат одной инструкцией.

Итоги

Чат GPT Image 2 — это не просто очередное повышение визуального качества, а сдвиг в сторону более управляемой и прикладной работы с изображениями. Обновление объединяет более точную генерацию, улучшенную работу с текстом, многошаговое редактирование, использование входных изображений как контекста и более гибкую настройку размеров и качества.

Изменения особенно заметны в сценариях, где изображение должно не только выглядеть правдоподобно, но и передавать структуру, отношения объектов, подписи и композиционную логику. Это делает новую модель полезнее для иллюстраций, макетов, редакционной графики, визуальных материалов с текстом и последовательной доработки кадров в диалоге.

Главный итог обновления — переход от генерации изображений в Чат GPT «по одному запросу» к более устойчивому визуальному процессу, где важны контекст, повторяемость правок и контроль над сценой. Для пользователей, которые регулярно работают с визуальным контентом, это означает расширение числа задач, которые можно решать в одном инструменте, с меньшим количеством повторных попыток и ручных исправлений.