Сегодня 03 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

OpenAI выпустила ИИ-модель ChatGPT Images 2.0, которая отлично генерирует текст на картинках

OpenAI представила модель генерации изображений ChatGPT Images 2.0, которая впервые среди массовых ИИ корректно отрисовывает текст на картинках. Если два года назад диффузионные ИИ-модели не могли составить меню мексиканского ресторана без выдуманных слов вроде «enchuita» и «burrto», то новая модель создаёт изображения с надписями, пригодными к использованию без правок.

Ещё в 2024 году диффузионные ИИ-модели систематически искажали надписи. По словам Асмелаша Тека Хадгу (Asmelash Teka Hadgu), основателя и гендиректора Lesan AI, модели восстанавливают изображение из шума и усваивают паттерны, покрывающие основную массу пикселей, а текст занимает ничтожную долю площади.

 Слева — меню, сгенерированное ChatGPT Images 2.0: все надписи читаемы, ни одного выдуманного слова. Справа — три варианта от Microsoft Designer на основе DALL-E 3: «Enchidas», «Tamrielo», «Churiros», «Margartas» и десятки других искажений. Источник изображений: ChatGPT Images 2.0, Microsoft Designer (DALL-E 3) / techcrunch.com

Слева — меню, сгенерированное ChatGPT Images 2.0: все надписи читаемы, ни одного выдуманного слова. Справа — три варианта от Microsoft Designer на основе DALL-E 3: «Enchidas», «Tamrielo», «Churiros», «Margartas» и десятки других искажений. Источник изображений: ChatGPT Images 2.0, Microsoft Designer (DALL-E 3) / techcrunch.com

С тех пор исследователи опробовали альтернативные подходы — в частности, авторегрессионные модели, которые предсказывают содержание изображения и работают по принципу, близкому к большим языковым моделям (LLM).

OpenAI не раскрыла, какая архитектура лежит в основе Images 2.0. Компания пояснила лишь, что новинка умеет «рассуждать» — искать информацию в интернете, генерировать несколько изображений по одному запросу и перепроверять результаты. Благодаря этому Images 2.0 создаёт маркетинговые материалы в разных размерах и даже комиксы. У ИИ-модели также улучшена работа с нелатинскими шрифтами — японским, корейским, хинди и бенгальским. Однако знания Images 2.0 ограничены декабрём 2025 года, что может сказаться на точности генерации по запросам о недавних событиях.

 Источник изображения: ChatGPT Images 2.0 / openai.com

Источник изображения: ChatGPT Images 2.0 / openai.com

«Images 2.0 выводит детализацию и точность генерации на беспрецедентный уровень. Модель способна продумать сложную композицию и воплотить её на практике: следовать инструкциям, сохранять заданные детали и отрисовывать элементы, на которых обычно спотыкаются генераторы, — мелкий текст, пиктограммы, элементы интерфейса, насыщенные композиции и тонкие стилистические ограничения, — и всё это в разрешении до 2K», — говорится в пресс-релизе компании. Генерация при этом занимает больше времени, чем обычный текстовый запрос к ChatGPT, но даже многопанельный комикс укладывается в несколько минут.

 Источник изображения: ChatGPT Images 2.0 / openai.com

Источник изображения: ChatGPT Images 2.0 / openai.com

Доступ к Images 2.0 получат все пользователи ChatGPT и Codex. Платные подписчики смогут генерировать более сложные изображения. OpenAI также откроет программный интерфейс (API) gpt-image-2 — стоимость будет зависеть от качества и разрешения выходных изображений.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про приложения для android

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Создатель Kimi K3 рвётся на биржу вслед за американскими ИИ-гигантами — Moonshot AI хочет привлечь $3 млрд 54 мин.
«Алиса AI» не получит расширенного доступа к Android, заверили в «Яндексе» 2 ч.
Бывший сценарист Half-Life 2 и Portal признался, что 17 лет назад Valve специально «слила» трейлер Left 4 Dead 2 2 ч.
Время — деньги: как ускорить загрузку сайта 4 ч.
Alibaba значительно улучшила ИИ-модель Qwen3.8-Max за счёт дообучения 5 ч.
OpenAI сообщила о разработке системы «автоматического экстренного отключения» ИИ 6 ч.
Windows 11 набрала почти 71 % среди пользователей Steam и продолжила теснить Windows 10 7 ч.
Meta выпустила модель Muse Spark 1.3 — улучшены навыки программирования и агентских задач 7 ч.
В WhatsApp выявлена уязвимость, позволяющая получить доступ к фотографиям до ввода PIN-кода 7 ч.
Журналисты показали скриншоты ранней версии ремейка Splinter Cell, включая записку от разработчиков на русском языке 16 ч.
Разработана твердотельная система охлаждения для ЦОД, не требующая электроэнергии 11 мин.
ИИ-бум загнал США в китайскую ловушку — без оборудования из КНР новые ЦОД строить никак не получается 37 мин.
Oukitel скрестила игровой смартфон с «броневиком» — WP600 получил два вентилятора, IP69K и батарею на 10 000 мА·ч 44 мин.
«ИКС Холдинг» наладит производство полупроводников на Дальнем Востоке 2 ч.
Анонсированы ноутбуки Asus ProArt P16 и P14, а также мини-ПК GR1X на платформе Nvidia RTX Spark 2 ч.
Китай «пылесосит» Тайвань в поисках инженеров — в ход идут огромные зарплаты и маскировка под компании из США 2 ч.
Складной iPhone станет крупнейшим анонсом Apple со времён iPhone X — и может принести ей $14 млрд за квартал 3 ч.
Анонсирован Acemagic F9A — один из первых мини-ПК на AMD Ryzen AI Max+ PRO 495 со 192 Гбайт памяти 3 ч.
Acer представила ремонтопригодный ноутбук Vero 16 — в нём можно апгредить процессор 6 ч.
За пару лет Broadcom намеревается увеличить выручку от реализации ИИ-чипов в четыре раза 6 ч.