Перейти к содержимому
Промпты

6 шаблонов промптов для gpt-image-2 от OpenAI

6 шаблонов промптов для gpt-image-2 от OpenAI

Промпты для gpt-image-2 из официального гайда OpenAI можно копировать почти дословно. Почти — потому что в примерах редактирования стоит параметр, который таблица моделей в том же документе объявляет отключённым.

Ниже — порядок сборки промпта, разбор этого противоречия и шесть блоков, которые можно скопировать целиком и подставить свои значения. Всё проверено по кукбуку от 21 апреля 2026 года и справочнику API.

В каком порядке писать промпт

OpenAI рекомендует единый порядок блоков: фон и сцена, затем объект, затем ключевые детали, затем ограничения. Плюс отдельно назначение картинки — реклама, макет интерфейса, инфографика. Назначение переключает «режим» и уровень отделки сильнее, чем длинное описание стиля.

Формат при этом не важен. Работают и минималистичные строки, и абзацы, и JSON-подобные структуры, и промпты на тегах. Для рабочей системы важнее, чтобы шаблон был просматриваемым и его можно было править через полгода, чем чтобы синтаксис был красивым. Для сложных запросов гайд советует короткие подписанные сегменты и переносы строк вместо одного плотного абзаца.

Два рычага дают больше всего на единицу текста. Слово photorealistic прямо в промпте сильно включает фотореалистичный режим; фразы вроде real photograph или professional photography работают слабее, а подробные характеристики камеры модель трактует вольно — они задают общий вид, но не физику. Второй рычаг — буквальный текст в кавычках или ЗАГЛАВНЫМИ, со спецификацией шрифта, размера и размещения; сложные слова и названия брендов стоит прописывать по буквам.

Технические потолки, о которых полезно знать заранее: длина промпта для GPT Image моделей — до 32 000 символов, к редактированию можно приложить до 16 изображений размером менее 50 МБ каждое в форматах PNG, WebP или JPG.

Что в гайде не сходится: input_fidelity в примерах редактирования

В сводной таблице моделей напротив gpt-image-2 стоит: «Disabled. input_fidelity does not work for this model because output is already high fidelity by default». И это логично — в документации по стоимости отдельно сказано, что gpt-image-2 всегда обрабатывает входные изображения в высокой точности.

При этом четыре примера редактирования в том же кукбуке — снегопад на билборде, удаление цветка из руки, встраивание человека в сцену, композитинг собаки — передают input_fidelity="high" вместе с model="gpt-image-2". Что происходит на практике, зависит от того, куда вы стучитесь. В Responses API параметр приводит к ошибке 400 с кодом invalid_input_fidelity_model — это зафиксировано в баг-репорте pydantic-ai. Для эндпоинта images.edit подтверждения уровня документации у меня нет: справочник API пишет, что параметр поддерживается для gpt-image-1, gpt-image-1.5 «and later models», а на форуме OpenAI сообщают об ошибке при его отправке. Прямого ответа вендора нет.

Практика от этого не меняется: из вызовов gpt-image-2 параметр лучше убрать. Пользы он не даёт по определению, а риск получить 400 в проде — вполне реальный. И заодно проверьте свою SDK-обёртку: некоторые библиотеки подставляют поле сами, даже когда вы его не задавали.

Там же стоит держать в голове ещё одну вещь про редактирование: маска в GPT Image работает как подсказка, а не как жёсткая геометрия. Документация формулирует это так — модель использует маску как ориентир и может не следовать её форме в точности. Если изображений несколько, маска применяется к первому.

Готовые блоки промптов

Каждый блок вставляется в поле prompt целиком. Плейсхолдеры в угловых скобках заменяются на свои значения.

Точечная правка без дрейфа

Основная формула редактирования по гайду: «измени только X» плюс «оставь всё остальное без изменений», и список сохраняемого повторяется на каждой итерации. Пригодится, когда правку нужно сделать хирургически, а модель норовит переснять кадр.

Change ONLY <что меняем>.
Keep everything else exactly the same: identity, geometry, layout,
camera angle, framing, saturation, contrast, labels, arrows,
and all surrounding objects.
Do not restyle the image. Do not add text, logos, or watermarks.

Фотореализм без студийного лоска

Работает, когда нужен кадр, похожий на снятый, а не отрендеренный. Ключевое — явно просить настоящую фактуру и запрещать ретушь.

Create a photorealistic candid photograph of <объект и действие>.
Visible real texture: <поры, морщины, износ ткани, царапины>.
Shot like a 35mm film photograph, <кадрирование> at eye level,
using a 50mm lens. <Освещение>, shallow depth of field,
subtle film grain, natural color balance.
Honest and unposed. No glamorization, no heavy retouching.

Вырезание продукта на прозрачный фон

Отправляется на images.edit вместе с background="transparent" и output_format="png". Подробности параметров — в разборе того, как включается прозрачный фон в gpt-image-2.

Extract the product from the input image and isolate it on a fully
transparent background.
Output: centered product, crisp silhouette, no halos/fringing.
Preserve product geometry and label legibility exactly.
Add only light polishing. Do not add a solid backdrop, checkerboard,
scenery, or shadow.
Do not restyle the product; preserve clean alpha transparency.

Точный текст на макете

Типографика требует явных ограничений: точная строка в кавычках, требование дословности и запрет на лишние символы. Для мелкого текста и плотных панелей гайд советует quality medium или high.

<Описание сцены или макета>.
Text (EXACT, verbatim, no extra characters): "<ваша строка>"
Typography: <начертание>, high contrast, <выравнивание>, clean kerning.
Ensure the text appears exactly once and is perfectly legible.
No extra text, no watermarks, no unrelated logos.

Работа с несколькими входными изображениями

Каждый вход нумеруется и описывается, и отдельно проговаривается, что куда переносится. Без этого модель сама решит, какая картинка главная.

Image 1: <что это>. Image 2: <что это>.
Place <элемент> from image 2 into the setting of image 1,
<куда именно>. Match lighting, perspective, scale, and shadows
to image 1 so the result looks naturally captured in one photo.
Do not change anything else in image 1.

Якорь персонажа для серии картинок

Схема из гайда для многостраничных иллюстраций: сначала генерируется опорный кадр с персонажем, затем он подаётся на вход каждой следующей сцены с явным списком того, что нельзя переделывать.

Continue the story using the same character.
Scene: <новая сцена и действие>.
Character consistency: same <одежда>, same facial features,
same proportions, same color palette, same personality.
Style: <стиль>.
Constraints: do not redesign the character, no text, no watermarks.

Как понять, что промпт пора резать, а не удлинять

Гайд прямо говорит: длинные промпты работают, но отлаживать проще короткий базовый промпт с последовательными правками по одному изменению. Признаки того, что вы ушли не туда, обычно такие.

  • Вы добавляете детали, а результат меняется в непредсказуемых местах — значит, ограничения конфликтуют между собой и модель выбирает сама.
  • В промпте одновременно описан фон и требование прозрачности. Текст перебивает параметр background, и вы получите нарисованную сцену.
  • На третьей-четвёртой итерации «поплыли» вещи, которых вы не касались: список сохраняемых элементов нужно повторять в каждом запросе, а не только в первом.
  • Вы пытаетесь качеством компенсировать композицию. Мелкий текст действительно требует medium или high, но кадрирование, ракурс и размещение элементов задаются словами, а не параметром quality.
  • Промпт описывает камеру подробнее, чем сцену. Характеристики объектива модель интерпретирует нестрого, а вот масштаб, кадрирование тела, направление взгляда и взаимодействие с предметами работают надёжно.

Что сделать сейчас

  • Найдите в своём коде все вызовы gpt-image-2 с input_fidelity и уберите параметр, включая случаи, когда его подставляет библиотека.
  • Приведите промпты к одному порядку блоков и вынесите ограничения в отдельный хвост, который переиспользуется между шаблонами.
  • Для каждой правки заведите постоянный список сохраняемых элементов и подставляйте его в каждую итерацию.
  • Сравните low, medium и high на своих типовых картинках, прежде чем фиксировать качество в коде: разница в счёте кратная, и цена генерации в gpt-image-2 зависит от этого сильнее, чем от длины промпта.
  • Начинайте отладку с чистого базового промпта и вносите по одному изменению за итерацию.

Источники