Доступные модели
Актуальные цены — на странице цен. Модели Gemini тарифицируются за вызов (одна фиксированная цена за картинку),
gpt-image-2 — по токенам (чем больше и качественнее картинка, тем дороже).
Адрес API и авторизация
- Base URL:
https://www.ruapi.ai/v1 - Авторизация: заголовок
Authorization: Bearer sk-ВАШ_КЛЮЧ(создаётся в панели, раздел «Токены»)
Способ 1. Gemini Image — через чат
Модели Gemini Image живут на чат-эндпоинте. Вы отправляете обычный запрос как к текстовой модели, а в ответ получаете изображение.Текст → изображение
Изображение → изображение (редактирование)
Чтобы отредактировать существующее изображение, передайте его в том же формате, что и для vision-моделей: массивcontent с частями text и image_url. В url можно подставить как обычную ссылку, так и data URI.
Соотношение сторон исходного изображения сохраняется — результат не обрезается до квадрата.
Многошаговое редактирование
Ответ модели можно вернуть обратно вmessages как сообщение assistant — Markdown data URI будет распознан и изображение уйдёт на вход следующего шага. Так строится диалог «сделай чёрно-белым» → «а теперь добавь рамку».
Поддерживаемые форматы входных изображений
image/png, image/jpeg, image/webp, image/heic, image/heif. Всё остальное будет отклонено с ошибкой mime type is not supported by Gemini.
Нативный эндпоинт Gemini
Если вы уже пишете под Google GenAI SDK, тот же ключ работает и с нативным форматом:candidates[0].content.parts[].inlineData.data (base64), без Markdown. Если вам не нужна совместимость с OpenAI SDK, этот вариант удобнее.
Способ 2. GPT Image — через /v1/images/generations
gpt-image-2 — это классический эндпоинт генерации изображений OpenAI. Никаких messages, только prompt.
Параметры
Ответ
Частые вопросы
Почему gemini-2.5-flash-image не работает через /v1/images/generations?
Почему gemini-2.5-flash-image не работает через /v1/images/generations?
Потому что это не модель генерации изображений в терминах OpenAI, а мультимодальная чат-модель, которая умеет отдавать картинки. Вызывайте её через
/v1/chat/completions — см. «Способ 1».Что за огромная строка base64 в поле content?
Что за огромная строка base64 в поле content?
Это и есть изображение. При отдаче через OpenAI-совместимый чат-эндпоинт картинка вставляется в текст ответа как
. Вытащите её регуляркой (пример выше) или используйте нативный эндпоинт Gemini, где изображение приходит отдельным полем.Какую модель выбрать для редактирования фотографий?
Какую модель выбрать для редактирования фотографий?
gemini-2.5-flash-image — лучшее соотношение цены и качества для правок. Если нужен максимум детализации, берите gemini-3-pro-image-preview. gpt-image-2 тоже умеет редактировать, но через отдельный эндпоинт /v1/images/edits.Сколько хранятся результаты?
Сколько хранятся результаты?
Модели Gemini не хранят ничего: base64 приходит прямо в ответе. У
gpt-image-2 в ответе есть поле url, но полагаться на него не стоит — сохраняйте b64_json.В ответе Gemini есть usage с токенами — за них списывают?
В ответе Gemini есть usage с токенами — за них списывают?
Нет. Модели Gemini Image тарифицируются за вызов: одна фиксированная цена за картинку. Поле
usage приходит справочно и на списание не влияет. По токенам считается только gpt-image-2.