Skip to main content
POST
Chat Completions Gemini ILM
Product: Visual Intelligence — Image Model APIs (atomic) Use case: Call an Image Language Model (Gemini / GPT / Nova / Qwen) directly with your own prompt. Full control over model and parameters. Host: https://mavi-backend.memories.ai/serve/api/v2 Auth: Authorization: sk-mavi-... (no Bearer prefix)
This endpoint allows you to generate chat completions with image inputs using Gemini ILM model.
Endpoint: POST https://mavi-backend.memories.ai/serve/api/v2/iu/chat/completionsImage Understanding (ILM) endpoints use the /iu path prefix. Video Understanding (VLM) endpoints use /vu instead.

Supported Models

All models require the gemini: prefix when used in the model parameter (e.g., gemini:gemini-2.5-flash).

Premium Models

Flash Models (High Performance)

Lite Models (Cost-Effective)

When using these models, remember to include the gemini: prefix in your API calls:
  • ✅ Correct: "model": "gemini:gemini-2.5-flash"
  • ❌ Incorrect: "model": "gemini-2.5-flash"

Request Body

Code Example

Response

Returns the chat completion response with structured output.

Response Parameters

Error Responses

Gemini upstream errors are wrapped in HTTP 200 — not a 4xx/5xx. Same envelope as gemini-vlm: check status and look for a top-level error object before parsing choices.
Verified live by submitting an empty input. This envelope is Gemini-specific — GPT, Nova, and Qwen use standard HTTP 4xx/5xx instead. Always check status == "completed" (or that choices is non-empty) before reading choices[0].text.

Authorizations

Authorization
string
header
required

Body

application/json
model
string
required

The model to use (e.g., gemini:gemini-2.5-flash)

Example:

"gemini:gemini-2.5-flash"

messages
object[]
required

Array of message objects

temperature
number
default:0.7

Controls randomness: 0.0-2.0, higher = more random

Required range: 0 <= x <= 2
max_tokens
integer
default:1000

Maximum number of tokens to generate

top_p
number
default:1

Nucleus sampling: 0.0-1.0

Required range: 0 <= x <= 1
frequency_penalty
number
default:0

Reduces repetition of frequent tokens: -2.0 to 2.0

Required range: -2 <= x <= 2
presence_penalty
number
default:0

Increases likelihood of new topics: -2.0 to 2.0

Required range: -2 <= x <= 2
n
integer
default:1

Number of completions to generate

stream
boolean
default:false

Whether to stream the response

stop

Stop sequences

extra_body
object

Response

200 - application/json

Chat completion response

id
string
required

Unique identifier for the completion

Example:

"resp_f8d13263-95b3-4337-b4c9-dbe9f6eb1e43"

object
string
required

Object type, always 'completion'

Example:

"completion"

model
string
required

The model used for the completion

Example:

"gemini:gemini-2.5-flash"

created_at
integer
required

Unix timestamp of when the completion was created

Example:

1767093024

status
string
required

Status of the completion

Example:

"completed"

choices
object[]
required
usage
object
required
meta
object
required