Skip to content

Gemini 媒体识别(原生Gemini格式)

Gemini 原生接口除文本对话外,还支持在同一 generateContent 端点上传图像、PDF、音频、视频进行识别与理解,使用与文本聊天相同的 Base URL 和认证方式。

仅支持 inlineData Base64 上传

YouQi AI 仅支持通过 inlineDataBase64 方式内联上传媒体文件,不支持 fileData.fileUri 或 Gemini File API(先上传文件再引用)。请将文件编码为 Base64 后直接放入请求体。

接口地址

POST /v1beta/models/{model}:generateContent

Base URL 与认证方式同 Gemini 文本聊天https://ai.youqi.tech/v1beta,通过 ?key= 查询参数或 x-goog-api-key 头传递密钥。

请求参数

参数类型必填说明
contentsarray对话内容列表,每项含 roleparts
parts[].textstring文本提示词
parts[].inlineDataobject内联媒体数据,含 mimeTypedata(Base64 字符串)

请求示例

图像识别

bash
curl "https://ai.youqi.tech/v1beta/models/gemini-2.5-pro:generateContent?key=sk-YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      {
        "role": "user",
        "parts": [
          { "text": "这张图片里有什么?" },
          {
            "inlineData": {
              "mimeType": "image/jpeg",
              "data": "BASE64_ENCODED_IMAGE_DATA"
            }
          }
        ]
      }
    ]
  }'

PDF / 音频 / 视频识别

mimeType 替换为对应类型(如 application/pdfaudio/mp3video/mp4),data 为该文件的 Base64 编码,其余结构一致:

json
{
  "contents": [
    {
      "role": "user",
      "parts": [
        { "text": "总结这份 PDF 的要点。" },
        {
          "inlineData": {
            "mimeType": "application/pdf",
            "data": "BASE64_ENCODED_PDF_DATA"
          }
        }
      ]
    }
  ]
}

响应示例

json
{
  "candidates": [
    {
      "content": {
        "role": "model",
        "parts": [{ "text": "图片中是一只在草地上奔跑的金毛犬。" }]
      },
      "finishReason": "STOP"
    }
  ],
  "usageMetadata": {
    "promptTokenCount": 258,
    "candidatesTokenCount": 18,
    "totalTokenCount": 276
  }
}

提示

Base64 编码会显著增加请求体体积,大文件请注意客户端与网关的请求体大小限制。若只需纯文本对话,使用 Gemini 文本聊天 即可。