Gemini 媒体识别(原生Gemini格式)
Gemini 原生接口除文本对话外,还支持在同一 generateContent 端点上传图像、PDF、音频、视频进行识别与理解,使用与文本聊天相同的 Base URL 和认证方式。
仅支持 inlineData Base64 上传
YouQi AI 仅支持通过 inlineData 以 Base64 方式内联上传媒体文件,不支持 fileData.fileUri 或 Gemini File API(先上传文件再引用)。请将文件编码为 Base64 后直接放入请求体。
接口地址
POST /v1beta/models/{model}:generateContentBase URL 与认证方式同 Gemini 文本聊天:https://ai.youqi.tech/v1beta,通过 ?key= 查询参数或 x-goog-api-key 头传递密钥。
请求参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
contents | array | 是 | 对话内容列表,每项含 role 与 parts |
parts[].text | string | 否 | 文本提示词 |
parts[].inlineData | object | 否 | 内联媒体数据,含 mimeType 与 data(Base64 字符串) |
请求示例
图像识别
bash
curl "https://ai.youqi.tech/v1beta/models/gemini-2.5-pro:generateContent?key=sk-YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"role": "user",
"parts": [
{ "text": "这张图片里有什么?" },
{
"inlineData": {
"mimeType": "image/jpeg",
"data": "BASE64_ENCODED_IMAGE_DATA"
}
}
]
}
]
}'PDF / 音频 / 视频识别
将 mimeType 替换为对应类型(如 application/pdf、audio/mp3、video/mp4),data 为该文件的 Base64 编码,其余结构一致:
json
{
"contents": [
{
"role": "user",
"parts": [
{ "text": "总结这份 PDF 的要点。" },
{
"inlineData": {
"mimeType": "application/pdf",
"data": "BASE64_ENCODED_PDF_DATA"
}
}
]
}
]
}响应示例
json
{
"candidates": [
{
"content": {
"role": "model",
"parts": [{ "text": "图片中是一只在草地上奔跑的金毛犬。" }]
},
"finishReason": "STOP"
}
],
"usageMetadata": {
"promptTokenCount": 258,
"candidatesTokenCount": 18,
"totalTokenCount": 276
}
}提示
Base64 编码会显著增加请求体体积,大文件请注意客户端与网关的请求体大小限制。若只需纯文本对话,使用 Gemini 文本聊天 即可。