Skip to content

Gemini 语音合成(原生Gemini格式)

OpenAI 兼容的语音合成接口 外,YouQi AI 还支持 Gemini 原生的语音生成模型(如 gemini-2.5-flash-preview-tts),复用 Gemini 的 generateContent 端点,通过 responseModalitiesspeechConfig 指定音频输出。

接口地址

POST /v1beta/models/{model}:generateContent

Base URL 与认证方式同 Gemini 文本聊天https://ai.youqi.tech/v1beta,通过 ?key= 查询参数或 x-goog-api-key 头传递密钥。

请求参数

参数类型必填说明
contents[].parts[].textstring待合成的文本
generationConfig.responseModalitiesarray固定为 ["AUDIO"]
generationConfig.speechConfig.voiceConfig.prebuiltVoiceConfig.voiceNamestring预置音色名称

请求示例

bash
curl "https://ai.youqi.tech/v1beta/models/gemini-2.5-flash-preview-tts:generateContent?key=sk-YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [
      { "parts": [{ "text": "你好,欢迎使用 YouQi AI。" }] }
    ],
    "generationConfig": {
      "responseModalities": ["AUDIO"],
      "speechConfig": {
        "voiceConfig": {
          "prebuiltVoiceConfig": { "voiceName": "Kore" }
        }
      }
    }
  }'

响应示例

音频以 Base64 内联数据形式包含在返回的 parts 中(inlineData.data,MIME 类型如 audio/L16;codec=pcm;rate=24000):

json
{
  "candidates": [
    {
      "content": {
        "role": "model",
        "parts": [
          {
            "inlineData": {
              "mimeType": "audio/L16;codec=pcm;rate=24000",
              "data": "BASE64_ENCODED_AUDIO_DATA"
            }
          }
        ]
      },
      "finishReason": "STOP"
    }
  ],
  "usageMetadata": {
    "promptTokenCount": 12,
    "candidatesTokenCount": 0,
    "totalTokenCount": 12
  }
}

提示

可用的音色名称与支持的 TTS 模型请以所选模型的实际能力为准。若只需通用文本转语音,/v1/audio/speechOpenAI 兼容格式)更简单易用。