Gemini 语音合成(原生Gemini格式)
除 OpenAI 兼容的语音合成接口 外,YouQi AI 还支持 Gemini 原生的语音生成模型(如 gemini-2.5-flash-preview-tts),复用 Gemini 的 generateContent 端点,通过 responseModalities 与 speechConfig 指定音频输出。
接口地址
POST /v1beta/models/{model}:generateContentBase URL 与认证方式同 Gemini 文本聊天:https://ai.youqi.tech/v1beta,通过 ?key= 查询参数或 x-goog-api-key 头传递密钥。
请求参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
contents[].parts[].text | string | 是 | 待合成的文本 |
generationConfig.responseModalities | array | 是 | 固定为 ["AUDIO"] |
generationConfig.speechConfig.voiceConfig.prebuiltVoiceConfig.voiceName | string | 是 | 预置音色名称 |
请求示例
bash
curl "https://ai.youqi.tech/v1beta/models/gemini-2.5-flash-preview-tts:generateContent?key=sk-YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{ "parts": [{ "text": "你好,欢迎使用 YouQi AI。" }] }
],
"generationConfig": {
"responseModalities": ["AUDIO"],
"speechConfig": {
"voiceConfig": {
"prebuiltVoiceConfig": { "voiceName": "Kore" }
}
}
}
}'响应示例
音频以 Base64 内联数据形式包含在返回的 parts 中(inlineData.data,MIME 类型如 audio/L16;codec=pcm;rate=24000):
json
{
"candidates": [
{
"content": {
"role": "model",
"parts": [
{
"inlineData": {
"mimeType": "audio/L16;codec=pcm;rate=24000",
"data": "BASE64_ENCODED_AUDIO_DATA"
}
}
]
},
"finishReason": "STOP"
}
],
"usageMetadata": {
"promptTokenCount": 12,
"candidatesTokenCount": 0,
"totalTokenCount": 12
}
}提示
可用的音色名称与支持的 TTS 模型请以所选模型的实际能力为准。若只需通用文本转语音,/v1/audio/speech(OpenAI 兼容格式)更简单易用。