API 目录

音频理解

POST
/v1beta/models/gemini-2.5-pro:generateContent

音频理解

Vortap 支持通过 Gemini 兼容接口提交音频内容,并让模型对音频进行理解、摘要、问答或信息抽取。

接口地址

POST https://www.vortapapi.com/v1/v1beta/models/gemini-2.5-pro:generateContent

该接口保持与 Gemini generateContent 请求结构兼容。

鉴权方式

请在请求中携带 Vortap API Key。示例:

x-goog-api-key: sk-***

也可以通过查询参数传入:

?key=sk-***

查询参数

名称类型必填说明
keystringVortap API Key,用于接口鉴权。

请求头

名称类型必填说明
Content-Typestring请求体格式,通常为 application/json
x-goog-api-keystringVortap API Key。若已通过 key 查询参数传入,可不填写。

请求示例

curl "https://www.vortapapi.com/v1/v1beta/models/gemini-2.5-pro:generateContent?key=sk-***" \
  -H "Content-Type: application/json" \
  -X POST \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "text": "请总结这段音频的主要内容。"
          },
          {
            "inline_data": {
              "mime_type": "audio/mpeg",
              "data": "BASE64_ENCODED_AUDIO"
            }
          }
        ]
      }
    ]
  }'

请求体

字段类型必填说明
contentsarray对话内容列表,包含文本、音频等输入片段。
contents[].partsarray单条内容中的多模态输入片段。
contents[].parts[].textstring文本提示词,用于说明希望模型完成的任务。
contents[].parts[].inline_dataobject以内联 Base64 形式提交的音频数据。
contents[].parts[].inline_data.mime_typestring音频 MIME 类型,例如 audio/mpegaudio/wav
contents[].parts[].inline_data.datastringBase64 编码后的音频内容。

响应示例

{
  "candidates": [
    {
      "content": {
        "parts": [
          {
            "text": "这段音频主要讨论了……"
          }
        ],
        "role": "model"
      }
    }
  ]
}

使用说明

  • 音频文件需要先转换为 Base64 后放入 inline_data.data
  • mime_type 应与实际音频格式一致,否则可能导致解析失败。
  • 可在同一个 parts 数组中同时提供文本指令和音频内容。
  • 如需更稳定的结果,建议在 text 中明确说明输出格式、语言和任务目标。