Skip to content

Transcriptions (Speech-to-Text)

將音訊轉寫為文本,採用通用 Transcriptions 協議格式。

POST https://wrouter.ai/v1/audio/transcriptions

請求為 multipart/form-data

表單欄位

欄位型別必填說明
filefile音訊檔案,支援 mp3 mp4 m4a wav webm flac 等,<= 25MB
modelstringwhisper-1gpt-4o-transcribeparaformer-v2
languagestringISO-639-1 程式碼,如 zhen;不填則自動檢測
promptstring提示文本,可用於風格 / 專有名詞提示
response_formatstringjson(預設)、textsrtverbose_jsonvtt
temperaturenumber0~1,預設 0
timestamp_granularitiesarray["word"]["segment"],需配合 response_format=verbose_json

示例

bash
curl https://wrouter.ai/v1/audio/transcriptions \
  -H "Authorization: Bearer $WROUTER_API_KEY" \
  -F file=@./meeting.mp3 \
  -F model=whisper-1 \
  -F language=zh \
  -F response_format=srt
python
from openai import OpenAI
client = OpenAI(api_key="sk-...", base_url="https://wrouter.ai/v1")
with open("audio.mp3","rb") as f:
    text = client.audio.transcriptions.create(
        model="whisper-1",
        file=f,
        language="zh",
    ).text

Translations 端點

POST /v1/audio/translations 將任意語言音訊翻譯為英文,引數同上,但 language 欄位會被忽略。