Skip to main content
ARouter 提供三種模式的全面音訊支援:語音轉文字(轉錄和翻譯)、文字轉語音(TTS)以及音訊對話(接受音訊輸入並產生語音輸出的多模態模型)。

音訊轉錄

使用與 OpenAI 相容的 /v1/audio/transcriptions 端點將音訊檔案轉錄為文字。

轉錄參數

單詞級時間戳


音訊翻譯

將任意語言的音訊翻譯為英文文字:

文字轉語音

將文字轉換為自然語音:

TTS 參數

可用聲音


音訊對話(多模態模型)

部分模型直接接受音訊作為聊天訊息輸入,並能以語音音訊進行回覆。

音訊輸入

支援的輸入音訊格式

音訊輸出

在模型回應中請求語音音訊:

支援的模型

語音轉文字

文字轉語音


Token 定價

音訊 Token 在 usage.prompt_tokens_details 中單獨統計:
音訊 Token 的定價與文字 Token 不同。請查看回應中的 usage.cost 了解每次請求的實際費用。