Skip to main content
ARouter 提供三种模式的全面音频支持:语音转文字(转录和翻译)、文字转语音(TTS)以及音频对话(接受音频输入并产生语音输出的多模态模型)。

音频转录

使用与 OpenAI 兼容的 /v1/audio/transcriptions 端点将音频文件转录为文字。

转录参数

单词级时间戳


音频翻译

将任意语言的音频翻译为英文文字:

文字转语音

将文字转换为自然语音:

TTS 参数

可用声音


音频对话(多模态模型)

部分模型直接接受音频作为聊天消息输入,并能以语音音频进行回复。

音频输入

支持的输入音频格式

音频输出

在模型响应中请求语音音频:

支持的模型

语音转文字

文字转语音


Token 定价

音频 Token 在 usage.prompt_tokens_details 中单独统计:
音频 Token 的定价与文字 Token 不同。请查看响应中的 usage.cost 了解每次请求的实际费用。