Skip to main content
ARouter は3つのモードで包括的な音声サポートを提供します:音声テキスト変換(文字起こしと翻訳)、テキスト音声変換(TTS)、音声チャット(音声入力を受け付け、音声出力を生成するマルチモーダルモデル)。

音声文字起こし

OpenAI 互換の /v1/audio/transcriptions エンドポイントを使用して音声ファイルをテキストに文字起こしします。

文字起こしパラメータ

単語レベルのタイムスタンプ


音声翻訳

任意の言語の音声を英語テキストに翻訳します:

テキスト音声変換

テキストを自然な音声に変換します:

TTS パラメータ

使用可能な音声


音声チャット(マルチモーダルモデル)

一部のモデルはチャットメッセージの入力として音声を直接受け付け、音声オーディオで応答できます。

音声入力

対応入力音声フォーマット

音声出力

モデルのレスポンスに音声オーディオをリクエストします:

対応モデル

音声テキスト変換

テキスト音声変換


Token 料金

音声 Token は usage.prompt_tokens_details で個別に追跡されます:
音声 Token はテキスト Token とは異なる料金が適用されます。各リクエストの実際の料金はレスポンスの usage.cost を確認してください。