Skip to main content
ARouter는 세 가지 모드에서 포괄적인 오디오 지원을 제공합니다: 음성 텍스트 변환(전사 및 번역), 텍스트 음성 변환(TTS), 오디오 채팅(오디오 입력을 받아 음성 출력을 생성하는 멀티모달 모델).

오디오 전사

OpenAI 호환 /v1/audio/transcriptions 엔드포인트를 사용하여 오디오 파일을 텍스트로 전사합니다.

전사 파라미터

단어 수준 타임스탬프


오디오 번역

모든 언어의 오디오를 영어 텍스트로 번역합니다:

텍스트 음성 변환

텍스트를 자연스러운 음성으로 변환합니다:

TTS 파라미터

사용 가능한 음성


오디오 채팅(멀티모달 모델)

일부 모델은 채팅 메시지 입력으로 오디오를 직접 받아 음성 오디오로 응답할 수 있습니다.

오디오 입력

지원되는 입력 오디오 형식

오디오 출력

모델 응답의 일부로 음성 오디오를 요청합니다:

지원 모델

음성 텍스트 변환

텍스트 음성 변환


Token 가격

오디오 Token은 usage.prompt_tokens_details에서 별도로 추적됩니다:
오디오 Token은 텍스트 Token과 다른 요금이 적용됩니다. 각 요청의 실제 비용은 응답의 usage.cost를 확인하세요.