创建语音
/v1/audio/speech将文本转换为语音音频。当所选模型支持时,该端点支持纯文本生成、参考音频生成和参考图片生成。
认证
Authorization Bearer
在 Authorization 请求头中使用 API Key 作为 Bearer Token。
Request Body
inputstringrequiredText input to synthesize into speech.
modelstringrequiredModel ID.
language_typestringSpeech language type.
speednumberSpeech speed adjustment.
referencesarraySpeech synthesis reference resources.
references.audio_urlstringReference audio URL.
references.image_urlstringReference image URL.
references.speakerstringProvider speaker ID or cloned voice ID.
references.audio_datastringBase64-encoded reference audio data.
references.image_datastringBase64-encoded reference image data.
audio_configobjectOutput audio configuration.
audio_config.formatstringOutput audio format.
audio_config.sample_rateintegerOutput audio sample rate in Hz.
audio_config.speech_ratenumberSpeech speed adjustment.
audio_config.pitch_ratenumberOutput pitch adjustment.
audio_config.loudness_ratenumberOutput loudness adjustment.
audio_formatstringOutput audio format.
rateintegerOutput audio sample rate in Hz.
loudness_rateintegerOutput loudness adjustment.
pitch_rateintegerOutput pitch adjustment.
watermarkobjectWatermark configuration.
watermark.aigc_watermarkbooleanEnable or disable the AIGC watermark.
watermark.aigc_metadataobjectAIGC metadata configuration.
response_formatstringResponse format.
metadataobjectApplication metadata.
extra_bodyobjectAdditional request body fields.
provider_optionsobjectUpstream configuration.
x_api_request_idstringUpstream request ID.
Response
audiostring生成音频 URL;如果 URL 转换不可用,则可能为 Base64 编码音频。
audio_typestringaudio 字段的编码方式。
modelstring用于合成的模型。
voicestring可用时返回供应商音色标识。纯文本请求可能返回默认音色值。
formatstring音频格式。
sample_rateinteger采样率,单位 Hz。
usageobject用量和供应商侧关联信息。
usage.audio_duration_secondsnumber可用时用于计费的生成音频秒数。优先使用供应商侧时长元数据,缺失时回退到后处理时长。
usage.original_durationnumber供应商原始输出时长,单位秒。
usage.durationnumber后处理后的音频时长,单位秒。
usage.provider_request_idstring用于上游关联排查的供应商请求 ID。