Skip to main content
POST
当前文字转语音能力由可灵渠道提供。你可以使用 OpenAI Speech 请求字段提交任务,也可以直接使用可灵原生兼容接口。
可灵 TTS 是异步任务。POST /v1/audio/speech 在模型路由到可灵渠道时返回任务 JSON,不会像 OpenAI TTS 一样直接返回二进制音频流。

支持模型

  • kling-v3
模型与音色的实际可用性取决于当前渠道,请以 模型广场 和上游可用音色为准。

OpenAI 兼容请求

string
default:"kling-v3"
required
填写路由到可灵渠道的模型 ID。
string
required
需要合成的文本。内部映射为可灵的 text
string
可灵已有音色 ID。内部映射为 voice_id
number
default:"1"
语速,范围 0.254.0。内部映射为 voice_speed
string
可选的语音风格或表达要求。内部映射为可灵提示字段。
string
Xcompute 扩展字段,例如 zhen。内部映射为 voice_language
object
可灵扩展字段,例如 callback_urlexternal_task_id
response_formatstream_format 当前不会改变可灵异步任务的输出格式。最终音频格式由可灵上游结果决定。
object 当前沿用统一异步多媒体任务结构,可能显示为 video。这不影响最终返回音频 URL。

可灵原生接口

原生接口使用可灵字段,返回与 OpenAI 兼容入口相同的异步任务结构。
voicevoice_id 用于选择已有音色。当前没有独立的音色克隆接口。

多模态通用任务接口

需要统一管理图片、视频和音频任务时,也可以使用多模态接口:

查询任务

统一任务查询

可灵原生查询

任务完成后,响应中的 metadata.url 为音频结果地址:

统一任务查询

查看异步任务状态与结果字段。