Skip to main content
对口型生成可以让视频中的人物”说”出您指定的话,支持两种输入方式——文本驱动(内置 TTS 合成语音)或直接使用音频文件驱动。 该接口需要 session_id,必须先调用人脸识别接口获取。

工作流概览

输入方式

文本驱动——内置 TTS

提供 textvoice_idvoice_language,平台使用指定音色将文字合成为语音,再驱动嘴型。

音频驱动——使用已有音频文件

提供 audio_url,直接用音频文件驱动嘴型。

请求参数

轮询结果

任务创建后,使用 GET /kling/v1/videos/advanced-lip-sync/{task_id} 查询状态,参考任务查询文档。状态流转:queuedprocessingsucceeded / failed 成功后,视频下载链接在 data.data.task_result.videos[0].url

前置步骤:人脸识别

必须先调用此接口获取 session_id。

音色 ID 参考文档

在线试听所有可用音色,选择适合的 voice_id 参数值。

API 参考

查看 Kling 对口型生成的交互式 API 文档。