什么是 Kling AI 数字人?
Kling AI 数字人根据提供的音频让一张静态人像说话。Standard 是 fal 的高性价比档,Pro 是更高质量档。Kanvora 会私密验证两份文件,并按验证后的音频时长计费,不承诺 fal 端点未公布的输出分辨率。
如何生成说话人像
准备人像
选择一张最大 10 MB 的 JPG 或 PNG。宽高都不得小于 300 像素,宽高比须在 1:2.5 到 2.5:1 之间。
准备音频
选择 2-300 秒、最大 5 MB 的 MP3、WAV、M4A 或 AAC。
选择 Standard 或 Pro
Standard 每秒 0.0562 美元,更经济;Pro 每秒 0.115 美元,质量档更高。验证后的音频时长决定准确冻结额。
检查已保存结果
下载前检查人物一致性、口型时序、牙齿、表情、构图、动作和音频对齐。
素材准备建议
- 使用脸部足够清晰、便于检查的人像。
- 优先使用没有多人重叠、爆音或长时间静音的干净语音。
- 上传前将音频裁剪到准确成片时长。
- Standard 和 Pro 是质量与成本档位,不代表有保证的分辨率。
常见问题
人像有哪些限制?
JPG 或 PNG,最大 10 MB,宽高都至少 300 像素,宽高比在 1:2.5 到 2.5:1 之间。
音频有哪些限制?
MP3、WAV、M4A 或 AAC,2-300 秒,最大 5 MB。
Standard 和 Pro 如何计费?
fal 标价为 Standard 每秒 0.0562 美元,Pro 每秒 0.115 美元。按 Kanvora 现有每积分覆盖 0.012 美元供应商成本的公式,Standard 为 10-1,405 积分,Pro 为 20-2,875 积分。
这和 Kling 口型同步一样吗?
不一样。AI 数字人从静态人像和音频开始;口型同步从已有的短人脸视频和音频开始。