Kling AI 数字人

使用 Kling 通过 fal,将一张私密 JPG 或 PNG 人像和 2-300 秒私密 MP3、WAV、M4A 或 AAC 音频生成说话人像视频。Standard 每秒 0.0562 美元,需 10-1,405 积分;Pro 每秒 0.115 美元,需 20-2,875 积分。不会发送提示词。

模型
Kling AI Avatar Standardfal · Standard cost-effective talking portrait · audio-timed
规格
JPG/PNG · 最大 10 MB · 每边至少 300pxMP3/WAV/M4A/AAC · 2-300 秒 · 最大 5 MB
官方视频样片位已预留

Kanvora 不会把其他模型的视频冒充样片。只有所选模型的来源可追踪输出获批后才会填充此舞台。

什么是 Kling AI 数字人?

Kling AI 数字人根据提供的音频让一张静态人像说话。Standard 是 fal 的高性价比档,Pro 是更高质量档。Kanvora 会私密验证两份文件,并按验证后的音频时长计费,不承诺 fal 端点未公布的输出分辨率。

如何生成说话人像

  1. 准备人像

    选择一张最大 10 MB 的 JPG 或 PNG。宽高都不得小于 300 像素,宽高比须在 1:2.5 到 2.5:1 之间。

  2. 准备音频

    选择 2-300 秒、最大 5 MB 的 MP3、WAV、M4A 或 AAC。

  3. 选择 Standard 或 Pro

    Standard 每秒 0.0562 美元,更经济;Pro 每秒 0.115 美元,质量档更高。验证后的音频时长决定准确冻结额。

  4. 检查已保存结果

    下载前检查人物一致性、口型时序、牙齿、表情、构图、动作和音频对齐。

素材准备建议

  • 使用脸部足够清晰、便于检查的人像。
  • 优先使用没有多人重叠、爆音或长时间静音的干净语音。
  • 上传前将音频裁剪到准确成片时长。
  • Standard 和 Pro 是质量与成本档位,不代表有保证的分辨率。

常见问题

人像有哪些限制?

JPG 或 PNG,最大 10 MB,宽高都至少 300 像素,宽高比在 1:2.5 到 2.5:1 之间。

音频有哪些限制?

MP3、WAV、M4A 或 AAC,2-300 秒,最大 5 MB。

Standard 和 Pro 如何计费?

fal 标价为 Standard 每秒 0.0562 美元,Pro 每秒 0.115 美元。按 Kanvora 现有每积分覆盖 0.012 美元供应商成本的公式,Standard 为 10-1,405 积分,Pro 为 20-2,875 积分。

这和 Kling 口型同步一样吗?

不一样。AI 数字人从静态人像和音频开始;口型同步从已有的短人脸视频和音频开始。