AI 数字人

AI 数字人

照片(或视频)+ 音频 → 口型同步说话视频 —— 基础版 / 高阶版 / MiniMax 三种模式

AI 数字人把一张照片(或一段输入视频)+ 一段音频驱动成口型同步的说话视频。提供两个接口,均为异步任务,提交后轮询查状态。素材不在公网?先用文件上传换取 6 小时有效的 URL。

Base URL:https://api.aiclonevoicefree.com | 鉴权:Authorization: Bearer sk_...

三种模式,点卡片直达

如何选择

数字人基础版(digital-human)数字人高阶版(generate)MiniMax 版(generate,engine=minimax)
输入照片或已有视频仅人像照片仅人像照片
动作提示词❌✅✅
输出尺寸宽高比 9:16 / 16:9 / 跟随原图,标准 / 高清两档清晰度三档清晰度:720 / 1280 / 1536,数字越大越清晰同高阶版
时长跟随音频固定 duration,或跟随音频(计费封顶 35 秒)跟随音频,最长 60 秒
计费1 或 1.5 积分每秒1.5 / 2 / 2.5 积分每秒固定 25 积分每秒
适合场景便宜,可驱动已有视频高清晰度 + 动作控制口型稳定、成功率高

数字人基础版:POST /api/v2/avatar/digital-human

字段类型必填说明
image_urlstring⬜*人像照片 URL(image_url 与 input_video_url 至少给一个)
input_video_urlstring⬜*输入视频 URL(驱动已有视频)
audio_urlstring✅说话音频 URL(时长由服务端实测,用于计费,无需传参)
aspect_ratiostring⬜视频宽高比:9:16(竖屏,默认)/ 16:9(横屏)/ original(跟随原图尺寸)
qualitystring⬜清晰度:standard(标准,速度快,默认)/ hd(高清 960P,出片稍慢)

计费(视频积分)

cost = 向上取整(实测秒数) × 倍率——提交时服务端从 audio_url 实测音频时长;倍率 = 标准清晰度 1、高清 1.5 (即标准 1 积分/秒、高清 1.5 积分/秒)。 音频超过 300 秒会被拒绝(audio_too_long);无法读取时长时提交返回 audio_probe_failed(请确认 URL 可公开访问)。 提交时不足直接 402;失败自动退款。

算例

  • 标准 9:16 竖屏(360×704)、12 秒 = 12 × 1 = 12 积分
  • 高清 16:9 横屏(960×544)、12 秒 = 12 × 1.5 = 18 积分
curl -X POST https://api.aiclonevoicefree.com/api/v2/avatar/digital-human \
  -H "Authorization: Bearer sk_your_api_key" \
  -H "Content-Type: application/json" \
  -d '{
    "image_url": "https://your-cdn.com/portrait.png",
    "audio_url": "https://your-cdn.com/speech.mp3",
    "aspect_ratio": "9:16",
    "quality": "hd"
  }'

响应 202

{
  "task_id": "b1d2...-uuid",
  "status": "pending",
  "capability": "avatar",
  "action": "digital-human",
  "model": "digital-human"
}

数字人高阶版:POST /api/v2/avatar/generate

把一张人像照片 + 一段音频合成为口型同步的说话视频,支持动作提示词、最高 1536px、最长 35 秒。

字段类型必填说明
image_urlstring✅人像照片 URL
audio_urlstring✅说话音频 URL
durationint⬜5/10/15/20/25/30/35,或 0=跟随完整音频(时长由服务端实测);默认 10
resolutionint⬜清晰度档位 720 / 1280 / 1536(数字越大越清晰);默认 1280
framerateint⬜24 / 25 / 30;默认 25
motion_promptstring⬜动作/表情描述,≤ 2000 字符;留空时用默认"自然说话"提示词
enginestring⬜传 "minimax"(忽略大小写)使用 MiniMax H3 引擎;其他值/缺省为默认 LTX 引擎

计费(视频积分,按秒)

清晰度档位每秒费率
7201.5
12802
15362.5

cost = 向上取整(每秒费率 × 计费秒数)。duration > 0 时计费秒数=duration;duration=0 时取服务端实测的音频时长(封顶 35 秒)。提交时视频积分不足直接 402;任务失败自动退款。

算例

  • 1280px、10 秒 = 2 × 10 = 20 积分
  • 1536px、20 秒 = 2.5 × 20 = 50 积分
curl -X POST https://api.aiclonevoicefree.com/api/v2/avatar/generate \
  -H "Authorization: Bearer sk_your_api_key" \
  -H "Content-Type: application/json" \
  -d '{
    "image_url": "https://your-cdn.com/portrait.png",
    "audio_url": "https://your-cdn.com/speech.mp3",
    "duration": 10,
    "resolution": 1280,
    "framerate": 25,
    "motion_prompt": "自然地看向镜头说话,带轻微的表情和头部动作"
  }'

响应 202

{
  "task_id": "1939...",
  "status": "pending",
  "capability": "avatar",
  "action": "generate",
  "model": "avatar-pro"
}

MiniMax 版(engine: "minimax")

在同一接口上传 engine: "minimax" 即可使用 MiniMax H3 引擎——口型稳定、成功率高。与默认 LTX 引擎的差异:

  • 音频上限:最长 60 秒,由服务端实测(超出返回 audio_too_long 错误)
  • duration:不适用 5/10/.../35 白名单;默认 0(跟随整段音频),任意正整数按值计费
  • 计费:固定 25 积分/秒,与 resolution 无关——cost = 向上取整(25 × 计费秒数),计费秒数封顶 60
  • resolution 仍影响输出尺寸但不影响价格;framerate 不生效;motion_prompt 正常使用
  • 响应结构与轮询方式与默认引擎完全一致
curl -X POST https://api.aiclonevoicefree.com/api/v2/avatar/generate \
  -H "Authorization: Bearer sk_your_api_key" \
  -H "Content-Type: application/json" \
  -d '{
    "image_url": "https://your-cdn.com/portrait.png",
    "audio_url": "https://your-cdn.com/speech.mp3",
    "resolution": 720,
    "engine": "minimax",
    "motion_prompt": "自然地看向镜头说话"
  }'

取结果

两个接口共用一个轮询路由:GET /api/v2/avatar/tasks/{task_id},完成时 videoUrl 为成片地址:

{
  "status": "completed",
  "capability": "avatar",
  "model": "avatar-pro",
  "progress": 1.0,
  "videoUrl": "https://.../result.mp4"
}

高阶版与 MiniMax 生成通常需要数分钟。另见 双人数字人。

On this page