AI 数字人

AI 数字人 Pro

人像 + 音频 → 高清口型同步说话视频,最长 35 秒(720 / 1280 / 1536px)

AI 数字人 Pro 把一张人像照片 + 一段音频合成为口型同步的说话视频,支持动作提示词、最高 1536px、最长 35 秒。异步任务,提交后轮询查状态

Base URLhttps://api.aiclonevoicefree.com鉴权Authorization: Bearer sk_...

POST /api/v2/avatar/generate

字段类型必填说明
image_urlstring人像照片 URL
audio_urlstring说话音频 URL
durationint5/10/15/20/25/30/35,或 0=跟随完整音频;默认 10
audio_duration_secondsnumberduration=0 时用于计费的音频时长(秒)
resolutionint长边像素 720 / 1280 / 1536;默认 1280
framerateint24 / 25 / 30;默认 25
motion_promptstring动作/表情描述,≤ 2000 字符;留空时用默认"自然说话"提示词

计费(视频积分,按秒)

长边分辨率每秒费率
7201.5
12802
15362.5

cost = 向上取整(每秒费率 × 计费秒数)duration > 0 时计费秒数=durationduration=0 时取 audio_duration_seconds(封顶 35 秒)。提交时视频积分不足直接 402;任务失败自动退款。

算例

  • 1280px、10 秒 = 2 × 10 = 20 积分
  • 1536px、20 秒 = 2.5 × 20 = 50 积分

示例

curl -X POST https://api.aiclonevoicefree.com/api/v2/avatar/generate \
  -H "Authorization: Bearer sk_your_api_key" \
  -H "Content-Type: application/json" \
  -d '{
    "image_url": "https://your-cdn.com/portrait.png",
    "audio_url": "https://your-cdn.com/speech.mp3",
    "duration": 10,
    "resolution": 1280,
    "framerate": 25,
    "motion_prompt": "自然地看向镜头说话,带轻微的表情和头部动作"
  }'

响应 202

{
  "task_id": "1939...",
  "status": "pending",
  "capability": "avatar",
  "action": "generate",
  "model": "avatar-pro"
}

取结果

轮询 GET /api/v2/avatar/tasks/{task_id},完成时:

{
  "status": "completed",
  "capability": "avatar",
  "model": "avatar-pro",
  "progress": 1.0,
  "videoUrl": "https://.../result.mp4"
}

生成通常需要数分钟。另见 AI 数字人双人数字人

On this page