AI 数字人
照片(或视频)+ 音频 → 口型同步说话视频 —— 基础版 / 高阶版 / MiniMax 三种模式
AI 数字人把一张照片(或一段输入视频)+ 一段音频驱动成口型同步的说话视频。提供两个接口,均为异步任务,提交后轮询查状态。素材不在公网?先用文件上传换取 6 小时有效的 URL。
Base URL:
https://api.aiclonevoicefree.com| 鉴权:Authorization: Bearer sk_...
三种模式,点卡片直达
数字人基础版
标准数字人,生成快,1 积分/秒起,可自由指定画幅与清晰度
数字人高阶版
最高 1536px 高清对口型,支持动作提示词与时长/帧率控制
MiniMax 版
MiniMax H3 驱动,口型稳定、成功率高;音频最长 1 分钟
如何选择
数字人基础版(digital-human) | 数字人高阶版(generate) | MiniMax 版(generate,engine=minimax) | |
|---|---|---|---|
| 输入 | 照片或已有视频 | 仅人像照片 | 仅人像照片 |
| 动作提示词 | ❌ | ✅ | ✅ |
| 输出尺寸 | 宽高比 9:16 / 16:9 / 跟随原图,标准 / 高清两档清晰度 | 三档清晰度:720 / 1280 / 1536,数字越大越清晰 | 同高阶版 |
| 时长 | 跟随音频 | 固定 duration,或跟随音频(计费封顶 35 秒) | 跟随音频,最长 60 秒 |
| 计费 | 1 或 1.5 积分每秒 | 1.5 / 2 / 2.5 积分每秒 | 固定 25 积分每秒 |
| 适合场景 | 便宜,可驱动已有视频 | 高清晰度 + 动作控制 | 口型稳定、成功率高 |
数字人基础版:POST /api/v2/avatar/digital-human
| 字段 | 类型 | 必填 | 说明 |
|---|---|---|---|
image_url | string | ⬜* | 人像照片 URL(image_url 与 input_video_url 至少给一个) |
input_video_url | string | ⬜* | 输入视频 URL(驱动已有视频) |
audio_url | string | ✅ | 说话音频 URL(时长由服务端实测,用于计费,无需传参) |
aspect_ratio | string | ⬜ | 视频宽高比:9:16(竖屏,默认)/ 16:9(横屏)/ original(跟随原图尺寸) |
quality | string | ⬜ | 清晰度:standard(标准,速度快,默认)/ hd(高清 960P,出片稍慢) |
计费(视频积分)
cost = 向上取整(实测秒数) × 倍率——提交时服务端从audio_url实测音频时长;倍率 = 标准清晰度1、高清1.5(即标准 1 积分/秒、高清 1.5 积分/秒)。 音频超过 300 秒会被拒绝(audio_too_long);无法读取时长时提交返回audio_probe_failed(请确认 URL 可公开访问)。 提交时不足直接402;失败自动退款。
算例
- 标准 9:16 竖屏(360×704)、12 秒 =
12 × 1= 12 积分 - 高清 16:9 横屏(960×544)、12 秒 =
12 × 1.5= 18 积分
curl -X POST https://api.aiclonevoicefree.com/api/v2/avatar/digital-human \
-H "Authorization: Bearer sk_your_api_key" \
-H "Content-Type: application/json" \
-d '{
"image_url": "https://your-cdn.com/portrait.png",
"audio_url": "https://your-cdn.com/speech.mp3",
"aspect_ratio": "9:16",
"quality": "hd"
}'响应 202
{
"task_id": "b1d2...-uuid",
"status": "pending",
"capability": "avatar",
"action": "digital-human",
"model": "digital-human"
}数字人高阶版:POST /api/v2/avatar/generate
把一张人像照片 + 一段音频合成为口型同步的说话视频,支持动作提示词、最高 1536px、最长 35 秒。
| 字段 | 类型 | 必填 | 说明 |
|---|---|---|---|
image_url | string | ✅ | 人像照片 URL |
audio_url | string | ✅ | 说话音频 URL |
duration | int | ⬜ | 5/10/15/20/25/30/35,或 0=跟随完整音频(时长由服务端实测);默认 10 |
resolution | int | ⬜ | 清晰度档位 720 / 1280 / 1536(数字越大越清晰);默认 1280 |
framerate | int | ⬜ | 24 / 25 / 30;默认 25 |
motion_prompt | string | ⬜ | 动作/表情描述,≤ 2000 字符;留空时用默认"自然说话"提示词 |
engine | string | ⬜ | 传 "minimax"(忽略大小写)使用 MiniMax H3 引擎;其他值/缺省为默认 LTX 引擎 |
计费(视频积分,按秒)
| 清晰度档位 | 每秒费率 |
|---|---|
720 | 1.5 |
1280 | 2 |
1536 | 2.5 |
cost = 向上取整(每秒费率 × 计费秒数)。duration > 0时计费秒数=duration;duration=0时取服务端实测的音频时长(封顶 35 秒)。提交时视频积分不足直接402;任务失败自动退款。
算例
- 1280px、10 秒 =
2 × 10= 20 积分 - 1536px、20 秒 =
2.5 × 20= 50 积分
curl -X POST https://api.aiclonevoicefree.com/api/v2/avatar/generate \
-H "Authorization: Bearer sk_your_api_key" \
-H "Content-Type: application/json" \
-d '{
"image_url": "https://your-cdn.com/portrait.png",
"audio_url": "https://your-cdn.com/speech.mp3",
"duration": 10,
"resolution": 1280,
"framerate": 25,
"motion_prompt": "自然地看向镜头说话,带轻微的表情和头部动作"
}'响应 202
{
"task_id": "1939...",
"status": "pending",
"capability": "avatar",
"action": "generate",
"model": "avatar-pro"
}MiniMax 版(engine: "minimax")
在同一接口上传 engine: "minimax" 即可使用 MiniMax H3 引擎——口型稳定、成功率高。与默认 LTX 引擎的差异:
- 音频上限:最长 60 秒,由服务端实测(超出返回
audio_too_long错误) duration:不适用5/10/.../35白名单;默认0(跟随整段音频),任意正整数按值计费- 计费:固定 25 积分/秒,与
resolution无关——cost = 向上取整(25 × 计费秒数),计费秒数封顶 60 resolution仍影响输出尺寸但不影响价格;framerate不生效;motion_prompt正常使用- 响应结构与轮询方式与默认引擎完全一致
curl -X POST https://api.aiclonevoicefree.com/api/v2/avatar/generate \
-H "Authorization: Bearer sk_your_api_key" \
-H "Content-Type: application/json" \
-d '{
"image_url": "https://your-cdn.com/portrait.png",
"audio_url": "https://your-cdn.com/speech.mp3",
"resolution": 720,
"engine": "minimax",
"motion_prompt": "自然地看向镜头说话"
}'取结果
两个接口共用一个轮询路由:GET /api/v2/avatar/tasks/{task_id},完成时 videoUrl 为成片地址:
{
"status": "completed",
"capability": "avatar",
"model": "avatar-pro",
"progress": 1.0,
"videoUrl": "https://.../result.mp4"
}高阶版与 MiniMax 生成通常需要数分钟。另见 双人数字人。