正在检测创作引擎
JUNZI XIAOYA · DIGITAL HUMAN 3.0

模块

这个模块已进入产品规划,当前版本先专注打磨数字人口播的核心创作链路。

MY WORKS

我的作品

查看、重试你的数字人与语音创作。

MY PORTRAITS

我的形象

保存上传的形象照片,点击即可在创作台复用。

MY VOICES

我的声音

保存上传的克隆样本(参考音频),点击即可在创作台复用。

DIGITAL HUMAN 3.0

让表达,自然发生

一张照片,一段声音,生成语音与动作同步的高品质数字人口播。

数字人创作引擎
01

输入文案

用已克隆的声音生成自然口播音频

上传形象照片支持 JPG、PNG、WEBP,建议半身正面照
上传驱动音频支持 MP3、WAV、FLAC,单文件不超过 30MB
0 / 2000
0 / 500
声音库加载中…
上传克隆样本(参考音频)清晰人声 5–15 秒,MP3 / WAV,用于克隆音色
02

设置声音

调整情绪强度,塑造口播语气

厌恶
低落
惊喜
平静

每个数字代表对应情绪的强度,最高为【1】。

应用介绍 & 输入建议

顺序为【喜】【怒】【哀】【惧】【厌恶】【低落】【惊喜】【平静】,默认 [0, 0, 0, 0, 0, 0, 0, 0]。

数值越大,该情绪在合成语调中的权重越高;全部为 0 时按工作流默认情绪生成。

抖动强度
缩放大小

推荐使用:强度 0.3、缩放 1.05。

应用介绍 & 输入建议

本工作流在 1280 分辨率下,运行时长基本等于音频时长,所以最好不要超过 50s,时间过长容易超过平台 60 分钟的生成限制导致报错。1280 需开启 Plus 大显存模式,否则易 OOM 失败。

0310-更新自定义镜头抖动(默认不使用,若要使用,推荐数值为“强度0.3”、“缩放1.05”)。

本次创作预计 8 积分音频克隆 · 预计1–3分钟

最近创作

每一次表达,都在积累你的数字资产

加载中…