正在检测创作引擎
JUNZI XIAOYA · DIGITAL HUMAN 3.0

模块

这个模块已进入产品规划,当前版本先专注打磨数字人口播的核心创作链路。

MY WORKS

我的作品

查看、重试你的数字人与语音创作。

MY PORTRAITS

我的形象

保存上传的形象照片,点击即可在创作台复用。

MY VOICES

我的声音

保存上传的克隆样本(参考音频),点击即可在创作台复用。

DIGITAL HUMAN 3.0

让表达,自然发生

一张照片,一段声音,生成语音与动作同步的高品质数字人口播。

数字人创作引擎
01

输入文案

用已克隆的声音生成自然口播音频

0 / 2000
0 / 500
声音库加载中…
上传克隆样本(参考音频)清晰人声 5–15 秒,MP3 / WAV,用于克隆音色
02

设置声音

调整情绪强度,塑造口播语气

厌恶
低落
惊喜
平静

每个数字代表对应情绪的强度,最高为【1】。

应用介绍 & 输入建议

顺序为【喜】【怒】【哀】【惧】【厌恶】【低落】【惊喜】【平静】,默认 [0, 0, 0, 0, 0, 0, 0, 0]。

数值越大,该情绪在合成语调中的权重越高;全部为 0 时按工作流默认情绪生成。

抖动强度
缩放大小

推荐使用:强度 0.3、缩放 1.05。

应用介绍 & 输入建议

本工作流在 1280 分辨率下,运行时长基本等于音频时长,所以最好不要超过 50s,时间过长容易超过平台 60 分钟的生成限制导致报错。1280 需开启 Plus 大显存模式,否则易 OOM 失败。

0310-更新自定义镜头抖动(默认不使用,若要使用,推荐数值为“强度0.3”、“缩放1.05”)。

本次创作预计 8 积分音频克隆 · 预计1–3分钟

最近创作

每一次表达,都在积累你的数字资产

加载中…