准备阶段最重要的是确认当前组织、合法使用权和素材质量。建议先用短素材完成一条测试任务,再制作正式长视频。
先确认组织和权限
数字人、克隆任务、视频、私有文件和计费都归属于提交时的组织。开始前请确认页面顶部组织正确,并检查是否具备:
- 浏览数字人和任务的权限。
- 创建克隆或视频任务的权限。
- 浏览文件中心已有私有文件,以及上传口播音频或背景素材所需的文件权限。
- 维护业务分类、编辑或删除私有人物所需的管理权限。
- 下载结果文件所需的文件读取权限。
克隆本地视频使用一次性直传,只要求当前成员具备克隆权限,不要求先把视频保存到文件中心;选择文件中心已有视频仍需要文件读取权限。口播音频和背景素材继续按页面提示检查文件读取或上传权限。
克隆人物需要什么视频
成员端使用克隆视频创建人物形象,不使用单张图片。建议选择:
- 人物主体完整、正面或接近正面、无遮挡的视频。
- 光线均匀、画面稳定、没有强滤镜和频繁切镜的视频。
- 只有目标人物,避免其他人进入画面或遮挡面部与身体。
- 使用 MP4、MOV 或 WebM,单个文件不超过 200MB,并符合页面当前时长和素材要求。
- 计划创建 4K 人物时使用真实 4K 素材;普通素材可以完成定制,但不会因此变成 4K 人物。
当前成员端固定只克隆人物形象,视频可以没有声音。克隆成功后,制作视频时再选择人物内置声音、声音模型或上传音频。
本地视频选择后会创建短时直传会话,并显示上传、合并和就绪进度。只有显示上传完成且可用时才能提交克隆;会话同时绑定当前组织和上传成员,一次成功创建克隆任务后即被消费。上传失败可按页面重试,校验失败、会话过期或创建另一项克隆任务时需要重新选择或上传文件。
口播文本怎样准备
- 删除网址、脚注、表格编号、无意义符号和不需要朗读的提示语。
- 把数字、日期、金额、英文缩写、品牌词和人名改写成希望朗读的形式。
- 使用自然标点控制停顿,避免连续堆叠符号。
- 首次测试只写一小段,确认读音、口型和字幕后再处理长内容。
- 单次文本长度以创建页实时限制为准,不要把内部资料、密钥或不应公开的个人信息写入口播。
三类声音怎样准备
- 人物内置声音:仅在所选人物形态提供并且当前可用时出现,适合快速测试。
- 声音模型:从当前组织可用的公共或私有声音中选择,根据文本生成本次驱动音频;不同声音支持的语速、音量和音调范围可能不同。
- 上传音频:使用当前组织安全可用的 MP3 或 WAV 直接驱动口型;提前完整试听,确认内容、时长和授权。
使用声音模型并开启字幕时,智笔生花会尽量生成时间轴;无法取得可用时间轴时,音频仍可继续并使用默认字幕识别。正式发布前仍需检查字幕断句、专有词和时间同步。
选择声音模型时,除数字人视频预授权秒数外,还会按本次口播文本产生声音字符计量;人物内置声音和上传音频不会伪造这项字符用量。后台在创建任务时分别校验并预占,任一额度或余额不足都会让本次创建整体回滚;创建成功后请到费用中心核对计量与流水。
背景、标题与字幕素材
- 普通背景可以使用纯色,或当前组织可用的 JPG、PNG、MP4 素材。
- 背景素材应与目标画布比例接近,避免人物被裁切或画面被过度拉伸。
- 透明 WebM 不带普通背景、标题和字幕,适合在剪辑软件中后期叠加。
- 视频标题最多 32 个 Unicode 字符,建议提前准备一条简短标题。
- 标题和字幕都要避免贴近画面边缘,并为移动端平台保留安全区域。
提交前检查清单
- 当前组织和业务分类正确。
- 人物、声音、文案和背景素材均已取得覆盖实际用途的许可。
- 克隆视频已完成直传并处于可用状态,背景文件也已上传完成。
- 4K、背景移除和透明输出能力与所选人物形态匹配。
- 口播文本、品牌词、数字和标题已经校对。
- 标题和字幕位置不冲突,透明模式下没有依赖标题或字幕。
- 当前组织具有足够的克隆次数、视频秒数、声音字符额度或智贝。