使用准备

开始前:准备数字人素材与权限

准备不超过 200MB 的合规克隆视频、口播文本、可用声音、背景素材、组织权限和任务权益。

9 分钟更新于 2026年8月19日核验于 2026年8月19日
本页目录

准备阶段最重要的是确认当前组织、合法使用权和素材质量。建议先用短素材完成一条测试任务,再制作正式长视频。

先确认组织和权限

数字人、克隆任务、视频、私有文件和计费都归属于提交时的组织。开始前请确认页面顶部组织正确,并检查是否具备:

  • 浏览数字人和任务的权限。
  • 创建克隆或视频任务的权限。
  • 浏览文件中心已有私有文件,以及上传口播音频或背景素材所需的文件权限。
  • 维护业务分类、编辑或删除私有人物所需的管理权限。
  • 下载结果文件所需的文件读取权限。

克隆本地视频使用一次性直传,只要求当前成员具备克隆权限,不要求先把视频保存到文件中心;选择文件中心已有视频仍需要文件读取权限。口播音频和背景素材继续按页面提示检查文件读取或上传权限。

克隆人物需要什么视频

成员端使用克隆视频创建人物形象,不使用单张图片。建议选择:

  • 人物主体完整、正面或接近正面、无遮挡的视频。
  • 光线均匀、画面稳定、没有强滤镜和频繁切镜的视频。
  • 只有目标人物,避免其他人进入画面或遮挡面部与身体。
  • 使用 MP4、MOV 或 WebM,单个文件不超过 200MB,并符合页面当前时长和素材要求。
  • 计划创建 4K 人物时使用真实 4K 素材;普通素材可以完成定制,但不会因此变成 4K 人物。

当前成员端固定只克隆人物形象,视频可以没有声音。克隆成功后,制作视频时再选择人物内置声音、声音模型或上传音频。

本地视频选择后会创建短时直传会话,并显示上传、合并和就绪进度。只有显示上传完成且可用时才能提交克隆;会话同时绑定当前组织和上传成员,一次成功创建克隆任务后即被消费。上传失败可按页面重试,校验失败、会话过期或创建另一项克隆任务时需要重新选择或上传文件。

口播文本怎样准备

  • 删除网址、脚注、表格编号、无意义符号和不需要朗读的提示语。
  • 把数字、日期、金额、英文缩写、品牌词和人名改写成希望朗读的形式。
  • 使用自然标点控制停顿,避免连续堆叠符号。
  • 首次测试只写一小段,确认读音、口型和字幕后再处理长内容。
  • 单次文本长度以创建页实时限制为准,不要把内部资料、密钥或不应公开的个人信息写入口播。

三类声音怎样准备

  • 人物内置声音:仅在所选人物形态提供并且当前可用时出现,适合快速测试。
  • 声音模型:从当前组织可用的公共或私有声音中选择,根据文本生成本次驱动音频;不同声音支持的语速、音量和音调范围可能不同。
  • 上传音频:使用当前组织安全可用的 MP3 或 WAV 直接驱动口型;提前完整试听,确认内容、时长和授权。

使用声音模型并开启字幕时,智笔生花会尽量生成时间轴;无法取得可用时间轴时,音频仍可继续并使用默认字幕识别。正式发布前仍需检查字幕断句、专有词和时间同步。

选择声音模型时,除数字人视频预授权秒数外,还会按本次口播文本产生声音字符计量;人物内置声音和上传音频不会伪造这项字符用量。后台在创建任务时分别校验并预占,任一额度或余额不足都会让本次创建整体回滚;创建成功后请到费用中心核对计量与流水。

背景、标题与字幕素材

  • 普通背景可以使用纯色,或当前组织可用的 JPG、PNG、MP4 素材。
  • 背景素材应与目标画布比例接近,避免人物被裁切或画面被过度拉伸。
  • 透明 WebM 不带普通背景、标题和字幕,适合在剪辑软件中后期叠加。
  • 视频标题最多 32 个 Unicode 字符,建议提前准备一条简短标题。
  • 标题和字幕都要避免贴近画面边缘,并为移动端平台保留安全区域。

提交前检查清单

  1. 当前组织和业务分类正确。
  2. 人物、声音、文案和背景素材均已取得覆盖实际用途的许可。
  3. 克隆视频已完成直传并处于可用状态,背景文件也已上传完成。
  4. 4K、背景移除和透明输出能力与所选人物形态匹配。
  5. 口播文本、品牌词、数字和标题已经校对。
  6. 标题和字幕位置不冲突,透明模式下没有依赖标题或字幕。
  7. 当前组织具有足够的克隆次数、视频秒数、声音字符额度或智贝。
操作结果与文档不一致?

先确认当前组织、任务状态和页面提示,再搜索对应错误现象。

继续排查