不拍视频做口播:数字人怎么选、怎么调、怎么建(附实测对比)

作者开源 SeeCut 后,被问得最多的不是剪辑而是数字人。他实测了 14 个数字人方案,把其中 8 个放进同一个八宫格、用同一段 18 秒配音对比,认为同价位里 HeyGen Avatar 5(AV5)最好,并列出其它方案在价格或口型上的问题。文中还给出让数字人更自然的 4 个细节(参考图要好看、口型不快不慢、肢体要动、提示词救不了模型),以及不订阅 HeyGen 就建 AV5 形象的四个步骤和 4 个坑:需先删干净旧形象且一个月只能建一个、手和麦克风别挡嘴、调用时须写明 avatar_v 引擎、竖屏与余额两个出片阶段才会发现的问题。最后提到可把这些经验更新进 SeeCut 仓库。

最近开源了 AI网感剪辑仓库 SeeCut,相关帖子和文章给我涨了700粉。

然而,评论区问得最多的,不是剪辑,是数字人。

我这周把市面上能找到的数字人方案试了一圈:海外的、国内的、对口型的、照片驱动的,甚至让 Opus 5.5 写代码自己画了一个。

一共 14 个。6 个一眼淘汰,剩下 8 个放进了同一个八宫格,用同一段配音对比:

Leaf Yeah!@leaf_sanren
X 引用
原文嵌入的 X 内容

原文嵌入的 X 内容

啊啊啊啊😮😮!我把市面上的数字人方案都试了一遍! 结论伤人!!😭😭 我之前开源仓库里建议用 HeyGen AV5,但确实不便宜(每分钟约 7.2 刀)。 so我把市面上的方案挨个测了一遍!!(视频是其中 8 个) 统一条件:heygen之外的数字人,同一张脸、同一段配音,就看肢体/五官自然度和口型匹配等。 结论很扎心: ✅ 能过线的,只有 HeyGen AV5 🟡 Seedan…

去 X 看原文 →

结论先放这:同价位里,HeyGen Avatar 5 是最好的(后面简称AV5)

我真不是给 HeyGen 打广告,但目前确实没找到比它更好的。

小目录

  1. 8 个方案横评:贵的不一定好,便宜的基本不能用
  2. 灵动数字人生成的 4 个细节
  3. 不花钱订阅,用上 AV5,但有 4 个坑

1. 8 个方案横评:贵的不一定好,便宜的基本不能用

8 个数字人方案用同一段配音生成的八宫格对比画面

先说怎么测的:同一段 18 秒的配音(豆包刘飞),同一个人的照片和视频,我一个个看、一个个听。

结论就三句话:

  • AV5:唯一过线。 嘴型和声音刚好对到「看着自然」的底线,身体会跟着晃。每分钟约 7.2 美元,在这一档里性价比最高。
  • AV4:能用,但只能当小窗。 一张照片就能驱动,每分钟约 2.3 美元,便宜。放在画面角落当小头像完全够用;一放大,脸上的细节就撑不住了。(八宫格里 AV4 那格是 8 月做的旧样片,文案不一样,所以静音了。)
  • 其它:要么太贵,要么口型不过关。
  • SD2.5 / SD2.0:效果还行,但每分钟 16 到 18 美元,是 AV5 的两倍多。
  • 蝉镜:很便宜,每分钟不到 5 块钱,肢体也自然,可口型还是对不上。
  • Sync-2 Pro 这类「对口型」工具:嘴永远慢半拍。我把声音往后挪了 0 到 360 毫秒四档去对,都对不齐,是模型本身的问题。
  • AV3:只有嘴在动,头和身子都不动,还带水印。
  • 代码数字人:Opus 5.5 写代码画的,嘴型、点头、晃动都有,但一看就是动画。挺搞笑的,算一种风格,不算真人。

另外 6 个(可灵、阿里 EMO、飞影、LatentSync 等),第一轮就淘汰了。

2. 好看比像你更重要:让数字人「活」起来的 4 个细节

① 参考图别追求像,要追求好看

这是我踩坑踩出来最反直觉的一条!!!

用照片做数字人,一定会有一层折损:照片越逼真、越像你,动起来反而越容易走形,五官会慢慢往一张「通用脸」上漂。

所以别追求像。像不像不重要,好看才重要。

参考图挑这样的:写实、少美颜、正脸、光线均匀、画质清晰。好看的底子留足了余量,折损完还能看。

参考图挑选示例:写实、少美颜、正脸、光线均匀

② 口型:不能慢,也不能快

一个数字人假不假,观众第一眼看的就是嘴。

嘴慢半拍、快半拍,哪怕只差一点点,人一眼就觉得不对劲,只是说不出哪里不对。

这也是为什么上面那一堆「对口型」工具全军覆没。

③ 肢体:光嘴动,就是假人

口型对上了还不够。

真人说话,头会点、肩会晃、手会比划。只有嘴在动、脖子以下一动不动,就是 AV3 那种「会说话的照片」。

还有一个细节:照片里要有手。 照片里没手,模型就不知道手在哪,上半身怎么都动不起来。

照片里带手部的参考图示例,模型才能生成上半身动作

④ 提示词救不了模型

AV4 可以写动作提示词,比如「双手比划、上半身自然晃动」。我试过写到最猛,还是偏僵。

一张照片能给模型的信息就那么多,提示词写出花也没用。

AV5 不一样,它是从你的真人视频里学动作的。这就是它贵、也是它好的地方。

3. 手把手建一个 AV5:不用订阅,但有 4 个坑

整个流程分两段:网页上建形象(只能你自己来),再让 AI 调接口出片。调接口的脚本放在 SeeCut 仓库的 digital-human/ 里了。

第 1 步:官网建数字分身,不用订阅

去 HeyGen 官网:Avatars → Clone a Real Person。

不需要每月 29 美元的会员,免费账号就能建一个 AV5 形象。

⚠️ 坑一:得先把账号里之前建的形象全部删干净,才能免费建;而且一个月只能建一个,别反复删了重建。

HeyGen 账号中已建数字分身列表,需要先删干净

第 2 步:上传真人视频 + 现场录授权

这一步 AI 替不了你。

上传一段你自己的说话视频。我用的是 45 秒、竖版、正对镜头连续说话、光线均匀的一段。

【必须】再用电脑摄像头现场录一段授权(Chrome授权现录即可),证明是你本人同意用你自己的这张脸。

⚠️ 坑二:手和麦克风别挡嘴。 我第一版训练视频拿着手持麦,麦在下巴边上,生成出来嘴那块直接穿帮。

第 3 步:拿到 Look ID,交给 AI

训练完成后,你会得到一个形象(Look)。把它的 ID 给你的 agent,让它去调接口。

HeyGen 训练完成后显示的形象(Look)页面
HeyGen 中形象(Look)的 ID 标识位置

配音我不用 HeyGen 自带的音色,偏假。

我用豆包语音合成好配音,再上传给 HeyGen 驱动嘴型。

第 4 步:调用时锁死 AV5

⚠️ 坑三:调用时一定要写明用 AV5 引擎(avatar_v)。不写,它会默认给你走 AV4,花了建 AV5 的功夫,出来的却是 AV4 的效果。

⚠️ 坑四:两个出片时才会发现的坑。

竖屏:接口目前不接受竖屏参数,默认出横屏 1280×720,你的竖版人像缩在中间,两边是灰边。要本地裁回竖屏(仓库脚本已经自动处理)。

余额:钱包余额不够,HeyGen 不会拒单,照样收任务、照样扣钱,而且任务取消不了。我因此白花了约 2 美元。提交前先查余额,一次只交一个任务。

价格参考:API 走按量钱包,一条 18 秒的 AV5 大约 2 美元。

HeyGen 按量钱包余额页面,提交任务前需先查看

数字人的问题,说到底就三件事:选对模型,喂好看的图,让它动起来。

试了一圈,贵的不一定好,便宜的基本不能用,最后还是回到了 AV5。

数字人出好了,下一步就是扔进 SeeCut 做网感精剪。

后面我看,要不把这些经验,都打包更新进仓库里!

觉得有用,给个 star。github.com/YeJe-cpu/SeeCut

欢迎issues和PR!我希望这是一个可以长期迭代的项目!

下一篇

如果大家感兴趣,我可以细讲讲,

怎么把 AI 剪好的片子推进剪映里微调

(可以评论区告诉我,不确定是否是大家关心的部分)

(可以评论区告诉我,不确定是否是大家关心的部分)

本文提及与引用

原文提到的内容里,已在本站整理好的可以直接接着读;标注「原文来源」的还没有整理成站内文章。

内容核验说明

作者自述试了 14 个数字人方案,把「同价位里 AV5 最稳」的取舍、建形象的四个坑和调用细节写清楚了。横评结论会过时,但删干净旧形象、麦别挡嘴、调用要锁 avatar_v 引擎、余额不足仍会扣钱这类踩坑记录更耐用。适合做口播、想低成本上数字人的人先看一遍再动手。价格与效果对比均为作者自述,按个人偏好对待。

文中的数据来自原作者公开披露,诀.com 未独立验证。八宫格对比、价格、口型与肢体效果均为作者个人自述与观看判断,未见可复核的原始素材或测试方法,经验型结论不保证在他人素材和账号上复现。

原始来源

原作者:Leaf Yeah!(@leaf_sanren)

本文对公开来源内容进行了结构化整理,原观点与内容归原作者所有。

查看原文