不拍视频做口播:数字人怎么选、怎么调、怎么建(附实测对比)
作者开源 SeeCut 后,被问得最多的不是剪辑而是数字人。他实测了 14 个数字人方案,把其中 8 个放进同一个八宫格、用同一段 18 秒配音对比,认为同价位里 HeyGen Avatar 5(AV5)最好,并列出其它方案在价格或口型上的问题。文中还给出让数字人更自然的 4 个细节(参考图要好看、口型不快不慢、肢体要动、提示词救不了模型),以及不订阅 HeyGen 就建 AV5 形象的四个步骤和 4 个坑:需先删干净旧形象且一个月只能建一个、手和麦克风别挡嘴、调用时须写明 avatar_v 引擎、竖屏与余额两个出片阶段才会发现的问题。最后提到可把这些经验更新进 SeeCut 仓库。
最近开源了 AI网感剪辑仓库 SeeCut,相关帖子和文章给我涨了700粉。
然而,评论区问得最多的,不是剪辑,是数字人。
我这周把市面上能找到的数字人方案试了一圈:海外的、国内的、对口型的、照片驱动的,甚至让 Opus 5.5 写代码自己画了一个。
一共 14 个。6 个一眼淘汰,剩下 8 个放进了同一个八宫格,用同一段配音对比:
结论先放这:同价位里,HeyGen Avatar 5 是最好的(后面简称AV5)
我真不是给 HeyGen 打广告,但目前确实没找到比它更好的。
小目录
- 8 个方案横评:贵的不一定好,便宜的基本不能用
- 灵动数字人生成的 4 个细节
- 不花钱订阅,用上 AV5,但有 4 个坑
1. 8 个方案横评:贵的不一定好,便宜的基本不能用

先说怎么测的:同一段 18 秒的配音(豆包刘飞),同一个人的照片和视频,我一个个看、一个个听。
结论就三句话:
- AV5:唯一过线。 嘴型和声音刚好对到「看着自然」的底线,身体会跟着晃。每分钟约 7.2 美元,在这一档里性价比最高。
- AV4:能用,但只能当小窗。 一张照片就能驱动,每分钟约 2.3 美元,便宜。放在画面角落当小头像完全够用;一放大,脸上的细节就撑不住了。(八宫格里 AV4 那格是 8 月做的旧样片,文案不一样,所以静音了。)
- 其它:要么太贵,要么口型不过关。
- SD2.5 / SD2.0:效果还行,但每分钟 16 到 18 美元,是 AV5 的两倍多。
- 蝉镜:很便宜,每分钟不到 5 块钱,肢体也自然,可口型还是对不上。
- Sync-2 Pro 这类「对口型」工具:嘴永远慢半拍。我把声音往后挪了 0 到 360 毫秒四档去对,都对不齐,是模型本身的问题。
- AV3:只有嘴在动,头和身子都不动,还带水印。
- 代码数字人:Opus 5.5 写代码画的,嘴型、点头、晃动都有,但一看就是动画。挺搞笑的,算一种风格,不算真人。
另外 6 个(可灵、阿里 EMO、飞影、LatentSync 等),第一轮就淘汰了。
2. 好看比像你更重要:让数字人「活」起来的 4 个细节
① 参考图别追求像,要追求好看
这是我踩坑踩出来最反直觉的一条!!!
用照片做数字人,一定会有一层折损:照片越逼真、越像你,动起来反而越容易走形,五官会慢慢往一张「通用脸」上漂。
所以别追求像。像不像不重要,好看才重要。
参考图挑这样的:写实、少美颜、正脸、光线均匀、画质清晰。好看的底子留足了余量,折损完还能看。

② 口型:不能慢,也不能快
一个数字人假不假,观众第一眼看的就是嘴。
嘴慢半拍、快半拍,哪怕只差一点点,人一眼就觉得不对劲,只是说不出哪里不对。
这也是为什么上面那一堆「对口型」工具全军覆没。
③ 肢体:光嘴动,就是假人
口型对上了还不够。
真人说话,头会点、肩会晃、手会比划。只有嘴在动、脖子以下一动不动,就是 AV3 那种「会说话的照片」。
还有一个细节:照片里要有手。 照片里没手,模型就不知道手在哪,上半身怎么都动不起来。

④ 提示词救不了模型
AV4 可以写动作提示词,比如「双手比划、上半身自然晃动」。我试过写到最猛,还是偏僵。
一张照片能给模型的信息就那么多,提示词写出花也没用。
AV5 不一样,它是从你的真人视频里学动作的。这就是它贵、也是它好的地方。
3. 手把手建一个 AV5:不用订阅,但有 4 个坑
整个流程分两段:网页上建形象(只能你自己来),再让 AI 调接口出片。调接口的脚本放在 SeeCut 仓库的 digital-human/ 里了。
第 1 步:官网建数字分身,不用订阅
去 HeyGen 官网:Avatars → Clone a Real Person。
不需要每月 29 美元的会员,免费账号就能建一个 AV5 形象。
⚠️ 坑一:得先把账号里之前建的形象全部删干净,才能免费建;而且一个月只能建一个,别反复删了重建。

第 2 步:上传真人视频 + 现场录授权
这一步 AI 替不了你。
上传一段你自己的说话视频。我用的是 45 秒、竖版、正对镜头连续说话、光线均匀的一段。
【必须】再用电脑摄像头现场录一段授权(Chrome授权现录即可),证明是你本人同意用你自己的这张脸。
⚠️ 坑二:手和麦克风别挡嘴。 我第一版训练视频拿着手持麦,麦在下巴边上,生成出来嘴那块直接穿帮。
第 3 步:拿到 Look ID,交给 AI
训练完成后,你会得到一个形象(Look)。把它的 ID 给你的 agent,让它去调接口。


配音我不用 HeyGen 自带的音色,偏假。
我用豆包语音合成好配音,再上传给 HeyGen 驱动嘴型。
第 4 步:调用时锁死 AV5
⚠️ 坑三:调用时一定要写明用 AV5 引擎(avatar_v)。不写,它会默认给你走 AV4,花了建 AV5 的功夫,出来的却是 AV4 的效果。
⚠️ 坑四:两个出片时才会发现的坑。
竖屏:接口目前不接受竖屏参数,默认出横屏 1280×720,你的竖版人像缩在中间,两边是灰边。要本地裁回竖屏(仓库脚本已经自动处理)。
余额:钱包余额不够,HeyGen 不会拒单,照样收任务、照样扣钱,而且任务取消不了。我因此白花了约 2 美元。提交前先查余额,一次只交一个任务。
价格参考:API 走按量钱包,一条 18 秒的 AV5 大约 2 美元。

数字人的问题,说到底就三件事:选对模型,喂好看的图,让它动起来。
试了一圈,贵的不一定好,便宜的基本不能用,最后还是回到了 AV5。
数字人出好了,下一步就是扔进 SeeCut 做网感精剪。
后面我看,要不把这些经验,都打包更新进仓库里!
觉得有用,给个 star。github.com/YeJe-cpu/SeeCut
欢迎issues和PR!我希望这是一个可以长期迭代的项目!
下一篇
如果大家感兴趣,我可以细讲讲,
怎么把 AI 剪好的片子推进剪映里微调
(可以评论区告诉我,不确定是否是大家关心的部分)

本文提及与引用
原文提到的内容里,已在本站整理好的可以直接接着读;标注「原文来源」的还没有整理成站内文章。
- https://x.com/i/status/2104881373475696966原文来源 · 尚未整理成站内文章
内容核验说明
作者自述试了 14 个数字人方案,把「同价位里 AV5 最稳」的取舍、建形象的四个坑和调用细节写清楚了。横评结论会过时,但删干净旧形象、麦别挡嘴、调用要锁 avatar_v 引擎、余额不足仍会扣钱这类踩坑记录更耐用。适合做口播、想低成本上数字人的人先看一遍再动手。价格与效果对比均为作者自述,按个人偏好对待。
文中的数据来自原作者公开披露,诀.com 未独立验证。八宫格对比、价格、口型与肢体效果均为作者个人自述与观看判断,未见可复核的原始素材或测试方法,经验型结论不保证在他人素材和账号上复现。评论区整合
根据评论整合来看,回复大多认可这次横评省事,有人说不用再自己研究了,也有人感慨便宜方案确实没好货、成本高到用不起。一条回复补充了落地经验:本地跑智能体时可用 Python 直接改写剪映的 draft_content.json 草稿工程,省掉导出再对轴,该回复还认同「参考图要好看、照片里要有手」这两点。另有回复认为 AV4 的性价比更高,与作者选 AV5 的结论不同。
基于原帖公开评论整理,只反映讨论中的观点与反馈,不代表诀.com 立场。原始来源
原作者:Leaf Yeah!(@leaf_sanren)
本文对公开来源内容进行了结构化整理,原观点与内容归原作者所有。
查看原文