全网首发!AI动画制作全流程分享!

作者以一条 15 秒鸵鸟动画为例,分享从故事节奏、角色设定表、场景设定表、空间与尺度、道具状态、时间戳、镜头与 FOV、表演情绪到最终视频 Prompt 的制作流程,并列出 10 个检查项,说明如何让多段 AI 生成内容在成片里保持连续。

我原本以为,AI 漫剧做到后面拼的是提示词

做完这条视频之后,我发现不是。

角色长什么样、山有多高、镜头从哪边拍、什么时候切镜、角色掉下去时有没有重量、13.6 秒为什么撞上那块石头……这些东西全部要在生成之前想清楚。

一条看起来很简单的动画,背后其实是一套小型制作流程。

这条视频的故事也不复杂:一只鸵鸟拿棕榈叶当翅膀,连续三次从山上起飞。

第一次直接掉下去。

第二次飞起来一点,又掉了。

第三次终于飞起来,甚至开心地喊出一句 “I can fly!”

然后撞墙。

真正难的地方,不是让它“飞”,而是怎么让这 15 秒从头到尾像同一部动画,而不是三段 AI 视频硬拼在一起。

01|先把故事节奏定下来

很多人做 AI 视频时,会从一句剧情描述开始:

一只鸵鸟绑着棕榈叶尝试飞行,搞笑动画风格。

这句话能告诉模型发生什么,但它解决不了节奏。

我给这条片子定的结构很简单:

第一次失败 → 第二次升级 → 第三次成功 → 马上反转。

15 秒也按这个逻辑切开。

0–4 秒,第一次失败。

4–8.5 秒,第二次起飞,比前一次更接近成功。

8.5–15 秒,第三次起飞,这次真的飞起来,然后在观众开始替它高兴的时候撞上岩柱。

这里我想要的不是三个“起飞镜头”,而是三个层级。

第一次让观众知道规则:它不会飞。

第二次让观众觉得:好像有点希望。

第三次让观众相信:这次可能成了。

所以后面的撞墙才有用。

如果前三段情绪是平的,最后撞得再狠,也只是一个动作。

02|角色要先做成“演员”

故事定完之后,我没有急着做视频,而是先把 Ollie 的角色设定做完整。

因为角色一致性这件事,靠一句“保持角色一致”基本不够。

Ollie 鸵鸟角色设定表,含转面、表情、动作与配色

我会把正面、侧面、背面、表情、动作、配色、眼睛、喙、脚、羽毛和身高比例全放进一张设定表。

这样做的目的很实际:后面它要跑、跳、回头、坠落、仰头,模型至少知道这个角色从不同角度看是什么样。

提示词:

白色背景上一张干净的 Pixar 风格角色参考表。角色:Ollie,一只年轻的鸵鸟,亢奋、滑稽、过度自信、惹人喜欢。转面图一行:正面、四分之三正面、侧面、四分之三背面、背面。头部表情一行:平静、开心、惊讶、困惑、怀疑、困倦、震惊。动作姿势:奔跑、跳跃、落地、回头、好奇、得意。配色色块:深浅羽毛、鲑鱼粉喙和腿、橄榄色虹膜。细节特写:眼睛、喙、羽毛、脚。与 180cm 人类的身高对比,Ollie 约 120cm。大眼睛、表情丰富,奶油色加棕色羽毛。影棚白背景,柔和均匀打光,杂志式角色设定表排版,无水印。

这里最容易偷懒的是,只生成一张好看的正面图。

但视频不是海报。

角色一转身、一跑动、一掉下悬崖,模型马上要处理侧脸、背部、腿长、翅膀比例。如果前面没定义,它只能自己补。

于是你就会看到一个角色,跑了 5 秒之后像换了物种。

03|场景也需要“身份证”

角色统一了,场景还有可能崩。

第一段是一座窄山脊,第二段可能变成宽平台,第三段连悬崖方向都换了。

所以我给 Skyfall Ridge 也做了一张设定表。

Skyfall Ridge 场景设定表,标出三个起跳高度与岩柱

这张图里必须能看见三个起跳高度:低处石台、中段岩突、高处峰尖,还要有最终撞上的岩柱、树冠和整体光线。

提示词:

一张干净的动画场景设定表,米白色背景,带标签的分格。场景:Skyfall Ridge,一座高耸的三层山峰,有一条狭窄的土质助跑道向上延伸,四周全是直坠下方深处丛林树冠的悬崖。分格:01 全景建立镜头,展示三个起跳高度;02 低处岩台;03 中段岩突;04 高处峰尖;05 不同角度;06 关键道具,包括平面岩柱和棕榈叶;07 灯光参考,明亮正午。配色条,天空和树冠参考缩略图。Pixar 风格 3D 动画环境美术,柔和全局光照,杂志式版面,无水印。

我后来发现,这三个高度本身也在帮故事工作。

第一跳低,第二跳高一些,第三跳从山顶冲出去。

失败越来越大,观众看到的空间尺度也越来越大。

如果三次起跳都发生在同一个小平台,剧情虽然没变,但“升级感”没了。

04|有设定图还不够,还得告诉 AI 空间怎么排

这一部分很容易被忽略。

场景图只能说明“这里有哪些东西”,但视频模型还需要知道这些东西怎么摆。

所以我在提示词里又加了一层场景地图。

前景是橙棕色的助跑道,中景是三个起跳点,背景是丛林、河带、薄雾、岩柱和天空。

更重要的是,我要求镜头从山脊外侧工作。

为什么?

因为这条片子的核心动作是“掉下去”。如果镜头一直站在山顶对着角色拍,它跳出去之后,下坠关系很可能看不清。你只会看到一只鸟飞出画面。

镜头放在山脊外侧,悬崖、角色和下方树冠能同时出现在画面里,观众不需要思考就知道它掉了几十米。这个区别很小,但成片观感差很多。

05|尺度不写,悬崖可能只剩一个土坡

我还给场景加了尺度。

Ollie 大约 120cm。

低处石台在树冠上方,高度大约是它身高的 4 倍;中段岩突大约是 30 倍;山顶高到下面的树只能看到一片绿色。

最终撞上的岩柱,大概是它身高的 6 倍。

这些数字不是为了显得专业。它们是在告诉模型:这个空间到底有多危险。

如果你只写“高耸悬崖”“巨大山谷”,模型有时会给你一个两三米高的小坡。

角色照样跳。剧情也没错,但紧张感没了。

06|棕榈叶不是装饰,它在帮观众记住时间

这条片子里还有一个我很喜欢的细节:两片棕榈叶。

第一次起飞时,它们是完整的。

第一次摔完,叶肋弯了,表面多了一道泥痕。

第二次坠落后,叶尖磨损,叶片开始撕裂。

最后撞墙时,一片破叶子挂在 Ollie 的喙上。

这个东西很小,但它把三次尝试串起来了。

如果每切一次镜头,叶子都恢复成新品,观众可能说不出哪里不对,但会感觉每一段像重新生成的,所以关键道具最好也有状态变化。

我现在会给它写成这种结构:

初始状态 → 第一次损伤 → 第二次损伤 → 最终状态。

角色一致性是在告诉观众“这是同一个角色”。

道具状态是在告诉观众“这些事真的连续发生过”。

07|写到这里,才轮到视频 Prompt

这一步也是整套流程里差距最大的一层。

普通人会写:

一只鸵鸟从悬崖跳下,尝试用棕榈叶飞行,搞笑动画。

我写的是:

  • 1.6 秒起跳。
  • 2.3 秒开始坠落。
  • 4.0 秒硬切。
  • 5.4 秒第二次起跳。
  • 6.8 秒失速。
  • 8.5 秒第二次硬切。
  • 10.2 秒第三次起跳。
  • 12.3 秒喊出 “I can fly!”
  • 13.6 秒发现岩柱。
  • 14.2 秒撞击。

一旦时间戳出现,AI 不只是知道“要发生什么”,还知道“什么时候发生”。

这也是长视频提示词里很关键的一层。

08|镜头不能只写“电影感”

“电影感”这种词我现在越来越少用了。

因为它不给模型明确动作。

这条片子我只用了三个主镜头,而且每一段镜头干什么都写得比较死。

第一段是低机位跟跑。Ollie 冲向低处石台,镜头和它一起向前,等它冲出悬崖之后,镜头也跟出去,再向下跟着坠落。

第二段镜头沿山脊上升。它从中段起跳之后,镜头在旁边陪它滑一小段,失速后继续跟进树冠。

第三段是最长的一段。镜头从峰顶跟出去,在它真正飞起来之后变成伴飞视角,12.3 秒靠近角色,让 “I can fly!” 这一句有一个情绪特写。然后 13.6 秒,岩柱进场。

如果这里没有前面的长滑翔,撞击也不会那么突然。

09|FOV 不是炫参数,是在控制距离

提示词里会出现 84°、63°、47°、29°、18° 这些 FOV。

看起来很技术,但逻辑很简单。

广角负责让你看清角色和空间关系。

中间焦段负责跟动作。

特写负责情绪和撞击。

所以第一段奔跑用广角,第三段飞行过程中慢慢收紧,角色喊 “I can fly!” 时再靠近,撞击那一下进入更紧的视角。

我想要的是观众的注意力跟着剧情一起缩小。

一开始看“它在哪里”,后来开始看“它怎么飞”,最后只看“它的脸和那块石头”。

10|动作写完,还得写“怎么演”

AI 视频经常有一种感觉:动作都做对了,但角色像个木偶。

因为你只写了“发生什么”,没有写情绪怎么变化。

比如第一次起跳之后,我没有只写“它很惊讶”。

我写的是:先保持自信,然后眉毛变化,眼睛睁大,喙松开。

低头看下面,意识到脚下什么都没有,然后掉下去,这个顺序很重要。

情绪不是一个标签,是一段变化。

第二次起飞也一样。先真的飞起来两米,然后眼睛睁大,嘴巴咧开,出现一点得意。下一秒升力消失,脸上的喜悦在几帧里崩成惊慌,这才有表演。

我现在会把一条 AI 漫剧拆成这 10 个检查项

这部分建议保存。

  • 故事有没有清晰的预期和反转
  • 15 秒内有没有明确节奏节点
  • 角色有没有完整设定表
  • 场景有没有统一空间关系
  • 高度、距离、人物比例有没有尺度
  • 关键道具有没有状态变化
  • 动作有没有对应时间戳
  • 镜头有没有明确运动和观看位置
  • 角色表演有没有情绪过程
  • 物理、声音、灯光有没有前后连续

少一两项,不一定会生成失败。

但问题会出现在成片里。角色换脸,就回去补角色锚点。空间乱掉,就改场景地图。悬崖像小土坡,就改尺度。角色像在飘,就补物理。镜头自己乱切,就把切点锁死。情绪没有起伏,就把“开心”“惊讶”这种词改成具体的表演过程。道具消失,则检查状态连续性,比起反复抽卡,我更愿意知道问题出在哪一层。

做完这条视频之后,我对 AI 漫剧的理解变了不少。

以前会觉得它是一条提示词的问题。

现在看,更像是一套制作管线:故事、角色、场景、空间、尺度、道具、分镜、表演、物理、声音、灯光,最后再交给模型执行

关于作者

三个三|AI 工具实测博主|AI 小白教程|2 个月靠 AI 赚了5位数 |全平台粉丝近 10 万粉 |@3three_AI

三个三|AI 工具实测博主|AI 小白教程|2 个月靠 AI 赚了5位数 |全平台粉丝近 1

内容核验说明

这篇的价值不在提示词本身,而在把一条 15 秒动画拆成故事节奏、角色设定表、场景地图、尺度、道具状态、时间戳、镜头与 FOV、表演这几层,末尾给出 10 项自检清单,成片出问题时能定位到哪一层,而不是反复抽卡。适合已会用 AI 视频工具、但成片总像几段拼接的人。文中尺度数值、时间戳与提示词来自作者公开披露,诀.com 未独立验证,换模型或平台后不保证复现。

文中的角色身高、场景高度倍数、FOV 数值、时间戳与各段提示词均来自原作者公开分享,诀.com 未独立验证;作者自述的收益与粉丝数据同样未经核实。成片效果依赖具体模型版本与工作流,他人照搬不保证复现。

原始来源

原作者:三个三(@3three_AI)

本文对公开来源内容进行了结构化整理,原观点与内容归原作者所有。

查看原文