全网首发!用 Codex 自动生成顶尖动效视频

文章记录作者用 Codex 自动生成高级动效视频的完整探索,强调不能只换 prompt,而要搭建包含导演层 Brief、分镜、主次景深、物理、光源、节拍音效、自检和参考库的制作链,并分享开源仓库 awesome-ai-motion 及在线画廊。

最近一直在研究 AI 自动做视频,恰好刷到一堆 Opus 5.5「神动效」

同样是opus5.5做的视频,有人出神作,有人出废片,差别不仅仅是模型的原因。

为了让codex也能做出高级动效视频,我跟Astar一直在探索,还烧掉两张重置卡——ChatGPT说大约价值5000刀的API成本,下面都是我的真实探索。

做一个好动效的问题不在「换个更玄学的 Prompt」,神作背后通常是:参考、分镜、节拍、物理、分层渲染、音效、自动自检——一整套制作链。

真正该复制的,不仅仅是prompt,还有让 Codex 从「帮你做动效」,升级成「帮你搭一套可复现的动效导演系统」。

下面把完整做法从头讲一遍。以后让Codex帮你自动出高级动效视频。

01|同是 Opus,神作 / 废片差在哪(导演层 vs 写代码)

同一个模型,为什么有人出神作、有人出废片?

那些热门的动效视频里,模型往往在同时干几件事:当导演、定运动、写实现、管声音、生成后再自检。我们平时用 Codex,却常常只让它干一件事——写动画代码。

更准确地说:两边都是代码 Agent。差距多半不在「会不会写 position / rotation」,而在有没有把 Art Direction 上下文喂进去——观众先看哪、什么时刻停、哪次碰撞要有重量、哪里绝对不能 glow。

Opus 5.5 本身已经能把很多缺的部分补上:镜头、节奏、材料事件,它会主动往前推。换成 Codex 这条路,缺的地方不会自动出现——你不写导演层,它就只负责把东西「做出来」。

大家的任务型提示通常只定义「做什么」:

做一支顶尖动效的15 秒产品介绍。

它没有定义:分镜、运动系统、轨迹、相机、物理、节拍、光、声、禁止项、验收标准。缺的部分一空,就退回默认值了——居中大字、霓虹渐变、全体同步淡入。

Codex 默认生成的居中大字霓虹渐变动效画面

成片质量可以大概概括成一个公式:设计判断 × 运动语言 × 素材 × 节拍与声音 × 渲染 × 自检。有一项接近0,成片就像「AI 做的 PPT」。

还有一个反直觉点:高级感常常来自删掉自由度,而不是加效果。 好指令会同时写大量限制——同一形状连续变形、极少颜色、微量过冲、禁止全体相同动作。

02|基础概念和工具

  • 分镜 / Shot:整片切成一段段镜头,每段有主任务和大致时长。
  • 主体 / 次主体 / 背景:观众先看谁、谁陪衬、谁垫底。层次乱了,再漂亮也像糊在一起。
  • 前中后景(或平面层次):近景抢注意或补充层次感,中景做事,远景托气氛;平面排版也可以只有「上中下」层次。
  • 错相:别全体同步动。主体先动,阴影、相机、文字晚几帧,这样才有节奏。
  • 预备 → 冲击 → 回稳:完整动作通常有蓄力、打中、余震,而不是匀速滑过去。
  • 过冲 / 回弹:到达目标后稍微冲过头再收回来。
  • 主光 / 高光 / 接触影:光从哪来、亮边在哪、贴地那一圈阴影。高级感经常靠光线衬托。
  • 卡点 / 节拍:重动作对准音乐拍;
  • BGM vs SFX:BGM 管情绪和段落;SFX 打在接触、落地、切换这些「事件」上。
BGM 与 SFX 在接触事件上的节拍分层演示

再推荐一些大家常用的工具:

  • Remotion:用 React 按帧写视频的框架,适合把动效当成可版本管理的工程来做,预览和渲染链路成熟;官方文档也把 Codex 这类 coding agent 当成入口之一。
  • HyperFrames:偏「把脚本 / 素材自动编排成片」的视频工作流,适合信息向口播、步骤卡、快速出片。
  • ChatCut:对话式剪辑方向,适合用自然语言改时间线、补字幕和画面,降低传统剪辑软件门槛。

03|导演层 Brief

做视频前这些要考虑清楚,如果你懒得考虑的话,就丢给Codex让它补充完整,你再审核。

导演层 Brief 中分镜运动光声等要素清单

举个例子:

作者示例的导演层 Brief 具体内容

这里我有不少经验分享,比如说我让他做视频的时候,我经常会让他把主体,还有一些次主体明确好,每个元素都要有自己的运动轨迹。

背景加上流动效果。注重各种物理实现,包括形变、弹跳、拉伸等等,其实这些东西都是通过各种数学公式、各种数学函数渲染出来的。

还有一个简单的检验是看它的代码量,这个不绝对,但是一般你的代码量越多,它的细节就越多,做的效果就越好。

Codex 动效代码量与细节丰富度对照

04|整片顺序地图

一个比较合适的制作顺序是:音乐 / 拍点 → 定整片核心 → 分镜 → 排主次与景深 → 确定力学 / 光 / 声效果 → 风格协调 → 导出检查

  • 定整片核心:明确观众、明确核心内容、明确核心表达方式。
  • 分镜:每镜一个主任务;就算是短动效的15 秒也要有节奏,包括“起势 → 发展 → 收束”。
  • 主次与景深:主体 / 次主体;前中后景(或平面层次)。
  • 力学 / 光 / 声:各种物理学效果要确定好,这是拉开差距的一个重要方向。
  • 风格:材质、光源、背景等整体风格,也可以根据用途分出风格重点,比如是宣传片,比如是科普视频,他们侧重的风格不一。
  • 检查:整体效果查看,如果有不满意的,最好是逐帧地去看才能发现问题。我会让Codex做一个HTML页面,能够逐帧地分析查看。
用 HTML 页面逐帧检查动效的界面

05|层次:主次、前中后景、错相

主次尽量各有过程,有自己的运动轨迹;背景不是静态图,可以视情况让他们流动起来;

错相:主体先动 → 次层滞后 → 相机可晚几帧 → 阴影更晚。目的就是不要同时有同样的动作,那看起来没有层次感,比较拉胯。

同一节奏、不同相位:多主体更像「发起 → 回应 → 截断 → 接管」,不是各做各的。尽量让各元素之间都有协作,每个元素虽然有自己的规律(函数规则),但是它们整体可以汇合成一个总的规律。

翻车信号:所有层共用一个进度——PPT 同步感极强。真实复杂动效里,主体、相机、阴影、文字、SFX 几乎从不共用一条时间函数。同一时刻尽量一个主事件。

主体次层相机阴影错相运动时间轴

06|运动语言:预备 → 拉伸 → 冲击 → 压扁 → 回稳

举一个简单的例子,想让一个元素从上到下。完整动作应该是:

预备 → 加速 / 拉伸 → 冲击 → 压扁 → 过冲 → 回稳 → 次级响应

元素从上到下运动的预备冲击回稳阶段

名字记不住没关系,写进 Brief 丢给 Codex 执行就行

做一个运动要先有原因,再有形变:压扁 / 拉伸应来自速度与冲量,不是随机 easing。过冲只在能量说得通的地方用。

动量要连续:上一动作的末速度,最好成为下一状态的初值——一形贯穿多状态,比每段重新「弹出」更高级。

动量连续传递与多状态形变运动曲线

07|物理:重量 / 弹性 / 碰撞,写入要求再验输出

要做一个高级的动效,不写清楚物理效果,输出很容易做出整幅推拉、死轮廓位移等问题,整体效果会比较差。

所以做之前就要让AI先把各种物理效果应用进去。这些都是我经常用到的物理规则:

重力抛物线、碰撞与连锁反应、弹跳、滚动和惯性;挤压拉伸、弹簧回弹、软体形变;弯曲、折叠、扭转及受力传播;还有水波、旋涡、漂浮、粒子流动与聚散。关键是让运动有明确的受力起点,并让接触、形变和后续运动连贯发生。

重力碰撞弹跳软体形变等物理规则演示

08|光源与细节

「高级感」常常来自光,包括:主光 / 弱补 / 轮廓光、粗糙度、高光、接触影、透视。

落地检查就三件事:主光方向整片统一;关键物体别冻死——位置不动时,高光、受光面、倒影也要跟着动;冲击传到环境时分层错相,别整幅一起抖。

主光轮廓光高光与接触影方向演示

09|节拍、音效与音乐

先建拍点网格,再做动画。例如 120 BPM、60fps,一拍约 30 帧——重拍动作尽量对准拍。不是每个 beat 都要动。

BGM 管段落与情绪;SFX 打在接触帧。更自然的做法是微偏移:预备略早、撞击略偏、碎屑略后——全层卡同一帧反而显得有点假。

SFX 最好从运动长出:速度 → whoosh,冲量 → impact;别动画做完再随便贴。需要的时候要给主体信息让路。声音从整句听,循环垫底 ≠ 声画叙事。

120 BPM 拍点网格与 SFX 接触帧对齐

10|一个好的参考能够节省大量的时间

前面讲的导演层、主次、景深、物理、光、声对动效制作都很关键;但你想稳定对齐「顶尖」观感的话,一段真正好看的参考会省下大量精力。

Opus 5.5 最近很多神作,那是因为模型自己就把导演层补得很满,提示词也到位;用Codex 做动效视频,你更需要看得见的目标来参考,把各方面约束好。

我把近期刷到的优秀 AI 动效,整理进了开源仓库 awesome-ai-motion,也做了可以直接观看的 在线画廊:现在有355个视频参考、六十多份作者公开提示词,数十个动效源码,持续更新中。

做动效之前,大家可以先去看看你喜欢的风格是什么样的,有一个好的参考事半功倍。

awesome-ai-motion 在线画廊视频参考列表

我是观默,01年,前大厂程序员,AI工程师,在大厂做过数十亿流水产品,出海港澳台日韩欧美,持续分享 AI 实战经验,AI提效方案,AI副业。

内容核验说明

把动效制作从换提示词转成一条链:导演层 Brief、分镜、主次景深、物理、光源、节拍音效、自检,再配可对照的参考库。做 AI 视频却常出「PPT 感」的人,可以拿它当检查清单。作者披露的 API 成本与仓库规模未经独立验证,文中也没有成片,实际效果需自行判断。

文中的 API 成本(约5000美元,由ChatGPT估算)、烧掉两张重置卡、仓库含355个视频参考与六十多份公开提示词等数据,均来自原作者公开披露,诀.com未独立验证;文章未附成片,制作流程属经验分享,结果不保证复现。

原始来源

原作者:观默(@guanmo_ai)

本文对公开来源内容进行了结构化整理,原观点与内容归原作者所有。

查看原文