分享我用codex做AI自动化剪辑经验。
白昼分享用 Codex 做 B 站好物视频自动化剪辑的经验:先解释 Agent、Skill、素材库等基础概念,再介绍 HyperFrames、Remotion、ChatCut 等流派与 FFmpeg、Whisper 等工具,最后给出逆向拆解流和正向创作流的操作步骤与提示词模板。;本段主要讲 AI 剪辑的加餐注意事项:剪辑越复杂、效果越精致,磨 Skill 越耗时且烧 token;推荐苹果电脑配合 Codex computer use 操作剪映,Windows 也能做但更多靠代码;介绍 ChatCut 作为不直接操控剪映的第二种方式;提到个人 IP 粗剪和圈友 Agent;随后对比 HyperFrames 与 Remotion 的选择,给出先用 HyperFrames 跑通、稳定后再整理成 Remotion 固定栏目的建议;最后介绍 video-use 处理已拍素材的安装与使用,并以作者业务推荐和求点赞收藏评论收尾。
【01】自我介绍和成绩
哈喽大家好,我是白昼,00后,entj
现围绕数码、家电家居两个赛道运营矩阵带货账号
与海信、美的、友望、TCL、京东京造等品牌方开展过内容合作,
这个项目主要靠B站横屏视频带货以及商单获得收入

今天我想加一个和我自己关系最大的成绩: 以前一条 10 分钟的好物视频,从录音到导出,光剪辑这一关就要【20小时 / 2天】; 现在我把剪辑交给了 Codex,粗剪、字幕、素材对位全是 AI 员工自己跑,我只花【30分钟】终审一遍。 今天这场,就专门讲这件事。
【ai剪视频的案例参考】
【02】为什么 Codex 自动剪视频是趋势
由于claude对中国用户太不友好,总是封号。那么codex能剪出来什么样的视频呢?可否平替?
答案是:完全可以
B 站好物项目复杂程度极高,一个视频 10 多个环节,这个我之前讲过。但今天我要说:这 10 多个环节里,最吃时间、最容易把小白卡死的,就是剪辑。
给你们算笔账: 一条视频 10 分钟,要一次性带 20 多个品。
- 每讲一个品,你要从素材库里把产品图、渲染视频、对比图翻出来;
- 口播 4000 字,哪句话对应哪张图,全靠人肉对;
- 字幕要逐句加,错一个字就得重对;
- 还要加片头片尾、转场、BGM、调色。
今年 618 之后,我想明白一件事: 我不需要“更努力地剪”,我需要让会写代码的 AI,把剪辑这件事整个替我做掉。
这里一定要把两件事分开: 市面上的 AI 剪辑,比如剪映的“图文成片”,本质是黑盒 —— 你把文案粘进去,它按它的模板配一些它素材库里的图。你想让它按你的规则剪?做不到,因为它不是为你的业务设计的。
但 Codex 不一样。 Codex 是一个编程 Agent。它能干的事是:你把“我平时怎么剪一条视频”告诉它,它把这套流程写成代码 —— 用 FFmpeg、用剪映草稿、用 Python—— 以后每一条视频,它自动按这套代码跑一遍。 换句话说:
成片模板= 你用它的模板
Codex = 你把自己的剪辑 SOP,变成一个可以无限复用的数字剪辑师
而且,和“让小白去学剪辑”不一样,Codex 剪辑对新手极其友好 —— 你不需要会剪辑,你只需要会把“你想要什么样的成片”描述清楚。(其他国内的ai agent同理)
【03】今天大家都可以学到什么?
第一,筑基:讲透“用 Codex 剪视频”原理。
它和剪映 AI、和人工剪辑的本质区别是什么
为什么这件事小白也能干
核心一句话:Codex 是把你的剪辑流程“代码化”,而不是赌运气让 AI 一键生成
第二,实操:从 0 开始用ai剪一个可以立即发布的视频。
今天会实操:输入一篇口播稿,自动产出带字幕、带素材对位的粗剪片
你会拿到一整套提示词模板,回去照着就能搭
提供一整套的skill可以直接使用;以及我的一些思考
【04】 基础原理:认识剪辑 Agent、剪辑 Skill 和素材库
动手之前,先分清三个最容易混的概念:Agent、Skill、素材库。
一、Agent不是“更会聊天的AI”
普通聊天机器人通常遵循“你问一句,它答一句”的模式,主要任务是生成内容。Agent则更像一个能够围绕目标持续工作的数字员工。
典型工具:Codex (国外,最强);WorkBuddy(国内)
Codex 本身就是一个Agent,一个编程 Agent,也是万能 Agent。
并且你可以让你的agent的任务固定下来,你可以把它想做是你的一个员工,你招聘了一个财务,那么它只负责财务工作。你招聘一个剪辑,那么这个员工(agent)只负责剪辑这方面工作,这是区别于豆包,workbuddy,codex这样的工具很大的区别。这样也会避免上下文太长,导致开发环境污染,最后做出来个屎山的结果。
Agent可以规划任务、调用工具、与其他专业Agent协作,并保留必要的状态来完成多步骤工作。一个完整的Agent通常由模型、指令、工具、知识、记忆以及安全边界共同组成。
例如,你对普通AI说:“帮我分析这几款空调。”它可能直接根据已有知识写一篇分析。
而一个选品Agent可能会:
- 读取待分析的产品名单;
- 查询产品参数和价格;
- 按照统一标准进行横向比较;
- 标记缺失或相互矛盾的数据;
- 根据目标人群完成产品排序;
- 生成口播稿并检查事实;
- 把结果保存到表格或文档中。

它不是简单地“回答问题”,而是在执行一个包含判断、行动、检查和交付的完整流程。
因此,判断一个系统是不是Agent,关键不在于它会不会使用大模型,而在于它能不能围绕目标形成工作闭环:
理解目标 → 制定计划 → 获取信息 → 调用工具 → 检查结果 → 决定下一步 → 完成交付。
Agent也不等于完全自动化。成熟的Agent应该知道哪些事情可以自主完成,哪些事情必须经过人工确认。例如搜索资料、整理数据和生成草稿通常可以自动执行;付款、删除文件、正式发布内容等高风险操作,则应该设置权限和审批。
二、剪辑 Skill = 你的“剪辑 SOP”
如果说 Codex 是剪辑师,Skill 就是这个剪辑师脑子里那套“老手才知道的规矩”。
你以为“加字幕”就是把字打上去?一个完整的剪辑 Skill 会规定:
- 口播稿里哪些词必须加粗标红(品牌名、价格、型号)
- 字幕一行多少字、停留多久
- 讲“痛点”配什么画面,讲“参数”配什么画面
- 一个品讲完,用什么转场切到下一个品
- BGM 什么时候进、什么时候压低
- 片头片尾多少秒、固定用哪一版
这些东西,你自己剪的时候是凭感觉的;但你不写下来,Codex 就只能瞎猜。 Skill 解决的不是“它知道什么”,而是“它应该按什么规矩做”。
一个Skill通常可以包含四类内容:
- Instructions: 工作步骤、判断规则和行为边界;
- References: 完成任务时需要查阅的规范与参考资料;
- Scripts: 可重复执行的程序或自动化脚本;
- Assets: 表格、文档、图片和输出模板等资源。
Skill 可以理解成一份给 Codex 看的工作说明书。它告诉 Codex,遇到口播、配音、分镜或剪辑任务时,该调用什么工具、按什么顺序完成、最后检查哪些问题。
Agent可以根据任务描述自动选择Skill,也可以由用户明确指定。系统通常先读取Skill的名称和适用范围,确认匹配后再加载完整内容,这种机制被称为“渐进式加载”,可以避免一次塞入太多无关信息。
三、知识库是Agent的“专业资料库”
Skill 告诉 Agent“怎么干活”,知识库则告诉它“干活的时候能翻哪些资料”。
做带货视频,哪些东西能塞进知识库?品牌方给的资料、产品参数、售后政策、以前跑过的爆款案例、品牌规范话术、课程资料、内部文档 ,凡是你做视频时可能要引用的,都能放进去。
知识库不会傻乎乎地把所有文件一股脑全塞进模型的上下文里。它的做法是:先把文档切成一小块一小块、建好索引;等 Agent 接到问题,再去检索最相关的那几段,挑出来交给模型生成答案。这套打法有个专业名字,叫检索增强生成,也就是 RAG。
例如,用户问“这款空调适不适合老人使用”,知识库里不一定存在完全相同的句子,但系统仍然可能找到与噪声、操作难度、送风方式和售后服务有关的资料。
不过,接入知识库并不等于Agent永远不会出错。答案质量仍然取决于:
- 原始资料是否准确;
- 文件是否及时更新;
- 文档切分是否合理;
- 检索结果是否真正相关;
- Agent是否对关键结论进行了交叉核对。
知识库的作用,是为Agent提供可检索、可更新、可追溯的外部依据,而不是让模型凭空拥有绝对正确的记忆。
素材库 = 剪辑 Agent 的“弹药库”
Codex 剪片子,不建议凭空变出素材。它需要一个查得到、找得准的素材库:
- 每个品牌每个品的产品图、渲染视频、官方素材
- 固定的片头片尾、BGM 库、转场模板
- 历史用过的对比图、参数表
这里有个真实提醒:素材库越乱,剪辑 Agent 剪出来的片子越离谱。它不是不努力,是它真的不知道你要哪张图。
四,ai剪辑的3大热门门派
流派一:HyperFrames
文章或主题 → 口播稿 → 配音 → 时间轴 → 分镜 → HyperFrames → 检查成片

HyperFrames 是什么?
HeyGen 开源的一套“用代码生成视频”的工具。
你可以把它理解成:
AI先把视频写成一个会动的网页,再把网页逐帧渲染成 MP4。
它通过 HTML、CSS、JavaScript 控制文字、图片、动画、字幕、转场和音频。你不必亲自写代码,可以让 Codex、Claude Code、Cursor 等 Agent 根据你的文案自动完成。
HyperFrames 官方介绍|GitHub 项目
它特别适合批量制作这类视频:
- 产品参数介绍、配置对比
- 排行榜、价格档位推荐
- 动态表格、数据图表
- 文字卡片、字幕动画
- App或网站功能演示
- 片头、章节页、价格提醒页
- 同一模板批量替换不同产品信息
比如你给它:
“根据这份电视参数,生成一个60秒竖屏视频,前3秒提出选购痛点,中间对比屏幕、分区和价格,最后提示评论区蓝链。”
Agent就可以生成画面布局、文字动画、产品图展示、配音时间轴,最后导出 MP4。
HyperFrames 怎么用?
画面样式也可以按需要补充。想做拼贴式知识视频,可以把
HyperFrames Community Skills
。这些都属于样式扩展,第一条视频不用全装。
流派二:remotion
remotion是什么?
用网页技术写出画面和动画 → 浏览器按时间逐帧播放/截图 → 编码成 MP4。
Remotion 像 “用React开发一套自动剪辑软件”
HyperFrames像“让Agent写一个动态网页,然后直接导出视频”
remotion怎么用?
HyperFrames 更像让 Codex 根据这一期内容重新组织画面。Remotion 更像先做一套栏目模板,之后每一期往固定位置填内容。
想走 Remotion 路线,把
Remotion Agent Skills 排斥代理技能
我的建议很简单:第一条先用 HyperFrames 跑通。连续做了几期以后,发现镜头结构已经稳定,再让 Codex 把它整理成 Remotion 的固定栏目。
流派三:chatcut

ChatCut 是什么?
ChatCut 是一个“用聊天指挥剪辑”的视频编辑器。
你不用先学时间线操作,可以直接对它说:
> >
它会把操作落实到真正的多轨时间线:切片、字幕、音乐、画面、动效都是可见、可撤销、可手动微调的。它的定位介于“剪映”和“AI Agent”之间。
ChatCut 怎么用?
- 打开 ChatCut,注册后新建项目。
- 上传原始视频、录屏、图片、产品素材和脚本。
- 在左侧聊天框描述要做的片子。
- 让它先做初剪,审一遍结果。
- 对不满意的地方继续直接说,或在时间线上手动调整。
- 导出成 B 站 16:9、短视频 9:16,或导出字幕等素材。
举个例子
对 B 站口播,建议第一次就用这种提示词:
这是一期 B 站数码口播。请先分析素材,保留信息密度最高的内容,
删除口头禅、重复表达和超过 0.6 秒的无意义停顿。
剪成节奏清晰但不要过度碎切的 6–8 分钟横版视频:
1. 开头 5 秒先放结论和冲突点;
2. 每讲一个核心参数就加对应的标题字幕;
3. 在“续航、屏幕、价格”三个部分各插入一次我上传的产品素材;
4. 字幕用简洁白字、重点词黄字;
5. 配轻微背景音乐,讲话时自动压低音量;
6. 结尾保留一句总结和关注引导。
先给我初剪版本,不要擅自删掉数据、结论和对比内容。然后第二轮可以精修:
第 1 分 20 秒到 1 分 45 秒节奏太慢,压缩为 12 秒;
把“续航不是最大问题”做成大字强调;
将价格比较整理为一个 3 秒的数据卡片;
另外提取 3 条 30–60 秒竖版高光切片。它特别适合口播、课程、访谈、产品讲解、录屏教程和播客;不太适合直接代替人工做剧情片、旅行 Vlog 或高度依赖音乐节奏的混剪。
最实用的用法是:ChatCut 负责初剪和搭包装,剪映负责最后的中文审美微调与发布。
五,工具通道:Codex 剪片子的“双手”
前面我们已经知道,Agent 会理解目标、规划步骤、做出判断、调用skill、完成任务
Skill 会告诉它一项工作具体应该怎样执行,
知识库会保存它长期需要使用的资料。
但它怎么真正把视频剪出来?靠这几样:
(1)FFmpeg:命令行剪辑工具,最稳
剪辑界的瑞士军刀。切视频、叠图片、加字幕、调音量、导出,全是命令。Codex 直接调 FFmpeg 干活,不依赖图形界面,批量跑几十条都不崩。
(2)剪映草稿:让 Codex 生成一个“半成品工程”
剪映专业版的草稿文件本身就是可读的。Codex 可以直接帮你生成一个剪映草稿 —— 轨道、字幕、素材位置全部排好。你打开剪映,只在这个草稿上微调,而不是从零开始拖。
(3)Whisper:自动出字幕
口播录音扔给 Whisper,自动转成字幕文件,自动对齐时间轴。再也不用手动一句一句对。
(4)Computer use 兜底(苹果电脑更好用,Windows一般)
遇到实在没有命令行接口的活(比如某个素材网站必须登录才能下),Codex 可以操作浏览器去下。但记住老原则:能 API、能命令行,就别用 computer use,不稳定。
如果我让 AI Agent 直接使用 computer use 功能去京东联盟上选品,那么执行几次就会被封号、被反爬;
但你要是用京东联盟的官方 API,就可以正常直接使用他去查商品信息
(5)配音工具
如果你想要自动配音,最稳定的就是字节的豆包语音大模型,费用不高,效果稳定;如果你想要克隆声音就用VoxCPM,这是一个免费开源的声音克隆工具。或者国外的minimax国内的阿里云百炼(付费)
(6)Python 环境:
请帮我检查视频自动化剪辑需要的环境:
1. 检查 FFmpeg 是否已安装,如果没有请帮我安装
2. 检查 Python 版本是否 >= 3.8,如果没有请帮我安装或升级
3. 检查是否安装了剪映专业版,如果没有请告诉我下载链接
4. 安装 Python 依赖包:opencv-python, numpy, pillow, openai-whisper
5. 确认 Whisper 能正常调用:跑一次测试转写,输出一段字幕文件
检查完之后,告诉我哪些已经装好了、哪些需要我手动处理,每一项单独列出来。(7)各种各样的剪辑skill
五、三者到底是什么关系?
用一个剪辑团队来理解:
- Codex 是剪辑师:接活、排流程、推片子
- Skill 是剪辑 SOP:字幕怎么加、转场怎么切
- 素材库是素材硬盘:图在哪、BGM 在哪
- FFmpeg / 剪映草稿是剪辑台:真正动手剪
- 模型是审片人:最后看一眼字幕和素材对不对得上
举个例子:你的“B 站好物剪辑 Agent”接到一篇 4000 字口播稿 —— 它调用“素材对位 Skill”确定每个品配什么图,从素材库找到海信 X7 的图,调 FFmpeg 把图叠到对应时间点,用 Whisper 生成字幕,再套上“字幕样式 Skill”,最后导出一条粗剪片给你终审。
整个过程:Codex 调度,Skill 定方法,素材库出料,FFmpeg 动手。 所以记住一句话:Codex 剪辑不是写一段长提示词让它“随便剪剪”,而是岗位目标清楚、SOP 清楚、素材清楚、工具清楚,再加人工终审。
【05】 实操使用codex剪辑视频
方案一:逆向拆解流
视频做出来比较简单,并且需要有一定的业务素材,直接可以用,适用信息流混剪流

第一步创建文件夹
装好这些之后,你需要建一个项目文件夹。我一般是按照这样的结构来组织:
项目文件夹/
assets/ # 你的素材库
work/ # 工作区,每次剪辑都在这里建一个日期文件夹
final/ # 最终成品
skill # 项目skillassets 文件夹就是你的带货素材库,凡是以后拍片可能用到的素材,提前全囤进去,别等到做商单的时候才临时翻箱倒柜。
素材来源不限 。AI 生成的能用,自己实拍的更好,但一定要提前备好,优先放那种能反复复用的。
素材记得按类别分好档:拿带货素材来说,可以按外观、功能、场景这些维度归归类;AI 生成的和真人实拍的最好也分开存,找起来省事。
提前囤素材有个实打实的好处是你能先人工筛一遍,把质感好的留下、废片淘汰掉。这样一来,后面出成片的时候效果就很稳,基本不用反复返工。
skill是项目的配置文件,里面记录了你这个项目的目标、输出规格、验收标准这些信息。这个文件很重要,因为 Codex 会根据这个文件来理解你的项目需求,然后帮你做出符合要求的视频。
第二步拆解视频
准备工作做完之后,就可以开始真正的剪辑流程了。
第一步是拆解视频。如果你想复刻自己以前的爆款视频,那么这一步你只需要拆解你自己的视频,都需要哪些步骤,几分几秒的时候出现这个特效,这个特效用哪个。
请帮我拆解这个视频:【视频文件路径,或视频链接】,这是我的爆款视频,我想复刻它的剪辑方式。
请用你能用的工具辅助分析:用 FFmpeg 抽帧看画面变化、用 Whisper 转出口播文字对齐时间轴。画面或特效细节如果你无法确定,标注“待人工确认”,不要瞎编。
拆解完成后,输出一份《视频拆解表》:
一、整体信息
- 总时长、分辨率、画幅比例
- 开场前几秒的钩子是什么(画面 + 文字 + 声音怎么配合)
- 整体节奏:平均多少秒切一次画面/抛一个信息点
二、按时间轴逐段拆解
从 00:00 开始,按实际内容切成若干段,每一段输出:
- 时间码:xx:xx - xx:xx(几分几秒到几分几秒)
- 画面内容:这一段是什么(口播画面/产品图/实拍/对比图/参数图等)
- 特效与转场:这一段出现了什么特效或转场(如:缩放强调、闪白、叠化、硬切、弹入、故障特效、扫光等),按出现顺序列全
- 字幕样式:字幕位置、字号、颜色、是否加粗、有没有关键词高亮
- BGM与音效:音乐在不在、什么时候压低/抬起、有没有特殊音效(卡点、提示音)
- 实现方式:这个特效是用哪个工具/滤镜做的(剪映里的哪个特效或转场、FFmpeg 的哪个滤镜命令),不确定就写“待人工确认”
三、复刻步骤清单
把我复刻这个视频需要的操作按剪辑顺序列出来:
第1步:导入素材,粗剪主干,去掉哪些部分
第2步:...
(从导入、粗剪、画面分段、加字幕、加特效转场、配乐、调色到导出,一步一步)
四、复刻要点总结
- 最关键、少了它就不是爆款的 3-5 个剪辑手法
- 哪些环节是固定模板可以直接复用,哪些必须换成我本期的新素材
- 新手最容易忽略的 3 个细节
拆解完成后,把这份《视频拆解表》保存到我的 Agent 项目文件夹,文件名 07-爆款拆解.md,并告诉我文件路径。如果你没有已经验证过的爆款视频,那么拆解别人的视频
这一步的核心目的,是把参考视频拆成一个个独立的镜头,然后从每个镜头里提取关键帧,当作后面素材匹配的依据 —— 相当于先给参考片“抽骨”,后面才好照着搭。
参考视频怎么找?可以是 B 站上跑出效果的爆款视频,也可以是你自己剪过、觉得数据或者质感都不错的片子。重点是它值得被“拆开研究”。
找到之后把它下载下来,放进 work 文件夹,文件名一定要起得清楚好认 —— 比如带上视频主题、来源或者日期,方便以后一搜就能定位到,不会在素材堆里翻半天。
然后把下面这段话复制发给 Codex:
我需要拆解一个参考视频。
参考视频位置在@(输入你的文件名,Codex会自动搜索)
请帮我完成这几件事:
1. 用 FFmpeg 识别视频的镜头切换点(通过帧间差异分析)
2. 为每个镜头提取关键帧,保存为图片
3. 提取视频的音轨,单独保存
4. 生成一个 recipe.json 文件,记录每个镜头的开始时间、结束时间、时长、关键帧路径
5. 如有文案,根据音频生成一个配音文本,按镜头分段,文案需要精校,避免出错
完成后按照AGENTS.md要求,保存到对应文件夹,并告诉我识别了多少个镜头,让我确认切分是否合理。这个 recipe.json 文件,就是后面整个流程的核心剧本,相当于参考视频的“拆解说明书”。
它完整记录了参考片的结构 —— 每个镜头怎么排、怎么切都写在里面。后面的素材匹配、配音生成、草稿制作,全都以它为准,所以它的质量直接决定成片质量。
拆解完之后,你会在对应的文件夹里看到一堆小视频片段和截图,这些就是拆出来的“零件”。
打开翻一翻,确认一下镜头切得合不合理。如果发现有切岔的地方 —— 比如一个完整镜头被硬生生切成了两段,或者两个镜头黏在一起没切开 —— 可以让 Codex 再调一下。
不过大多数情况下,自动识别的结果都是能直接用的,不用太担心。
第三步筛选和匹配素材
这一步是整个流程里最核心的环节,也是最体现“自动化真香”的地方。
传统做法是什么样呢?你得一个镜头一个镜头地去素材库里翻,找到合适的素材,再手动拖到时间线上。这个过程又费时间又费眼睛,而且很容易漏掉一些其实更合适的素材 —— 翻着翻着就麻木了。
但用这套工作流就不一样了,我们只需要告诉 Codex 素材库在哪,它会自动帮你做视觉匹配,把每个镜头对应上最合适的素材。你省下来的时间,拿去多剪一条视频不香吗?
下面是提示词,你可以直接发给Codex:
我需要从素材库中匹配替换素材。
项目信息:
- recipe.json 路径:(上一步的拆解路径)/recipe.json
- 素材库路径:assets/
- 输出路径:work/(你的保存路径)
匹配要求:
1. 读取 recipe.json 中每个镜头的关键帧
2. 遍历素材库,为每个素材提取关键帧
3. 通过颜色、亮度、构图等视觉推荐最匹配的素材(给出置信度得分)
4. 应用这些规则:
- 避免连续3个镜头都用同 - 避免相邻镜头出现明显重复的房间或构图
6. 生成 fragment_plan.json 和 matches.json
7. 把选中的素材复制(不是移动)到 material/fragment01/, fragment02/ 等文件夹
重要原则:如果某个镜头的匹配置信度低于 0.6,标记为“缺素材”,不要用无关素材硬凑。
完成后,告诉我匹配结果,并列出哪些镜头缺素材需要人工补充。第四步生成配音
素材挑完,下一步就是配音了。
还记得最开始拆视频那一步吗?当时 Codex 已经把参考片的文案整段提取出来了,而且每句话都对应着它原本所在的镜头,相当于连台词带分镜一起给你备好了。
不过要提醒一句,Codex 一般是靠 OCR 或者 ASR 来“读”文案的,机器识别嘛,准确率很难做到百分之百,难免有听错、认错的地方。
所以生成配音之前,你先过一遍文案,看看有没有错字、漏句、或者读不通顺的地方。这步别省,不然配出来的音直接翻车,后面还得返工。
没有问题之后,就把下面这段提示词发给Codex:
我需要为视频生成配音。配音文本是@(你的文案.txt)
要求:
1. 调用豆包 TTS 接口,为每个镜头生成独立的语音文件
2. 读取每个生成的语音文件的实际时长
3. 如果配音时长和参考视频的镜头时长不一致,记录时长差异
4. 将所有片段拼接成完整的配音文件:final_voice.mp3
5. 更新 recipe.json,记录真实的配音时长
完成后,让我试听一遍,确认语音自然度和语速。第五步生成剪映草稿
直接复制就可以
我需要生成最终的视频和剪映草稿。
输入信息:
- recipe.json:work/recipe.json
- matches.json:work/matches.json
- 素材路径:work/material/
- 配音文件(可选):work/voice/final_voice.mp3
- 字幕文本(可选):work/script.txt
输出:
1. 渲染预览视频:work/remix.mp4
2. 字幕文件:work/captions.srt
3. 剪映草稿:work/jianying_draft/
要求:
1. 按照 recipe.json 和 matches.json,把素材按顺序拼接
2. 如果有配音,用配音的时长作为基准;否则用参考视频的时长
3. 生成 .srt 格式的字幕文件
4. 生成剪映可以打开的草稿格式,注意:
- 内容 ID、元数据 ID、根索引 ID 必须一致且唯一
- 素材路径必须是绝对路径且文件真实存在
- 所有素材先复制到项目文件夹,避免路径失效
直接生成剪映草稿,完成后提醒我审核和确认。第六步人工审查
最关键的是跑通整个工作流以后,你可以直接跟Codex说:帮我把工作流封装成Skill。下一次,你就可以不需要这么复杂的流程,直接调用Skill就可以生成。
方案二:正向创作流
第一步:把文章或主题变成口播稿
口播稿是整条视频的骨架。画面再漂亮,开头没有抓住人,后面的方法也说不明白,视频很难被看完。
这里有三条路。
路线一:只有一个主题,直接让 Codex 写
比如你准备做一条“Codex 如何做视频”,先告诉 Codex 四件事:讲给谁听、解决什么问题、视频多长、希望观众看完做什么。
我要做一条 60 秒竖版视频,主题是“第一次用 Codex 做视频”。
观众只会使用 Codex,没有写过口播稿,也没有剪过视频。
开头先告诉他最终能做出什么,再讲清楚:生成口播、选择声音、用 HyperFrames 做画面、检查成片。
每句话尽量能直接念出来,不写书面化小标题,不堆概念。
结尾让他先用一个主题跑通第一条视频。
现在只交付口播稿,暂时不要做分镜和视频。主题越具体,口播越容易写。把“做 AI 视频”缩成“把一篇工具测评做成 60 秒竖版讲解”,Codex 才知道哪些内容该留下。
路线二:已经有文章,让 Codex 改成能说出口的话
然后告诉 Codex:
请读取 article.md,把它改成一条 90 秒口播稿。
保留文章的核心判断和最有用的案例,不要逐段缩写全文。
开头先说读者能得到什么,中间只保留三步方法,每一步都用能听懂的句子讲。
文章里的链接、脚注和排版符号不要读出来。
请把最后需要我核对的事实单独列出来。
先只生成 narration.md。文章转口播时,最容易出现的问题是“字都认识,念起来不像人说的”。把
改完仍然要自己读一遍。嘴巴会替你发现很多眼睛看不出来的问题。
文案写作的tips:
- 钩子:先把结果或具体问题摆出来。
- 问题:告诉观众,他现在卡在哪里。
- 方法:用两三步把过程讲清楚。
- 下一步:给一个看完就能做的动作。
例如这篇教程的视频开头,可以直接说:“装好 Codex 不知道干什么?你可以先用它做一条视频。给它一篇文章,它能继续处理口播、声音、字幕和画面。今天先跑通最短的一条流程。”
第二步:选择普通 TTS,还是复刻自己的声音
口播定稿以后,再决定由谁来念。
【06】 加餐,注意事项和其他的ai剪辑形式
但是这里我要先给大家打一个预防针:剪辑越复杂,你想要的效果越精致,你去磨这个 Skill 的时间就越长。磨一个精致的 AI 剪辑效果,不是一下午、几个小时就能搞定的,而且非常烧 token,你们今天实操的时候,心里要有这个预期。不过如果你的带货视频本身比较简单,今天完全可以上手试一把。我今天讲的,就是想让大家看看 AI 剪视频到底可不可行。
先说一下平台:剪辑这块,我更推荐苹果电脑。因为苹果上 Codex 可以用 computer use 直接模拟人手,在剪映里操作,而且只在后台跑,不影响你前台干别的。Windows 也能做,只是更多是靠代码去操纵,体验不太一样。
另外还有第二种剪辑方式,不直接操控剪映 —— 借助 ChatCut 这个软件,你用 Codex 对话 ChatCut,随时改视频。这种方式最适合那种没有固定模板、又不想自己动手剪的人,而且它可以直接导出 MP4。
还有,我知道有些老板想做个人 IP,那第一步还需要粗剪,把停顿、卡壳剪掉,让口播更顺滑 —— 这块也有圈友做出 Agent 了,是可以做的。但我自己全程用数字人和声音克隆,用不到这个;真要我剪,我直接在剪映里用智能剪口播就够了。
我分享的几个剪辑 Skill,都已经在前面的篇幅中标注,大家可以直接打开github让codex调用,立马看到成品。但如果你想拥有属于自己的、贴合你风格的 Skill,那就得按今天讲的步骤,自己慢慢调教了。
HyperFrames 和 Remotion,该选哪个呢?
两者都可以把文字、声音、图片和时间轴做成视频。你只需要选一个作为最后的成片工具。

HyperFrames 更像让 Codex 根据这一期内容重新组织画面。Remotion 更像先做一套栏目模板,之后每一期往固定位置填内容。
想走 Remotion 路线,把
Remotion Agent Skills 排斥代理技能
我的建议很简单:第一条先用 HyperFrames 跑通。连续做了几期以后,发现镜头结构已经稳定,再让 Codex 把它整理成 Remotion 的固定栏目。
处理的是已经拍好的素材。它先转写视频,找出每一段说了什么,再和你确认哪些内容留下,之后才开始整理剪辑、字幕和补充画面。
安装时可以直接把这段话交给 Codex:
请帮我安装 https://github.com/browser-use/video-use。
先阅读 install.md,完成依赖、FFmpeg 和 Codex Skill 注册。
安装后先不要转写任何视频,等我把素材放进文件夹。
拍摄完成后,把原视频放进一个单独文件夹,再告诉 Codex:
请使用 video-use 处理这个文件夹里的真人口播。
先盘点素材并转写,找出重复、停顿、说错和重新开始的位置。
先给我一份剪辑方案,列出准备保留和删除的片段;我确认后再剪。
定稿后添加中文字幕,并在讲到步骤时使用 assets 里的对应图片补充画面。
最后输出预览版,检查无误后再输出 final.mp4。
最后,把视频变成一套内容获客系统
当你已经掌握批量生产内容的能力,那么接下来就要搭建你自己的内容获客系统了。搭建你自己的sop闭环,给下期做个预告。
最后推荐一下我自己:
我对ai agent在内容创作和视频方面比较有所研究,针对内容电商也有成绩,不管是帮老板打造定制个人ip的内容系统还是赋能老板业务的ai化矩阵化提效都可以做到
如果有老板需要这方面的业务需求可以和我聊一下
如果老板自己公司有相关培训的需要,觉得我讲的还不错的话,也可以找我
想个人深挖定制自己的剪辑模板或者一些其他技术问题都可以咨询我
内容核验说明
价值在于把「用 Codex 自动剪视频」拆成可操作的链路:Agent、Skill、素材库的分工,HyperFrames、Remotion、ChatCut 的取舍,以及逆向拆解和正向创作两套提示词模板,照着改就能试。适合做横屏口播带货、想把剪辑流程代码化的人。文中 20 小时压到 30 分钟、佣金成绩均来自作者公开披露,诀.com 未独立验证,效果不保证复现。
文中「单条视频从 20 小时压到 30 分钟」「单月佣金 5 位数」「618 之后转变」等成绩与时间点均出自作者自述,诀.com 未独立验证。给出的提示词模板、Skill 与工具组合未见实际运行结果,成片质量受素材库、模型版本影响,结果不保证复现。评论区整合
根据评论整合来看,回复主要在转述并认可作者的剪辑思路:把 B 站好物剪辑从 20 小时压到 30 分钟,做法是把剪辑 SOP 写成 Skill,再配素材库和 FFmpeg 批量出粗剪。有回复表示没想到 AI 剪辑已经能这样用;也有回复认同关键不在「一键成片」,而在于把自己的剪辑流程代码化。三条回复方向一致,没有出现质疑或补充经验,也没人提到亲自验证过效果。
基于原帖公开评论整理,只反映讨论中的观点与反馈,不代表诀.com 立场。原始来源
原作者:白昼|AI工具实战(@q936941441)
本文对公开来源内容进行了结构化整理,原观点与内容归原作者所有。
查看原文