如何利用 Muse 制作一部 3 分钟一集的漫剧

作者记录了自己用 Muse 的视频生成能力制作 3 分钟一集漫剧的过程:先用同一套提示词在 Muse 上与 Seedance 对比 10 秒镜头的效果,再按「剧本 → 分镜表 → 资产 → 锁定资产 → 逐镜生成 → 拼接」的六步流程跑一集 18 个分镜,期间在中文配音和台词发音上连续失败,据此得出「在模型可达域内找最优解」的结论,最后结合 Seedance 官方提示词文档与 Higgsfield 开源长片的方法论,给出分三层上手(10 秒练手感、一集练流程、系列化练管理)的建议和实战生成次数数据。

一、Muse 到底是个啥

Muse 最近很火,但很多人以为它就是个 AI 助手,其实不是,这里我科普下:

Muse 是 Meta 旗下的产品,背后是一整个 Muse 模型家族

  • 负责对话和推理的 Muse Spark
  • 负责生图的 Muse Image
  • 负责视频生成的 Muse Video

而且它跟普通聊天机器人有个本质区别:

每个用户都有一台专属的云电脑,Muse 在上面替你干活——写代码、跑脚本、做视频、管文件,是个能动手执行的智能体,不是个只会动嘴的问答机。

搞清楚这个,就明白为啥可以用 Muse 的视频生成能力,一集一集地生产漫剧。

二、X 上一个 10 秒视频让我入了坑

前几天在 X 上刷到有人用 Muse 生成的视频镜,质量看着还行。

我当时第一反应是:它跟 Seedance 比能力如何?

于是我把自己在 Seedance 上用的同一套提示词拿过来,在 Muse 这里试了一下——效果还可以,画面、运镜、氛围都在线,大家也可以感受下。

提示词:

【整体设定】

2005 年盛夏的台湾校园青春偶像剧。两名刚满 18 岁的高中生情侣放学后骑自行车回家。男生穿白色短袖校服衬衫、深蓝长裤和帆布鞋,女生穿白色短袖校服、深蓝百褶裙和白色帆布鞋,两人背着略显旧的双肩书包,各骑一辆银色复古自行车。

场景是校园外的林荫小路,路旁有低矮民居、旧式中文招牌、电线杆和盛开的凤凰木。阳光穿过树叶形成斑驳光影,空气里带着盛夏午后的明亮与潮湿感。整体呈现 2005 年台湾青春偶像剧风格,清新、浪漫、青涩,带有轻微柔焦、高光泛白、低对比暖色和复古电视画面质感。

【0–5 秒】

放学铃声刚结束,两人骑着自行车从校园门口并肩驶出。男生稍微加速后回头看向女生,嘴角带着克制的笑意;女生迎着风眯起眼睛,头发和裙摆轻轻摆动。侧面中远景平稳跟拍,树影快速掠过车轮与校服,远处传来蝉鸣和自行车链条转动声。

【5–10 秒】

女生轻轻按响车铃,笑着对男生说:“等我一下啦。”男生放慢速度,两人的自行车重新并排。镜头切到正面中景,缓慢向后移动,保持两人始终位于画面中央。女生低头忍住笑意,随后抬眼看向男生;男生短暂移开视线,耳朵微微泛红。两人的动作自然、克制,带有初恋般的青涩感。

【10–15 秒】

两人骑进凤凰木覆盖的长坡,夕阳从道路尽头照来。女生向前伸出一只手感受迎面的风,男生转头看她,两人同时笑起来。镜头切到背后远景并缓慢拉远,两辆自行车并肩驶向金色夕阳,树叶被风吹落,最后定格在两人的背影和被阳光拉长的影子上。

【画面与声音】

4:3 复古电视偶像剧构图,2005 年台湾青春剧质感,夏日暖黄色自然光,柔和逆光,轻微高光溢出与胶片颗粒,色彩清新但不过度饱和。背景音乐使用轻快克制的木吉他与钢琴旋律,融合蝉鸣、风吹树叶、自行车铃声和链条转动声;对白清晰自然,音乐不遮盖人声。

【约束条件】

全程只保持同一对18岁情侣作为主要人物,面部、发型、校服、书包和自行车前后一致;骑行动作符合真实物理规律,手脚结构正常,车轮转动和人物重心自然;不出现智能手机、现代电动车、现代汽车、LED广告牌或其他明显晚于2005年的物品;无字幕、无水印、无多余文字;人物面部稳定,无变形、闪烁、穿模或角色数量变化。

seedance 2.0:

Muse video:

但 Muse 的视频模型一次就生成约 10 秒,时长不可调。想做长视频,只有一条路:一段一段生成,再拼接起来。

我跟 Muse 沟通它说他可以直接拼接出片,这样连剪辑都省了。

三、能不能做成 3 分钟一集?

一个 10 秒镜头和一部 3 分钟一集的漫剧之间,差的不是技术,是方法。

3 分钟 = 180 秒,按每镜 10 秒拆,一集就是 18 个分镜。18 个镜头怎么保证是同一个人、同一个场景、同一个故事?人物不能这一镜一个样,剧情不能断,台词不能乱——这才是真正的难题。

刚好我前段时间开发了一个漫剧创作出海战的工具,我就结合我这个产品中漫剧制作六部方法论:

剧本 → 分镜表 → 资产(人物/场景/道具)→ 锁定资产 → 逐镜生成 → 拼接

漫剧制作六步方法论流程图:剧本、分镜表、资产、锁定资产、逐镜生成、拼接

这套工作流 Muse 承包拆分镜、写提示词、生成资产、质检、拼接,我只干两件事:拍板,审片。规矩是「一镜一确认」——生成一条,我看过点头,再做下一条。

基本还原了我之前开放的这个产品的核心方法论。

四、栽在了中文配音上

于是我把漫剧工作台现有的《长安异闻》剧本发给它,让它去实测效果。

流程跑起来后,第一个大坑出现在中文题材上。Muse 的视频模型在配音和文字这两块很薄弱,我结结实实撞了两次:

第一次,「边跑边喊」全军覆没。《长安异闻》里我要一个镜头:阿七边跑边喊「让一让」,纯背影。第一轮三版全是哑巴,一句台词没有;第二轮三版有声音了,但每到喊话那一秒,阿七必转头对着镜头喊。我写了三种不同强度的「不许转头」,全被击穿。最后我拍板:台词取消,用最早那版的第 4–10 秒,纯奔跑。

第二次,「沈书吏」念成「行速力」。中文对白的发音是模型的系统性缺陷,重拍解决不了。后期配音我也试了,TTS 的台湾口音被我自己否了——「还是老外味」。

这个过程我起码调整了有 3 个小时,最后实在不想抽卡了,我就把这个半成品发到了 X,很快就有了大量的曝光,同样大家也感受下效果:

上面这个问题让我认清现实:做漫剧不是「实现导演意图」,而是「在模型的可达域内找最优解」,导演意图得给模型能力让路。

五、让 Muse 去啃 Seedance 2.5 的官方文档

既然拼的是提示词,那我就把提示词这件事做到极致。

我找来 Seedance 2.5 的官方提示词文档,让 Muse 逐字学习、总结 prompt 技巧;又对照了 Higgsfield 开源 AI 长片《Hell Grind》的方法论(人家用 Seedance 做了 95 分钟,全套 prompt 开源)。两边校准完,几条关键结论直接改了我的打法:

  • 资产先行:Higgsfield 的原话——「不锁定全部资产,一个镜头也不生成」。人物描述词一旦冻结,每个分镜提示词里一字不许改,「模型没有记忆,少描述一句,下一镜他就换脸换夹克」。
  • 三视图人物锁被官方劝退:我之前用三视图锁人物,官方文档明确说不要——模型会把同一角色的不同角度认成不同的人。改成「面部特写+全身照」。
  • 英文写描述,中文说台词:Aqi says in Mandarin {让一让,让一让},人名加拼音注音,专治发音跑偏。
  • 否定约束只对字幕和音频有效,画面上想「不要」什么,得用肯定式表达。
  • 情绪不写抽象词:不写「悲伤」,写「低头、肩膀轻颤、手指无意识攥衣角」。
  • 一镜只许一种运镜,复杂动作必须放开场。

六、最后跑通的流程长这样

融合 seedance 提示词技巧和我的实战教训,现在的标准流程是:

  • 剧本 → 分镜表:Muse 拆成 18 镜,标景别、运镜、动作、对白落点;我审故事,锁定
  • 资产清单:Muse 从分镜表反推人物/场景/道具,写生成提示词
  • 生成资产:Muse 生成+同框测试;我验收,锁定
  • 逐镜提示词:Muse 英文描述+中文台词,资产描述逐字复用
  • 逐镜生成:Muse 生成 → 质检(逐秒验帧/剧本对照/台词试听);我逐镜确认
  • 拼接交付:Muse 拼接、调色、每条首尾各剪半秒;我终审

两条红线:

  • 一镜 10–15 次迭代不收敛就简化镜头,不许烧生成次数;
  • 原生对白做不出来就改镜头设计,永远不走后期配音。

实战数字:一个分镜平均 3–4 次生成换 1 条可用,一集 18 镜,50–70 次生成是常态。慢,但是可控。

七、你也可以照着来

分三层,对号入座,别跳级。

第一层:先玩转 10 秒。

别一上来就想做剧。先让 Muse 给你生成一个 10 秒的镜头:一个人、一个动作、一种运镜、一句台词,全写进提示词里。你会立刻碰到真实的问题——人物长得对不对、台词出没出声、运镜飘不飘。把这一个镜头玩明白,提示词的手感就有了。Seedance 的官方文档这时候再去读,每句话你都看得懂。

第二层:拿流程跑通一集。

找个 3 分钟的小故事,走完整整六步:分镜表 → 资产 → 锁定 → 逐镜生成 → 拼接。重点不是成片有多精美,是把「资产先行」「一镜一确认」「一次改一行」这三条纪律练成肌肉记忆。第一集一定会翻车,翻车的记录就是你最值钱的东西——我到现在还留着每次失败的提示词版本。

第三层:跑通一集,再谈系列化。

一集跑通之后,真正的挑战才来:人物跨集一致、风格统一、生产速度。这时候再去看 Higgsfield 的开源项目,人家 95 分钟是怎么管资产、怎么写 tag 字典、怎么做生产日志的。路是一样的,只是规模变大。

一句话:10 秒练手感,一集练流程,系列化练管理。别反过来。

Muse 目前的活动诚意很足,一个账号 310 亿 token,用来做漫剧练手也不错。

我前后大概生成了 100 多个 10s 的视频,跑完周额度送的 token 就花了 1 亿

还没注册的填这个邀请码:ANS6U6

Muse 注册邀请码 ANS6U6 的邀请页面截图

我是 Jarvis,正在用 AI 做一人公司。这套 Muse 漫剧方法论目前跑通了两部剧,SOP 和踩坑记录都在持续更新。

我是 Jarvis,正在用 AI 做一人公司。这套 Muse 漫剧方法论目前跑通了两部剧,S

本文提及与引用

原文提到的内容里,已在本站整理好的可以直接接着读;标注「原文来源」的还没有整理成站内文章。

内容核验说明

这篇值得留,在于它补上了「10 秒片段」到「3 分钟一集」之间的方法缺口:六步流程、资产先行、一镜一确认,加上中文配音和台词发音这两处模型硬伤的具体表现,都是能照着试的操作细节。适合已在用 Muse 做视频、或想评估 AI 漫剧产能的人。

文中的生成次数(平均 3–4 次换 1 条可用、一集 50–70 次、100 多个 10 秒视频)、token 消耗与「跑通两部剧」均为作者自述,诀.com 未独立验证;无第三方测试或可复现的公开数据,效果不保证复现。

原始来源

原作者:Jarvis|AI 商业实验室(@jarvis11x)

本文对公开来源内容进行了结构化整理,原观点与内容归原作者所有。

查看原文