用 Seedance 2.5 拍 AI 短片:从剧本到成片的完整流程与踩坑

先看一组数字:一部 6 分钟的 AI 短片,两个人做了 12 天,累计消耗 3000 多元的积分额度,主力工具是 Codex 加 Seedance 2.5。

这是爱范儿团队最近公开的一次完整尝试。他们把过程写成了图文,其中最值得拿去复用的部分,不是某一套提示词模板,而是「哪一步最容易返工」。如果你也准备碰 AI视频生成,这篇复盘基本把常见弯路走了一遍。

图|如果不看制作过程,你能分辨出这是AI生成的画面吗?今天这

整条链路拆下来是四步:打磨剧本、建立资产库、生成视频、后期制作。换成传统片场的说法,就是写剧本、找演员、选服装、搭场景、拍摄,再进剪辑。区别只在于,演员、摄影棚和摄影机都被搬进了电脑。

剧本:别急着生成,先让 AI 把动作写清楚

图|从前期策划到最终成片,我们把制作过程拆成了四个阶段先说明

他们把第一步留给了剧本,花掉整整一天。做法是先研究原著、电影、预告片和公开设定,讨论出故事框架,再把框架和整理好的资料交给 AI,让它按标准剧本格式补情节和人物对白,出稿后人工逐场核对。

这里有个技巧值得单独拎出来:不要让 AI 只交代「发生了什么」,还要让它写清人物「怎么做」——动作的先后顺序、表情的细微变化、说话时的情绪,以及人物之间的位置关系。剧本写得越具体,后面改写成视频提示词时,歧义就越少。

AI给出初稿后,我们再人工检查每一场戏的细节,确认人物动作、

他们给这一步定的目标很实在:不是把剧本写得更像文学,而是让它更容易被执行。

资产库:决定成片气质,也是返工最多的地方

剧本定稿之后是资产库,包括角色外形、服装、道具和场景设定。它既决定整部片子的美学风格,也决定同一个人物换到下一个镜头后,会不会突然变成另一个人。

图|需要反复调用的素材,最好在生成视频前统一准备好但这里有一

踩得最深的坑出在版权上。为了接近电影的视觉气质,他们一开始直接上传了电影截图作为参考,生成效果确实不错,甚至有些「太不错了」——资产传到 AI 视频平台之后,触发了版权保护审核,视频没法继续生成。

于是,我们重新调整了资产,保留低饱和色彩、荒漠质感、空间尺度

补救的办法是把资产整体重做一遍:保留低饱和色彩、荒漠质感、空间尺度这类抽象视觉特征,重做人物轮廓、服装结构和道具细节;弗雷曼人的蓝眼睛、蒸馏服上的过滤塞这种辨识度很高的元素直接去掉。这轮返工前后用了三天,先花两天生成图片资产,再花一天集中调整,才得到一套能继续用的素材。

我们前后花了两天生成图片资产,又多用一天集中调整,才得到一套

还有一个细节关系到工具选择:网页版 GPT 生成的图片在反复修改后出现越改越糊的情况,所以图片资产的后续调整,他们挪到了 AI 编程工具里完成。

提示词:30 秒的视频,按秒拆时间线

图|提示词和参考素材要一一对应,避免模型混淆角色与场景真正拉

视频生成的操作本身并不复杂:把对应角色、场景和道具上传到对话框,附上提示词,再逐一 @ 需要引用的素材,选好模型、画幅、分辨率和时长就能提交。

乍看之下,它们很长、很复杂,但拆开来看核心只有三层:整体概述

真正拉开结果差距的是提示词。他们整理出来的提示词乍看很长很复杂,拆开看核心只有三层。

图|这段30秒提示词被拆成多个时间区间,每一段只安排有限动作

第一层是整体概述,说清这一段发生什么、采用怎样的摄影风格、人物处于什么情绪。第二层是分时段时间线,标出每个时间区间里人物站在哪里、做什么,镜头如何移动,表演节奏怎样变化。第三层是约束条件,明确哪些元素不能出现、哪些动作不要发生、哪些画面必须保持一致。

最后再加上约束性提示词,明确告诉AI哪些内容不能出现、哪些画

换个说法就是:概述负责说明「为什么拍」,时间线负责说明「怎么拍」,约束词负责提前排除最常见的失控画面。

Seedance 2.5 一次能生成 30 秒,但时长越长,提示词越不能含糊。镜头运动、人物走位和表演节奏,只要有一项没说清楚,后面就容易逐渐失控——人物可能突然换位,动作次序可能颠倒,原本克制的表演也可能变得夸张。所以他们的做法是把视频按秒拆成时间线,分段交代位置关系、表情神态、肢体动作和台词语气,最后再补一段否定式的约束。把要求提前说清楚,既能提高镜头的可控性,也能减少反复抽卡的次数,说到底还是给自己省钱。

图|角色、场景、道具和生成结果集中在一张画布里,方便继续延展

工具层面还有两个功能值得一提。一个是自由画布,可以把一场戏需要的人物、场景和道具集中放在一起,先选中一部分素材生成关键片段,再以它为基础向外延展镜头。实际用下来,他们仍以 Agent 对话为主,画布用来管理素材、组织镜头。另一个是局部编辑:某个镜头里多了一艘飞船,纯靠文字描述,AI 未必能判断是哪一艘、在哪个位置、其他内容要不要动,直接框选那块区域再补一句修改要求,结果通常比纯文字稳定。

对新手来说,可以先打开Agent模式里的画布开关,从对话开始

后期:生成的是素材,剪辑才决定能不能成片

AI 短片很少一次生成到位,它更像一个不断生成、筛选和重新组合的过程。一段 30 秒的视频里,可能只有几秒真正精彩,但只要那几秒足够好,它就能成为成片里的一个有效镜头。所以每一次生成的结果都保留下来,进剪辑软件重新挑选,微调节奏之后再组合,最后补上音乐、音效和字幕。

图|只框选需要修改的区域,可以尽量保留原镜头里的构图生成结束

这套流程能复用到哪里

两个人、12 天、3000 多元的积分额度,换来一部 6 分钟的作品,这个体量当然没法跟工业级项目比。但有个参照挺有意思:一部 95 分钟、画面全部由 AI 生成的长片《Hell Grind》在戛纳的活动上做过放映,团队 15 人,资产准备之后生成阶段用了 14 天,总预算低于 50 万美元,他们后来还开放了完整项目资料,包括每场戏背后的提示词、资产和生成记录。

图|同一个镜头的多个版本都会保留,最终只选最合适的几秒画面拼

把两边的工作流放在一起看,逻辑其实是同一套:先把剧本、角色和场景变成可重复调用的资产,再选择合适的工具生成镜头,最后靠人工筛选和剪辑,把素材变成真正的作品。

他们最后给出的结论也很直接:与其在每一个新出的 AI工具 上追着跑,不如把时间花在剧本、资产管理、镜头调度和后期判断上。模型会不断更新,这些能力会留在创作者手里。

项目由15人团队制作,在花大量时间准备好资产库之后,生成阶段