多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

AI视频制作全流程:从剧本分镜到剪辑合成的完整指南

AI视频制作全流程:从剧本分镜到剪辑合成的完整指南 1. 先搞清楚一条AI视频到底由哪些零件拼起来很多人第一次听到“AI视频制作”脑子里浮现的画面是打开一个软件输入一句话点一下按钮一条带剧情、有角色、有配乐、有转场的完整片子就出来了。我一开始也是这么想的结果折腾了一整天才发现这种期待本身就是最大的坑。真实的AI视频制作流程更像是在组装一台模型——每个零件单独看都不复杂但要把它们拼到一起还能跑起来中间有大量需要手动衔接的环节。一条完整的AI视频拆开来看至少包含五个核心模块剧本与分镜、视觉素材生成、动态化处理、配音与音效、剪辑与合成。这五个模块各自有对应的工具链而且它们之间的衔接方式决定了你最终成片的效率和质量。我见过太多人卡在“画面生成了但动不起来”或者“动起来了但口型对不上”这类问题上本质上就是没有提前想清楚模块之间的数据该怎么流转。这篇文章要解决的问题很具体让一个完全没有接触过AI视频制作的人从零开始走通一条完整的生产链路。不管你是想做3D古风短片、动漫风格的漫剧还是简单的口播视频这套流程框架都是通用的。我会把每个环节的工具选型逻辑、参数设置思路、以及我实际踩过的坑都摊开来讲。你不需要有编程基础也不需要会画画或者剪片子但你需要有耐心——因为AI视频制作目前还不是一个“一键完成”的事情它更像是一个需要反复调试的手工活。提示本文涉及的AI视频生成工具均为公开可获取的常规创作工具所有操作均在合规范围内进行。涉及提示词的部分我会重点讲设计思路而非具体敏感内容。2. 剧本和分镜别急着打开AI工具先把纸上的事想清楚2.1 为什么剧本阶段决定了后面80%的返工率我刚开始做AI视频的时候最大的毛病就是“边做边想”。打开AI绘画工具先随便生成几张图看看效果觉得不错再想下一步。这种做法在单张图片创作时问题不大但放到视频制作里就是灾难。因为视频的核心是连续性——角色要一致、场景要连贯、动作要能接上。如果你没有提前规划好每个镜头的内容后面生成出来的素材根本拼不到一起。剧本阶段要解决的问题其实就三个谁、在哪、做了什么。听起来很简单但落到AI视频制作的具体场景里你需要把这三个问题拆解到每一个镜头。比如“一个穿白衣的剑客在竹林里练剑”这句话在剧本阶段就要拆成镜头1是竹林全景镜头2是剑客拔剑的特写镜头3是剑花飞舞的中景镜头4是收剑入鞘的远景。每个镜头对应一张关键帧图片而每张图片都需要用提示词去精确描述。我自己的习惯是用一个简单的表格来管理分镜字段包括镜号、画面描述、景别、角色状态、预计时长、对应提示词关键词。这个表格不需要多专业用Excel或者飞书表格都行关键是让每个镜头的信息都落在纸面上而不是留在脑子里。2.2 分镜脚本的写法给AI看的和给人看的不是一回事这里有一个很多人忽略的关键点给人看的分镜脚本和给AI用的提示词是两套语言。给人看的分镜可以写“画面唯美、氛围感强”但AI看不懂这种描述。你需要把“氛围感强”翻译成具体的视觉元素是逆光还是侧光是暖色调还是冷色调是浅景深还是大景深举个例子同样是“古风女子在月下抚琴”这个场景给人看的分镜可能就一句话但给AI的提示词需要拆成主体描述年轻女性、古装、长发、动作描述双手抚琴、微微低头、环境描述夜晚、满月、庭院、石桌、光影描述月光从左侧打来、面部有柔和阴影、风格描述3D渲染、中国古风、电影级质感。这些要素缺一个生成出来的画面就可能偏离你的预期。我一般会在分镜表格里直接写好每个镜头的完整提示词这样到了生成阶段直接复制粘贴就行不用临时想。提示词的长度控制在50到80个词之间比较合适太短了信息不够太长了AI会抓不住重点。2.3 角色一致性从第一帧就要开始控制角色一致性是AI视频制作里最让人头疼的问题之一。同一个角色在不同镜头里长得不一样观众一眼就能看出来整个片子的质感就崩了。解决这个问题的方法有几个层次最基础的做法是在每个镜头的提示词里都重复描述角色的核心特征比如“黑色长发、白色汉服、腰间佩玉”。但这种方法只能保证大方向不跑偏细节上还是会有差异。进阶的做法是使用角色参考图。很多AI绘画工具支持上传一张参考图让生成的新图片在角色特征上向参考图靠拢。我的经验是先用提示词生成一张满意的角色定妆照然后把这张图作为后续所有镜头的参考图。参考强度一般设置在0.6到0.75之间太低了不起作用太高了会导致所有画面都长得差不多。还有一个技巧是固定随机种子。大部分AI绘画工具都支持设置seed值相同的seed加上相同的提示词会生成相同的图片。虽然不能完全保证一致性但至少能减少随机性带来的偏差。3. 视觉素材生成从文字到画面的关键参数怎么调3.1 工具选型的底层逻辑没有最好的只有最合适的市面上的AI视频生成工具大致可以分成三类文生图工具、图生视频工具、一体化视频生成工具。这三类工具的使用逻辑完全不同选错了工具会让你的工作流变得极其别扭。文生图工具负责把文字变成静态画面这是整个流程的基础。图生视频工具负责让静态画面动起来比如让头发飘动、让水流起来。一体化工具则是输入文字直接输出视频看起来最方便但可控性最差适合做简单的氛围短片不适合有明确剧情和角色要求的项目。我的建议是如果你要做有剧情、有角色的视频走“文生图图生视频”的组合路线。虽然步骤多了但每个环节你都能控制。一体化工具目前更适合做抽象风格或者风景类的短视频角色一多就容易翻车。3.2 提示词设计的核心框架四层结构法提示词设计是AI视频制作里最核心的技能没有之一。我总结了一个四层结构法基本上适用于所有主流的AI绘画和视频生成工具第一层是主体层描述画面里有什么。包括角色特征、服装、动作、表情。这一层要具体到颜色、材质、款式比如“白色丝绸汉服”就比“白色衣服”好“微微侧头微笑”就比“表情自然”好。第二层是环境层描述主体所处的空间。包括地点、时间、天气、背景元素。比如“竹林深处、清晨、薄雾、石板小径”。环境层决定了画面的氛围基调。第三层是光影层描述光线方向和质感。这是很多人会忽略的一层但它直接决定了画面的高级感。比如“逆光、边缘光、柔和阴影”和“顶光、硬阴影”出来的效果完全是两个档次。第四层是风格层描述整体的视觉风格。比如“3D渲染、电影级质感、中国古风、超高清”。风格层要放在提示词的最后因为大部分AI工具对末尾关键词的权重分配会有所不同。这四层加起来控制在60到80个词用逗号分隔不要写成完整的句子。AI工具对关键词的识别效率远高于对自然语言句子的理解。3.3 参数设置采样步数、CFG、分辨率的实际影响除了提示词AI绘画工具还有几个关键参数需要调整。我用一个表格来说明它们的作用和推荐值参数名称作用推荐范围调整逻辑采样步数控制生成过程的精细度25-40太低画面粗糙太高收益递减CFG值控制提示词的遵循程度7-12太低AI自由发挥太高画面僵硬分辨率控制输出图片尺寸1024x1024起低于这个值细节丢失严重随机种子控制生成结果的随机性固定值固定后可复现相同结果采样步数我一般设在30左右这是一个性价比比较高的值。CFG值要看具体工具有些工具7到9比较合适有些可以到12。分辨率方面如果你的最终输出是横屏视频建议生成1920x1080的图片如果是竖屏短视频生成1080x1920。分辨率不够的话后面放大时会损失细节。注意不同工具的参数名称可能不一样比如有的叫“迭代步数”有的叫“采样步数”但底层逻辑是相通的。理解每个参数在控制什么比记住具体数值更重要。3.4 从静态到动态图生视频的三种驱动方式静态图片生成好之后下一步是让它动起来。目前主流的图生视频工具有三种驱动方式第一种是运动笔刷你手动在图片上画出希望运动的区域和方向比如在头发上画一个向下的箭头头发就会向下飘动。这种方式控制最精确但操作最繁琐适合做局部细节动画。第二种是运动强度参数你设置一个整体运动强度值AI会自动判断画面中哪些元素应该动。这种方式最省事但可控性差有时候背景会莫名其妙地动起来。第三种是轨迹控制你指定某个物体从A点移动到B点AI会生成中间的过渡帧。这种方式适合做镜头推拉或者物体位移。我自己的习惯是主体动作先用运动笔刷精确控制环境动态用运动强度参数辅助。比如人物说话的场景嘴部和头部的运动用笔刷控制背景的树叶飘动用强度参数带一下。这样出来的效果比较自然不会出现“整个人都在晃”的诡异感。4. 配音、音效与剪辑让画面真正变成“视频”4.1 AI配音的选择音色、语速、情感三个维度画面动起来之后如果没有声音它依然只是一段“动态图片”。配音是让视频产生叙事感的关键。目前AI配音工具已经相当成熟选择的时候主要看三个维度音色方面男声、女声、少年音、老年音这些基础选项都有但更重要的是音色和角色的匹配度。一个古风剑客配一个现代感很强的播音腔观众分分钟出戏。我的做法是先用文字描述角色的性格和年龄然后在配音工具里找最接近的音色试听三到五个再定。语速方面默认语速通常是每分钟240字左右但古风题材建议降到200字左右给观众留出品味画面的时间。如果是快节奏的解说类视频可以提到260字以上。情感方面现在的AI配音工具大多支持情感标签比如“平静”“激动”“悲伤”“温柔”。不要小看这个功能同一句话用不同情感读出来效果天差地别。我一般会在剧本阶段就标注好每句台词的情感倾向配音时直接选对应的标签。4.2 音效和配乐别让BGM盖过一切音效和配乐是很多人会敷衍的环节但恰恰是这些细节决定了视频的“完成度”。我的原则是环境音效铺底动作音效点睛配乐控制情绪但不抢戏。环境音效比如风声、雨声、鸟鸣、街道嘈杂声音量控制在-25dB到-20dB之间刚好能感觉到但不注意不到。动作音效比如脚步声、拔剑声、关门声音量可以到-15dB左右要清晰但不刺耳。配乐的音量一般控制在-20dB到-18dB有人声台词的时候要自动 ducking 到-25dB以下。配乐的选择要和画面风格统一。古风视频配电子乐不是不行但需要很强的剪辑功力才能不违和。新手建议先从风格匹配的曲库开始选等熟练了再尝试混搭。4.3 剪辑合成时间线、转场、字幕的实操要点所有素材准备好之后最后一步是在剪辑软件里把它们拼起来。这一步看起来最简单但实际上有很多细节会影响成片质量。时间线方面每个镜头的时长建议控制在3到5秒。太短了观众来不及看清画面太长了节奏会拖沓。对话场景可以适当延长到6到8秒但要有景别变化来维持视觉新鲜感。转场方面新手最容易犯的错误是滥用花哨转场。叠化、划像、缩放这些转场偶尔用一次可以但大部分镜头之间用硬切就够了。硬切最自然也最不容易出错。只有在时间跳跃或者空间转换的时候才需要用转场来提示观众。字幕方面如果是口播类视频字幕是必须的。字体选择上古风视频用宋体或楷体现代视频用黑体或圆体。字号要保证在手机屏幕上也能看清一般占画面宽度的80%左右。字幕出现的时间要和语音对齐误差控制在0.2秒以内。5. 常见问题与排查技巧实录5.1 画面崩坏角色变形、多手多脚、面部扭曲这是AI视频制作中最常见的问题几乎每个人都会遇到。原因通常是提示词冲突或者模型对某些姿势的理解不到位。排查思路是这样的先检查提示词里有没有相互矛盾的描述比如同时写了“正面视角”和“侧脸”。然后检查分辨率是不是太低低分辨率下AI容易把细节画糊。如果都没问题尝试增加负面提示词把“多余的手指、变形的手、扭曲的面部”加进去。最后的手段是换一个随机种子重新生成有时候就是运气问题。5.2 动态不自然画面抖动、物体漂移、动作僵硬图生视频阶段最常见的问题是动态不自然。画面整体抖动通常是因为运动强度设得太高降到中等水平试试。物体漂移比如背景里的树莫名其妙地移动这是因为AI把不该动的区域也判定为运动区域了需要用运动笔刷把静止区域锁定。动作僵硬一般是关键帧太少导致的可以尝试增加中间帧或者换一个运动模式。5.3 音画不同步口型对不上、音效延迟音画不同步在剪辑阶段很容易修复但如果是AI生成的口型动画对不上那就需要在生成阶段解决。目前AI口型同步工具已经比较成熟输入音频和人物面部图片就能生成对应的口型动画。如果对同步精度要求不高也可以在剪辑软件里手动微调音频位置前后移动几帧就能对齐。5.4 常见问题速查表问题现象可能原因排查步骤解决方案角色每张图长得不一样缺少角色参考检查是否使用了参考图固定角色参考图和种子画面模糊细节丢失分辨率不足检查输出分辨率提高生成分辨率视频抖动明显运动强度过高检查运动参数降低运动强度背景物体乱动运动区域误判检查运动笔刷设置锁定静止区域配音和画面不搭音色或语速不合适试听对比更换音色调整语速成片节奏拖沓单镜头时长过长检查时间线缩短镜头或增加景别变化5.5 我踩过的三个印象最深的坑第一个坑是忽略音频采样率。我一开始用AI配音工具导出的音频是48kHz但剪辑软件的项目设置是44.1kHz结果导出后音频出现了轻微的变调。后来统一成48kHz就没问题了。这个坑很小但排查起来很费时间。第二个坑是过度依赖一体化工具。我试过用一体化工具直接生成带剧情的视频结果角色在第三个镜头就变成了另一个人而且完全没法控制。后来老老实实回到“文生图图生视频”的流程虽然步骤多了但每个环节都可控。第三个坑是忘记备份中间素材。AI生成有随机性有时候第一版效果最好但你没保存后面怎么调都调不回来了。现在我养成了习惯每个满意的中间结果都单独存一份标注好参数和种子值。6. 关于效率和质量的平衡我的一些实际体会做AI视频这件事最容易陷入的误区是追求“全自动”。市面上确实有一些工具宣称可以一键生成完整视频但实际用下来你会发现要么风格千篇一律要么根本没法控制剧情走向。真正能拿得出手的作品背后一定有大量的人工干预和反复调试。我的工作流经过多次迭代目前稳定在这样一个节奏剧本和分镜占20%的时间素材生成占50%动态化和配音占20%剪辑合成占10%。素材生成之所以占这么多时间是因为需要反复抽卡——同样的提示词生成十次可能只有两三次能达到可用标准。这不是工具的问题而是目前AI生成技术的固有特性。另外一个体会是提示词工程的核心不是写得多花哨而是写得足够具体。我见过很多人把提示词写成诗什么“月光如水洒在青石板上”AI根本理解不了。改成“夜晚、满月、石板路、月光从上方照射、地面有反光”效果立刻就不一样了。AI需要的是视觉元素清单不是文学修辞。最后分享一个提高效率的小技巧建立自己的素材库。把每次生成的好看的背景、道具、光影效果都分类存好下次做新项目的时候可以直接调用或者作为参考图。我现在的素材库里有几百张分类好的图片做新片子的时候至少能省掉三分之一的生成时间。这个习惯看起来不起眼但日积月累下来效率提升非常明显。
返回列表