AI 短剧制作:从脚本生成到画面渲染的全链路

上周,一位做短视频运营的学员找到我,说他们团队用传统方式做一条30秒的短剧,从写本子到拍完剪辑,平均要3天,成本至少5000块。他问我:“有没有可能用AI把这个流程压缩到半天,成本降到500以内?”我的回答是:不仅可能,而且已经有人这么干了。

今天,我就把这条全链路拆开给你看。从脚本生成、角色设计、分镜绘制,到画面渲染、配音合成、最终输出,每一步用什么工具、怎么调参数、踩过哪些坑,我都会说清楚。读完这篇,你就能立刻上手做一条AI短剧。

第一步:用AI生成脚本——不是“写”,是“组装”

很多人以为AI写脚本就是丢一句“帮我写个短剧脚本”,然后等着收成品。结果往往是一堆废话。真正的做法是结构化提示词 + 分步迭代

工具:Claude 3.5 Sonnet 或 GPT-4o(2024年8月版本)
关键参数:Temperature 0.7,Max tokens 4096

实操案例:生成一个“外卖员穿越古代”的短剧脚本

Step 1:定义核心冲突
不要直接��AI写剧情,而是先让它生成3个高冲突场景。提示词模板:

你是一个专业短剧编剧。请为“现代外卖员穿越到古代宫廷”这个设定,生成3个核心冲突场景。每个场景包含:
  • 场景名称
  • 冲突类型(身份冲突/认知冲突/情感冲突)
  • 一句话梗概
  • 关键对话片段(2-3句)
  • 要求:冲突要有反转,每句话不超过15字。

    Step 2:选择场景并扩展成完整脚本
    假设我们选中了第三个场景“外卖员用手机点外卖被当成妖术”。继续提示:

    基于以下梗概扩展成完整的30秒短剧脚本:
    场景:外卖员穿越到古代皇宫,被当作妖人。他掏出手机想点外卖,却被太监当成召唤妖术。
    要求:
    
  • 格式:场景描述 + 对话 + 动作指示
  • 总对话不超过8句
  • 最后一句台词要有反转或悬念
  • 控制字数在200字以内
  • Step 3:人工微调
    AI生成的脚本大概率会偏长或节奏不对。你需要手动压缩:把“皇上,此人身上有妖物”改成“皇上,妖物!”;把“我是在点外卖啊您别误会”改成“误会!这是外卖!”

    输出结果示例(我实际生成的):

    场景:金銮殿,凌晨。外卖员小张穿着黄色冲锋衣,举着手机。
    太监(惊恐):皇上,此人怀揣妖物!  
    小张(慌):别别别,我点个外卖...  
    皇上(怒):外卖是何物?  
    小张(低声):就是...送饭的。  
    手机响起:“您的外卖已送达”  
    太监(尖叫):妖物说话了!  
    小张(无奈):得,今天又超时了。  
    

    这个脚本只有6句对话,30秒刚好。关键技巧:每句对话不超过10个字,这是短剧的黄金法则。

    AI生成的短剧脚本示例

    第二步:角色设计与分镜生成——Midjourney + ComfyUI 双线作战

    脚本有了,接下来要出画面。传统做法是找演员、搭景、拍摄。AI时代,我们直接生成角色和场景。

    2.1 角色一致性:用Midjourney生成角色三视图

    工具:Midjourney v6.1
    参数:–ar 3:4 –style raw –s 50 –v 6.1

    关键提示词结构
    [角色描述] + [服装细节] + [表情/姿态] + [背景要求] + [风格控制]

    以“外卖员小张”为例:

    A young Chinese delivery man, 25 years old, wearing yellow Meituan-style uniform, holding a smartphone, confused expression, ancient Chinese palace background, cinematic lighting, photorealistic, 8k --ar 3:4 --style raw --s 50 --v 6.1
    

    但这里有个��:Midjourney每次生成的图都不一样。要保证后续画面里主角长相一致,必须用 “角色参考”功能

    操作步骤
    1. 首先生成一张满意的正面图,下载到本地。
    2. 上传到Discord,右键复制图片链接。
    3. 新提示词末尾加上:`–cref [图片链接] –cw 50`
    – `–cw 0`:只参考面部
    – `–cw 100`:参考面部+服装+姿势
    4. 生成其他角度和表情的图。

    2.2 分镜生成:用ComfyUI实现多画面一致性

    Midjourney适合单张出图,但要生成完整的分镜序列(比如连续5个镜头),推荐用 ComfyUI + AnimateDiff

    安装配置

  • ComfyUI版本:v0.2.3+
  • 模型:Realistic Vision v6.0(写实风格)
  • 插件:AnimateDiff v3.0 + IP-Adapter v1.0
  • 实操步骤
    1. 加载第一个关键帧(用Midjourney生成的外卖员正面图)。
    2. 用IP-Adapter提取角色特征。
    3. 设置AnimateDiff参数:
    – 帧数:16帧(约2秒)
    – 步数:25
    – CFG Scale:7.0
    – 运动幅度:0.8(短剧动作不宜太大)
    4. 输入第二个关键帧(比如外卖员举起手机的动作)。
    5. 生成中间过渡帧。

    重要参数说明

  • 运动幅度(Motion Scale):0.5-0.8适合对话场景,1.0以上适合打斗。
  • 帧数(Frame Count):16帧=2秒,32帧=4秒。30秒短剧大约需要240帧(15个2秒片段)。
  • 采样器:DPM++ 2M Karras(兼顾速度与质量)。
  • ComfyUI工作流界面

    第三步:画面渲染与声音合成——从静态到动态的最后冲刺

    分镜序列生成后,需要渲染成连贯视频,并配上声音。

    3.1 视频渲染:用Topaz Video AI提升画质

    ComfyUI生成的视频分辨率通常只有512×512或768×768,直接输出会糊。必须用 Topaz Video AI v4.2 做超分。

    参数设置

  • 模型:Proteus-4(兼顾细节和速度)
  • 放大倍数:2x(从768×768到1536×1536)
  • 帧率:24fps(短剧标准帧率)
  • 去噪强度:0.3(太高会丢失细节)
  • 操作流程
    1. 导入ComfyUI输出的MP4文件。
    2. 在“AI模型”里选Proteus-4。
    3. 输出格式选H.264,码率设20Mbps。
    4. 点击“Start”渲染,一段2秒的视频大约需要1分钟(RTX 4090)。

    3.2 声音合成:ElevenLabs + Fish Audio

    短剧需要两个声音:旁白(画外音)和角色对话。

    角色对话:用ElevenLabs的“声音克隆”功能。
    1. 上传一段10秒的真人录音(可以用自己念台词)。
    2. 选择“Instant Voice Cloning”。
    3. 输入台词文本,调整参数:
    – Stability:0.5(太低会不稳定,太高会机械)
    – Similarity:0.8(越高越像原声)
    – Style Exaggeration:0.3(短剧不需要太夸张)
    4. 生成后导出WAV文件。

    旁白:用Fish Audio的免费模型。

  • 进入fish.audio官网,选“TTS”。
  • 选择“中文男声/女声”模型。
  • 输入旁白文本,设置语速1.1x(短剧旁白通常偏快)。
  • 下载MP3。
  • 合成:用剪映专业版(v5.8.0)把视频、对话、旁白、背景音乐叠在一起。

  • 视频轨道:渲染好的片段
  • 音频轨道1:角色对话(对齐嘴型)
  • 音频轨道2:旁白
  • 音频轨道3:背景音乐(选免版权的“短剧紧张”类型)
  • 总结与进阶建议

    这条全链路的关键点就三个:脚本要短、角色要稳、声音要对。如果你第一次做,可能会在角色一致性上卡住——没关系,多试几次`–cref`参数,或者换用IP-Adapter的权重。另一个常见问题是AI生成的动作不够自然,这时可以手动在ComfyUI里插入更多关键帧。

    进阶方向
    1. 实时生成:用Stable Video Diffusion替代AnimateDiff,实现单张图直接生成短视频。
    2. 多语言版本:用HeyGen的“视频翻译”��能,一键把中文短剧转成英文、日文。
    3. 交互式短剧:用ChatGPT + ComfyUI + ElevenLabs搭建实时互动系统,观众说一句话,AI当场生成下一段剧情。

    最后提醒一句:AI工具更新极快。Midjourney v7已经支持实时视频生成,ComfyUI的AnimateDiff v4也快了。保持关注官方文档和社区,别守着旧版本不放。

    常见问题 FAQ

    Q1:我用Midjourney生成的角色,在不同场景下长相不一样怎么办?
    A:这是最常见的问题。解决方法:1)用`–cref`参数并锁定`–cw 50`(只参考面部);2)在ComfyUI里用IP-Adapter提取角色特征,后续所有图都加载这个特征文件;3)如果差异还是大,手动在PS里微调面部特征后再喂给AI。

    Q2:ComfyUI生成视频太慢,有没有替代方案?
    A:有。如果只是做预览,可以用Pika Labs(pika.art)或Runway Gen-3,它们在线生成,速度更快。但质量不如ComfyUI可控。商业用途建议用ComfyUI本地跑,虽然慢但参数可调。

    Q3:短剧的配音,AI声音听起来太假怎么办?
    A:两个技巧:1)在ElevenLabs里把Stability降到0.3-0.4,让声音带一点“毛刺感”,更接近真人;2)在剪映里给音频加“电话音”或“环境混响”效果,掩盖AI味。实在不行,花200块找真人录旁白,只保留AI做对话。

    Q4:生成的视频画面闪烁怎么办?
    A:这是AnimateDiff的常见问题。解决方案:1)增加帧数(从16帧加到24帧);2)在ComfyUI里启用“Frame Interpolation”节点;3)用Topaz Video AI的“稳定”功能做后期处理。如果还闪,说明关键帧间距太大,需要插入更多关键帧。

    Q5:有没有完全免费的工具组合?
    A:有,但牺牲质量。脚本用Claude 3.5 Sonnet(免费版每天100条);角色图用Stable Diffusion WebUI(本地免费);视频用AnimateDiff(本地免费);配音用Fish Audio(免费版每天500字)。唯一需要花钱的是Topaz Video AI(试用期30天),或者用FFmpeg脚本替代,但画质会差一截。

    声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。