AI漫剧制作全教程 · 课程总览与学习规划

写于 2026-08-22

📌 课程来源:AI漫剧制作全教程(2026全新内容) 🎤 讲师:老程 📝 形式:分集精简笔记(干货 + 实操案例) 📊 体量:约 8.6 万字 → 结构化提炼版


📚 五大模块总览

本课程共 12 集,分为 5 大模块,从认知入门到实战进阶,循序渐进:

模块 包含集数 主题 核心目标
模块一 01 / 02 / 03 认知入门与工具准备 建立全流程认知,装好工具
模块二 04 / 05 / 06 / 07 AI编剧心法 学会和AI沟通,写出好剧本
模块三 08 / 09 静帧画面生成 掌握提示词,生成高质量静帧
模块四 10 / 11 动态视频制作 让画面动起来,学会运镜叙事
模块五 12 人物一致性(核心难点) 解决人物变脸问题

模块一:认知入门与工具准备

序号 笔记文件 核心内容
01 01-AI漫剧实操教程·总览篇 全流程SOP、市场前景、学习路线图
02 02-ComfyUI入门与安装 软件介绍、安装部署、56个内置功能
03 03-AIGC基础与视频生成原理 AIGC概念、应用场景、技术路线

模块二:AI编剧心法

序号 笔记文件 核心内容
04 04-AI沟通大法 提示词方法论、6大沟通原则
05 05-Markdown剧本格式规范 剧本格式、排版语法、模板
06 06-AI编剧常见问题 AI编剧坑点、质量控制
07 07-三幕剧结构详解 叙事学基础、故事结构

模块三:静帧画面生成

序号 笔记文件 核心内容
08 08-文生图提示词实战与避坑 提示词万能公式、纠错指南
09 09-Gemini实战指南 Gemini 2.5 Pro 实操技巧、模板

模块四:动态视频制作

序号 笔记文件 核心内容
10 10-图生视频与动态效果 图生视频、动态效果、常见错误
11 11-动态运镜与镜头语言 镜头语言、运镜叙事、节奏控制

模块五:人物一致性(核心难点)

序号 笔记文件 核心内容
12 12-即梦人物一致性实战 智能参考 / 人像特征 / 人像写真

🔧 工具链全景图

【前期·剧本】                  【中期·画面】                【后期·成片】
  豆包 / Gemini ──→ Markdown剧本 ──→ 分镜拆解
                                         │
                                         ▼
                 ┌───────────┴───────────┐
                 ▼                       ▼
            即梦AI(在线)          ComfyUI(本地/云端)
            智能参考                 Flex Context
            人像特征                 LoRA / ControlNet
            人像写真                 万物迁移工作流
                 │                       │
                 └───────────┬───────────┘
                             ▼
                       静帧图片素材
                             │
                             ▼
                       图生视频动态化
                             │
                             ▼
                  配音 + 剪辑 + 字幕 = 成片

🎯 学习路径建议

零基础路线(推荐顺序)

Step 1: 01 总览篇 ─────────→ 建立全流程认知,知道每一步在干什么
    ↓
Step 2: 模块二 编剧(04-07)→ 内容为王,先学会和AI沟通写剧本
    ↓
Step 3: 模块三 画面(08-09)→ 掌握提示词,生成合格的静帧
    ↓
Step 4: 模块五 一致性(12)─→ 解决最核心的人物统一问题
    ↓
Step 5: 模块四 动态(10-11)→ 让画面动起来,加上运镜
    ↓
Step 6: 模块一 工具(02-03)→ 按需回看工具部署细节

速查路线(遇到问题直接跳转)

遇到的问题 直接看哪一集
人物不一致、变脸 第12集 · 即梦人物一致性实战
写不出好剧本、AI写的太烂 第 4 / 6 / 7 集
画面效果差、提示词不会写 第8集 · 文生图提示词实战
视频不动 / 动得奇怪 / 崩坏 第 10 / 11 集

📝 笔记使用说明

每篇笔记的统一结构

📌 本章核心知识点          ← 一句话知道本章学什么
🔧 涉及工具 / 📋 前置知识   ← 需要准备什么

一、正文(按逻辑分小节)
   - Step 1/2/3 操作步骤
   - 表格对比 / 案例展示
   - ```提示词/代码``` 示例块

💡 实操技巧               ← 讲师踩坑总结的经验
⚠️ 常见误区               ← 新手高频错误,务必注意
📝 本章小结               ← 一句话回顾核心

符号速查表

符号 含义
💡 经验技巧,来自讲师实操踩坑
⚠️ 新手高频错误,务必注意
🔧 涉及的工具 / 软件
📋 学习本章需要的前置知识
⭐ 重点推荐 / 最常用
❌ 错误做法 / 不推荐
✅ 正确做法 / 推荐

📂 文件清单

./
├── 00-课程总览与学习规划-整理版.md     ← 本文件
├── 01-AI漫剧实操教程·总览篇-整理版.md
├── 02-ComfyUI入门与安装-整理版.md
├── 03-AIGC基础与视频生成原理-整理版.md
├── 04-AI沟通大法-整理版.md
├── 05-Markdown剧本格式规范-整理版.md
├── 06-AI编剧常见问题-整理版.md
├── 07-三幕剧结构详解-整理版.md
├── 08-文生图提示词实战与避坑-整理版.md
├── 09-Gemini实战指南-整理版.md
├── 10-图生视频与动态效果-整理版.md
├── 11-动态运镜与镜头语言-整理版.md
└── 12-即梦人物一致性实战-整理版.md

🔄 更新记录

  • 2026-08-22:创建总览规划,完成全部 12 集结构化整理

01 · AI漫剧实操教程(总览篇)

📌 核心知识点 - AI漫剧是2026年内容风口,平台扶持力度大(高分成 + 保底激励) - 全流程6步走:剧本 → 分镜 → 静帧 → 动态 → 配音 → 剪辑 - 人物一致性是核心难点,有即梦(在线)和 ComfyUI(本地)两套方案 - 零基础可上手,不需要画画基础,不需要高端显卡

🔧 涉及工具:豆包 / Gemini(编剧)、即梦AI、ComfyUI、Topaz Video(放大)、剪映 / PR(剪辑) 📋 前置知识:无(零基础入门)


一、为什么做AI漫剧:市场与机会

1.1 风口现状

维度 具体情况
市场规模 千亿级蓝海市场,正在爆发
平台分成 高达 90% 的分成比例
激励政策 官方保底激励,作品入库即有收益
变现方式 流量分成 + 贴片广告

1.2 门槛已被AI打破

很多人犹豫的两个问题: - ❓ 我不会画画 → AI时代,不需要画画基础 - ❓ 买不起显卡 → 在线工具(即梦等)免费可用,本地方案也有低配路线

💡 你缺的只是一套标准化的 SOP 流程。只要有一台电脑,你就等于拥有了一个动漫工作室。

1.3 本期案例:千手观音的由来

本教程以「千手观音的由来」为实战案例,贯穿全流程讲解。故事梗概:

妙庄国王有三女,小女妙善天性慈悲、淡泊名利。妙庄王欲为其安排婚事以巩固权势,妙善拒绝,被贬为庶民,往香山修行。多年后妙庄王身染恶疾,需至亲至仁者的双手双眼入药。妙善得知后,毅然割手挖眼为父治病。妙庄王痊愈后前往香山,见女儿惨状痛悔祈祷。忽金光万丈,佛陀降临,妙善化作千手千眼之圣像,普度众生。


二、全流程 SOP 总览

AI漫剧制作共分 7 大环节,环环相扣,前一步是后一步的基础:

┌─────────────┐    ┌─────────────┐    ┌─────────────┐    ┌─────────────┐
│  1. 剧本创作  │ →  │  2. 人设+分镜 │ →  │  3. 静帧生成  │ →  │  4. 图生视频  │
└─────────────┘    └─────────────┘    └─────────────┘    └─────────────┘
                                                                   ↓
┌─────────────┐    ┌─────────────┐    ┌─────────────┐
│  7. 最终输出  │ ←  │  6. 剪辑合成  │ ←  │  5. 配音配乐  │
└─────────────┘    └─────────────┘    └─────────────┘

各环节核心产出

步骤 环节 核心产出 关键工具
1 剧本创作 完整故事剧本(含风格定位、角色、对白) 豆包 / GPT / Gemini
2 人设 + 分镜 人物设定表 + 分镜脚本 + 初始 Prompt 大语言模型 + 飞书文档
3 静帧生成 每个分镜对应的静态图片(人物一致、风格统一) ComfyUI / 即梦 / MidJourney
4 图生视频 每个分镜的动态视频片段 可灵 / 即梦 / ComfyUI(Fusion X)
5 配音配乐 旁白 + 角色配音 + BGM + 音效 各类 TTS 工具
6 剪辑合成 拼接片段、加字幕、调色、转场 剪映 / PR
7 最终输出 视频放大、导出成片 Topaz Video / 剪辑软件

三、第一步:剧本创作

3.1 剧本包含的四要素

故事脚本
  ├── ① 故事剧本(整体框架、情节走向)
  ├── ② 人物设计(服装、外形、性格、行为特点)
  ├── ③ 分镜脚本(逐镜头拆解)
  └── ④ Prompt 初始生成(人物 + 分镜的提示词预备)

⚠️ 为什么要提前生成人物和场景的 Prompt? 为了保证人物一致性。前期把人物特征、风格的 Prompt 统一好,后续每一张图都基于同一套描述,人物才不会"变脸"。

3.2 剧本怎么写:交给大语言模型

操作步骤:

  1. 你先有一个灵感或主题(例如:千手观音的由来)
  2. 把主题丢给大模型,让它帮你发散成完整剧本
  3. 在模型产出的基础上,融合你自己的想法进行修改

参考 Prompt 模板:

你是一个专业的动画编剧。
现在请以「千手观音的由来」为主题,
帮我生成一个一分半钟以上的动画剧本。

产出示例(千手观音案例):

项目 内容
标题 千手观音的由来
总时长 约 1 分 50 秒
风格定位 古风写意、感人、神话
目标受众 青少年及以上,对传统文化或神话故事感兴趣的观众
结构 片头 + 起承转合 + 高潮 + 结尾

四、第二步:人物设计与分镜脚本

4.1 人物设计

人物设定必须统一的四个维度:

  1. 👕 服装外形 — 服饰、发型、配饰、颜色
  2. 😊 外貌特征 — 脸型、五官、年龄感
  3. 🧠 性格特点 — 内向 / 外向、善良 / 威严等
  4. 🚶 行为举止 — 习惯性动作、说话方式

为什么前期必须做人物设计? → 为了人物一致性。前期统一了,后续每一张图的角色才能是同一个人。不做这一步,每张图的人物都长得不一样,整部片就崩了。

参考 Prompt 模板:

请帮我生成剧本中每个人物的人物设定,
需要具备:服装外形、性格、行为特点。

4.2 分镜脚本

分镜脚本 = 把剧本拆成一个一个的镜头

每个镜头包含: - 🎬 镜头画面(场景、角色、动作) - 📷 镜头运动(推 / 拉 / 摇 / 移 / 固定) - 💬 对白 / 旁白 - 🔊 音效 - ⏱️ 持续时间

参考 Prompt 模板:

帮我把这个剧本转变成分镜脚本。
每个镜头包含:画面描述、角色、镜头运动、
对白/旁白、音效、时长。

💡 实操建议:分镜脚本建议存到飞书文档 / Notion 里,方便后续随时查阅和修改。一个分镜对应一张静帧图,有多少个分镜就要生成多少张图。


五、第三步:风格选择与工具选型

5.1 整体画风怎么定

开工前必须先定风格,否则后面每张图画风不一样,整部片就乱了。

三种画风获取方式对比:

方式 说明 难度 推荐度
找现有风格模型 网上搜现成的 LoRA(如 GBT 手办风、新海诚风、宫崎骏风) ⭐ ⭐⭐⭐⭐⭐
自己练 LoRA 截喜欢的动漫角色高清图,训练专属 LoRA ⭐⭐⭐ ⭐⭐⭐
IP-Adapter 风格迁移 用参考图迁移风格 ⭐⭐ ⭐⭐(不推荐)

❌ 为什么不推荐 IP-Adapter 控制整体风格? 容易出现颜色溢出、干扰主体、画面杂乱。质量取决于底模效果。目前仅支持 SD 1.5 和 SDXL。整体风格不建议用,但可以用在局部调整。

5.2 工具平台选择

平台 类型 优势 适合人群
即梦AI 国内在线平台 免费、V3 模型效果好、操作简单、人物一致性方案成熟 新手、快速出片
MidJourney 海外在线平台 图像质量高、有 --cref 保持人物一致 追求画质、有翻墙条件
ComfyUI 本地开源 精细控制、批量生产、可自定义工作流 进阶玩家、有一定配置

5.3 底模选择指南

根据你的电脑配置和需求选择:

底模系列 适合人群 特点
SD 1.5 AI 绘画新手 容易起步,LoRA 资源丰富,好调教,对配置要求低
SDXL 商业接单 商用插图的中坚力量,效果稳定
Flux 追求前沿效果 新一代扩散模型,高端绘画 / 影视 / 工业设计首选,出图慢、对配置要求高

💡 本教程案例使用的是 Flux 1-dev FP8 底模 + GBT 手办风格 LoRA。


六、第四步:人物形象生成(一致性关键)

6.1 为什么不能直接出图?

很多新手的误区:直接写一段提示词就出图。比如:

"可爱的人物,东方女神,云层之上,雪山背景,一个年轻女子坐在金莲座上,清纯安详的面容,白丝绸蒙眼,额上红珠纱纹,乌黑飘逸的长发,精致的发饰……"

这样出的图 每次人物都不一样,做不了连贯的动画。

🔑 人物一致性是 AI 动画短片最重要的核心问题,必须专门解决。

6.2 两种人物生成方案

方案 做法 难度 效果
简单做法 生成 1 张面部特写 + 1 张全身形象 ⭐ 基础可用
推荐做法 即梦智能参考 / ComfyUI Flex Context / InstantID 等专业方案 ⭐⭐⭐ 一致性强

简单做法原理: - 面部特写 → 用 InstantID 保证脸部一致 - 全身形象 → 保证服装、体型、姿势一致

(详细操作见后续分集)


七、第五步:分镜静帧生成

7.1 第一步:确定构图

两种出图方式:

方式 做法 优点 缺点
直接出图 根据分镜 Prompt 反复抽卡调试 灵感多、惊喜多 时间成本不可控
参考出图 找一张构图参考图,用图生图 / ControlNet 反推 构图可控、符合预期 需要找参考图

参考出图的两种技术路径: - ControlNet:控制构图,强度不要太高(否则会丢失风格) - 直接图生图:简单直接,但要注意尺寸匹配问题

7.2 第二步:细化细节(重点)

构图确定后,按顺序做三件事:

① 人物一致性  →  ② 其他画面调整  →  ③ 确定是否需要首尾帧

① 人物一致性(万物迁移法)

思路:构图确定了,但人物的脸、衣服不对 → 用「万物迁移」工作流,把正确的角色特征迁移过去。

操作步骤(ComfyUI):

  1. 打开万物迁移工作流
  2. 上方上传参考角色图(正确的服装 / 身体 / 脸部)
  3. 下方上传待调整的分镜图
  4. 右键 → 在遮罩编辑器中打开
  5. 用画笔涂抹要迁移的部位(先涂衣服 → 运行 → 再涂脸部 → 运行)
  6. 点击运行,生成调整后的图
优点 缺点
方法简单,思路直观 比较笨,需要调试
能在保留构图的前提下换角色 不太可控,不是百分百精准

② 其他画面调整

同样用局部重绘的方式处理: - 背景细节优化 - 道具 / 装饰添加 - 光影 / 色调微调

③ 确定是否需要首尾帧

  • 如果图生视频的运动幅度不大 → 一张图就够
  • 如果镜头有明显的起止状态 → 需要生成首帧和尾帧两张图,让视频模型在两者之间插值

(详细操作见后续分集)


八、第六步:图生视频与动态效果

8.1 运镜提示词怎么写

推荐公式:

镜头 + 主体 + 运动 + 其他描述

示例:

中景镜头,妙善公主静坐书房窗边诵经,镜头缓缓推近至特写,窗外雪花飘落,柔和暖光。

不会写怎么办? 把分镜图发给 GPT,让它帮你写:

[上传分镜图片]
妙善公主在书房窗户旁静坐着。
帮我根据图片写一段运镜提示词,用于可灵AI图生视频。

8.2 闭源平台 vs 开源项目

类别 代表工具 优势 劣势 推荐场景
闭源平台 可灵、即梦、Runway 质量高、人物表情自然、动作丝滑、一致性好 付费 / 有额度限制 有人物、有情感表达的镜头
开源项目 Fusion X、AnimateDiff、CogVideo 免费、可本地部署 吃配置(需 16G+ 显存)、人物情感表达弱 风景空镜、转场特效、无人物场景

8.3 重点开源模型:Fusion X

特点: - 万象 2.1 新出的视频模型 - 仅需 6~10 步 就能出高质量效果 - 比基础 One 模型快 30%~50% - 光照与运镜表现接近闭源商业模型 - 可快速导入 ComfyUI,一键上手

支持的场景: - ✅ 文生视频 - ✅ 图生视频 - ✅ 视频扩展 - ✅ 首尾帧视频生成 - ✅ 局部重绘 - ✅ 动作迁移

⚠️ 经验总结:一旦需要表达人物情感、说话,一定要用闭源模型。开源模型目前还做不好图生视频中的人物表情和口型。

(详细操作见后续分集)


九、第七步:配音、剪辑与最终输出

9.1 配音制作

根据分镜脚本中的旁白和对白,使用 TTS 工具生成音频。 - 旁白:选择合适的音色 - 角色配音:不同角色用不同音色,增强代入感 - 音效:根据场景添加环境音、动作音

(详细操作见后续分集)

9.2 剪辑合成

在剪映 / PR 中完成: 1. 把所有视频片段按分镜顺序拼接 2. 对齐配音音轨 3. 添加转场效果 4. 添加 BGM 和音效 5. 添加字幕

9.3 最终输出

  • 视频放大:用 Topaz Video 提升分辨率
  • 调色:统一全片色调
  • 导出:选择平台适配的格式和码率

💡 实操技巧

  1. 风格先定:开工前先确定整体画风(如 Q 版皮克斯 3D、国风手绘等),后续所有生成都围绕统一风格
  2. 人物从简:新手做人物一致性,角色设计越简单越好(服饰、发型不要太复杂),面部 + 全身各一张参考图即可
  3. 工具组合:即梦适合快速出图 + 智能参考,ComfyUI 适合精细控制 + 批量生产,两者结合效率最高
  4. 分镜先行:不要边想边做,先把全部分镜脚本和静帧搞定,再统一进动态环节

⚠️ 常见误区

误区 后果 正确做法
❌ 一上来就做复杂人设 人物一致性会崩 从简单角色开始练手
❌ 全程只用一个工具 各环节效果打折扣 不同工具有不同优势,组合使用
❌ 跳过剧本直接画图 没有好故事,画面再美也没人看 剧本是灵魂,先把故事讲好
❌ 追求一帧完美 进度卡死,做不完 先跑通全流程,再迭代质量

📝 本章小结

AI漫剧制作是一个标准化的 SOP 流程:

写剧本 → 拆故事 → 定人设 → 出分镜 → 做动态 → 配音效 → 剪成片

核心难点是人物一致性,但通过即梦智能参考或 ComfyUI Flex Context / 万物迁移等方案可以有效解决。

新手路径建议: 先用即梦跑通完整流程(门槛低、速度快),建立全局认知 → 再逐步深入 ComfyUI 的高级玩法,追求更精细的控制和更高的质量。


下一篇:02-ComfyUI入门与安装.md


02 · ComfyUI 入门与安装

📌 核心知识点 - ComfyUI 是一站式 AI 工具平台,官方正版免费,内置 56 个 AI 功能 - 安装三步曲:下载 → 解压 → 双击启动 - 节点式工作流,灵活可组合,适合从入门到进阶全阶段 - 2026 年 5 月新版官方原生支持中文,新手门槛大幅降低

🔧 涉及工具:ComfyUI 📋 前置知识:无


一、ComfyUI 是什么

ComfyUI 是全球公认功能最全面、生态最丰富、最贴近生产力的免费开源 AI 软件。你用它就能玩遍所有叫得上名的国内外最新最前沿的 AI 功能。

它不是野鸡套壳网站,而是全球开发者社区共同维护的顶级开源项目。

2026 年 5 月新版三大亮点(特别利好中国用户)

亮点 说明 意义
全中文官方界面 原生支持中文,不是第三方翻译插件 英文不好的朋友入门第一道坎直接抹平
56 个内置模板 官方精选 56 个经典 AI 功能,开箱即用 零基础也能直接上手,不用学节点
工作流预览 模板直接展示在工作流预览区 点一下就能用,不用自己搭节点

内置功能覆盖范围

AI绘画:文生图 / 图生图 / 扩图 / 高清放大 / 局部重绘 / 区域控制
AI视频:文生视频 / 图生视频 / 首尾帧视频 / 视频扩展
AI音频:音乐生成 / 音效生成
AI 3D:3D 建模 / 3D 渲染
  ... 以及更多前沿功能

节点式工作流的优势

特点 说明
可视化 每个节点做什么一目了然
可组合 像搭积木一样组合不同功能
可复用 调好的工作流存成 JSON,下次直接用
可分享 社区有大量现成工作流可以直接用
灵活度高 从简单到复杂,想怎么搭就怎么搭

二、安装步骤

Step 1:下载安装包

  • 从官方渠道获取正版软件
  • 已预配置 56 个 AI 功能,无需单独安装插件
  • 下载后是一个压缩包

Step 2:解压

  • ⚠️ 解压到非中文路径(路径中不要有中文和空格,否则 90% 概率报错)
  • 建议预留足够磁盘空间(模型文件较大,通常几十 GB 起步)
  • 推荐路径示例:D:\ComfyUI\ 或 D:\AI\ComfyUI\

Step 3:启动

  1. 双击启动脚本(run_nvidia_gpu.bat 或类似文件)
  2. 等待终端加载完成(第一次启动会下载必要文件,需要等一会儿)
  3. 浏览器自动打开本地地址(通常是 http://127.0.0.1:8188)
  4. 看到界面就表示安装成功了

💡 首次启动慢是正常的,需要加载模型和依赖。后续启动会快很多。


三、界面初识

界面三大区域

区域 位置 功能
左侧菜单栏 左边 节点库、工作流管理、模型管理
中间工作区 中央 节点画布,拖拽连接节点
右侧参数面板 右边 选中节点的参数调整

56 个内置模板在哪找

左侧菜单 → 工作流预览 → 选择你想要的功能模板 → 点击加载

内置模板涵盖: - 🎨 绘画类:文生图、图生图、高清修复、局部重绘 - 🎬 视频类:文生视频、图生视频、视频风格化 - 🔧 工具类:放大、抠图、上色


四、新手第一个工作流:文生图

操作路径

加载「文生图」模板 → 在正向提示词框输入描述 → 点击「生成」按钮 → 等待出图

基础文生图工作流包含的节点

节点 作用
Checkpoint 加载器 选择底模(Flux / SDXL 等)
正向提示词 描述你想要什么
负面提示词 描述你不想要什么
采样器 设置生成步数、CFG 等参数
VAE 解码图像
保存图像 输出结果

💡 新手不需要理解每个节点的原理,直接用内置模板就行。先跑通,再深入。


💡 实操技巧

  1. 路径别用中文:安装路径和模型存放路径都用英文/数字,否则容易报错
  2. 先跑通基础工作流:不要一上来就搞复杂节点,先跑通文生图基础流程
  3. 工作流可保存复用:调好的工作流存成 JSON,下次直接加载
  4. 善用社区资源:GitHub、B站、小红书上有大量现成的 ComfyUI 工作流可以下载
  5. 边用边学:不需要先学完所有节点再开始,遇到不懂的节点再查

⚠️ 常见误区

误区 后果 正确做法
❌ 盲目堆节点 节点多≠效果好,反而容易乱 理解每个节点作用,够用就行
❌ 路径有中文/空格 90% 的新手报错都是这个原因 全英文路径,如 D:\ComfyUI\
❌ 一上来就想搞复杂工作流 容易被劝退 从简单的文生图开始,逐步加功能
❌ 每次都从零搭节点 浪费时间 直接用内置模板或下载社区工作流

📝 本章小结

ComfyUI 是 AI 漫剧制作的核心工具平台,采用节点式工作流设计,灵活度极高。

  • 安装简单:下载 → 解压 → 双击启动,三步搞定
  • 门槛降低:官方中文 + 56 个内置模板,零基础也能上手
  • 上限很高:从简单文生图到复杂的视频生成工作流都能做
  • 生态丰富:全球最大的 AI 绘画开源社区,资源无限

新手建议:先加载内置的「文生图」模板跑通一次,建立信心,再慢慢探索更多功能。


上一篇:01-AI漫剧实操教程·总览篇-整理版.md 下一篇:03-AIGC基础与视频生成原理-整理版.md


03 · AIGC 基础与视频生成原理

📌 核心知识点 - AIGC = AI Generated Content,人工智能生成内容,是多模态的 - 应用场景远不止"美女跳舞":电商海报、老照片修复、动画制作、影视特效等 - AI 视频生成三大技术路线:文生视频、图生视频、视频续写 - 漫剧制作的核心路线是"图生视频"(先静后动)——人物一致性最好控制

🔧 涉及工具:各类 AI 绘画 / 视频生成工具 📋 前置知识:无


一、什么是 AIGC

基本概念

AIGC = Artificial Intelligence Generated Content 中文:生成式人工智能

落脚点是 C(Content,内容),但内容是多模态的,涵盖包罗万象。

AIGC 覆盖的内容领域

广义艺术范畴:音乐、美术、绘画、戏剧、电影 ...
        +
游戏、文本、代码、3D、视频、音频 ...
        =
  几乎所有内容生产领域

为什么 AIGC 是生产力革命

以几个行业为例:

行业 传统方式 AI 方式 效率提升
视频制作 脚本→拍摄→配音→特效→剪辑,团队几周 AI 智能体一键生成,一人几小时 数十倍
电商设计 设计师画详情页,1~2 天/张 AI 生成底图 + 排版,1 小时/张 500%+
影视特效 几十人团队,数周做 1 分钟短片 一人操作,1 小时出片 百倍级

AI 影视制作的分工模式

前期策划(分镜、剧本)  →  大语言模型(GPT / Kimi / 豆包 / 文心 / DeepSeek)
画面内容(生成视频)    →  AI 视频工具(可灵 / 即梦 / 海螺 / ComfyUI)
后期合成(剪辑、配音)  →  剪辑软件 + AI 配音工具

💡 一人成军:以前需要几十人团队的工作,现在一个人 + AI 就能完成。


二、AI 视频生成的三大技术路线

路线对比表

技术路线 输入 优势 劣势 适合场景
文生视频(Text-to-Video) 一段文字 创意自由、从零开始 可控性差、人物容易崩、一致性差 创意短片、抽象概念
图生视频 ⭐(Image-to-Video) 一张静态图 人物/场景可控、一致性好 需要先有静帧 AI 漫剧主流方案
视频续写(Video-to-Video) 一段视频 在已有素材基础上扩展 需要视频素材 延长镜头、风格化

为什么漫剧选"图生视频"路线

核心理由:人物一致性可控

文生视频:直接从文字生成视频 → 每张帧的人物都可能不一样 → 崩
图生视频:先出好静帧(人物确认好) → 再让画面动起来 → 稳

"先静后动"工作流:

Step 1: 用文生图生成高质量静帧 → 确认人物、构图、风格都满意
Step 2: 用图生视频让静帧动起来 → 只加运动,不改变人物和风格

三、图生视频实操演示

操作流程(以可灵 AI 为例)

① 上传首帧图片
      ↓
② 书写创意描述(运镜提示词)
      ↓
③ 点击「立即生成」
      ↓
④ 等待生成 → 得到动态视频

提示词示例

果冻切割案例:

【首帧图】:一个由梵高星空组成的果冻方块,人手拿着一把刀放在方块上方
【运镜描述】:缓慢地切果冻,在海洋里,水里有各式各样的鱼在游动,
            自然光,光影斑驳,杰作,高清,极致的细节

提示词写作要点

和文生图类似,但要加上运动描述: - 主体在做什么动作 - 镜头怎么运动 - 环境中有什么在动

详细的运镜提示词写法见第 10、11 集。


四、AI 视频的应用边界

已经能做好的

  • ✅ 风景空镜(云动、水动、光影变化)
  • ✅ 人物微动态(眨眼、呼吸、轻微转头)
  • ✅ 镜头运动(推、拉、摇、移)
  • ✅ 短片段(2~5 秒)质量稳定
  • ✅ 风格化视频(动漫、油画等艺术风格)

目前还做不好的

  • ❌ 长视频(超过 10 秒容易崩)
  • ❌ 大幅度动作(奔跑、打斗容易变形)
  • ❌ 精确的口型同步
  • ❌ 复杂的多人互动
  • ❌ 一镜到底的完整叙事

💡 正确心态:AI 是工具,不是魔法。了解它的能力边界,扬长避短,才能用出最好效果。


💡 实操技巧

  1. 先静后动:先把静帧画面调到满意,再进视频生成环节,不要反过来
  2. 一镜一生成:每个分镜单独生成动态,不要试图一镜到底
  3. 短视频为主:单镜头 2~5 秒足够,太长容易崩坏
  4. 用剪辑弥补时长:多个短镜头剪辑在一起,比一个长镜头更稳也更好看

⚠️ 常见误区

误区 后果 正确认识
❌ 追求"一键生成完整视频" 质量不可控,人物崩坏 目前技术做不到,拆解成短镜头
❌ 直接用文生视频做漫剧 人物一致性无法保证 用"先静后动"的图生视频路线
❌ 单镜头拉太长 超过 5 秒后画面容易崩 单镜 2~5 秒,靠剪辑组接
❌ 静帧随便做,反正要动 输入垃圾,输出垃圾 静帧质量决定了视频质量的上限

📝 本章小结

AIGC 是 AI 生成内容的统称,应用场景广泛,正在深刻改变内容生产方式。

做 AI 漫剧的核心技术路线是 "先静后动":

文生图出高质量静帧 → 图生视频让画面动起来

这种方式在人物一致性和画面质量之间取得了最佳平衡,是目前 AI 漫剧制作的主流方案。理解了这个底层逻辑,后面的学习就有了方向。


上一篇:02-ComfyUI入门与安装-整理版.md 下一篇:04-AI沟通大法-整理版.md


04 · AI 沟通大法

📌 核心知识点 - AI 不是搜索引擎,简短关键词得不到好结果 - 6 大沟通原则:给身份、给任务、给格式、给例子、分步骤、做迭代 - 从"命令式"转向"赋能式":把 AI 当合作者,不是工具 - 提示词质量直接决定产出质量——垃圾进,垃圾出

🔧 涉及工具:豆包、ChatGPT、Gemini 等大语言模型 📋 前置知识:无


一、新手最常见的沟通误区

误区 1:把 AI 当搜索引擎

习惯性输入简短关键词,希望 AI 像谷歌一样直接给答案。 - ❌ 输入"压力大怎么办" - 结果:得到百度百科式的通用回答,泛泛而谈,没有针对性

误区 2:只说需求不说身份

不给 AI 设定角色,它就不知道用什么视角和深度来回答。 - ❌ "给我写个剧本" - 结果:不知道给谁写、什么风格、什么水平,输出很平庸

误区 3:不指定输出格式

想要列表?表格?文章?不说清楚,AI 输出的结构就很乱。 - ❌ "帮我分析一下" - 结果:一大段文字,找信息都费劲

误区 4:一次就想完美

期望第一次就得到满意结果,不愿意迭代修改。 - ❌ 不满意就重新开一个对话 - 结果:每次都从零开始,效率极低


二、6 大沟通原则

原则 1:给身份(Role)⭐

先告诉 AI「你是谁」,它的输出立刻就有专业感。

反面示例 正面示例
给我写个剧本 你是一位资深动漫编剧,有 10 年漫剧创作经验,擅长三幕剧结构,请帮我写一个 3 分钟的古风玄幻漫剧剧本

为什么给身份有效? AI 会调用对应角色的知识库、语气、专业深度来回答,而不是用通用视角。

原则 2:给任务(Task)

明确告诉 AI 你要什么,越具体越好。

❌ 写个故事
✅ 写一个 3 分钟的古风漫剧剧本,主角是 18 岁的公主,
   主题是"成长与牺牲",有 10 个左右分镜

原则 3:给格式(Format)

指定输出格式:Markdown、列表、表格、分镜脚本格式等。

请用 Markdown 格式输出,包含以下字段:
- 场景编号
- 画面描述
- 台词
- 时长

为什么要给格式? - 结构化的输出你更容易读 - AI 也更容易理解你的要求 - 方便后续复制到其他工具中使用

原则 4:给例子(Example)

给 AI 看一个你期望的样本,它能更快 get 到你的风格要求。

这是我喜欢的风格示例:
【镜1】大殿内,国王坐在王座上,眉头紧锁
       台词:"妙善,你真的不愿意吗?"
       时长:4秒

请按照这个格式,继续写下面的分镜。

原则 5:分步骤(Step by Step)

复杂任务拆成多步,比一次性说清楚效果更好。

第一步:先给我 3 个故事大纲,我选一个
第二步:基于选中的大纲,写出完整的分镜脚本
第三步:把每个分镜的提示词也写出来

原则 6:做迭代(Iterate)⭐

第一次不满意很正常,告诉 AI 哪里要改,逐步逼近理想结果。

很好,在这个基础上修改:
1. 把主角性格调得更倔强一些
2. 第三幕的冲突再激烈一点
3. 结尾留个悬念

迭代比重写效率高得多,因为 AI 已经理解了你的整体需求,只需要微调。


三、从"命令式"到"赋能式"

两种沟通方式的对比:

沟通方式 例子 效果
命令式 "告诉我怎么缓解压力" 通用答案,缺乏深度,像查百度
赋能式 "你是资深心理咨询师,请从心理学角度分析压力的来源和应对策略" 专业、有深度、有温度

💡 把 AI 想象成一个才华横溢但毫无主见的实习生。你给的方向越清晰,它的产出就越棒。


四、五大思维转变

转变方向 具体变化
从模糊 → 精准 把"写个故事"变成"为谁写、写什么、什么风格"
从命令 → 赋能 把"告诉我"变成"你是专家,请你分析"
从单词 → 迭代 把"不行"变成"很好,在这个基础上修改一下"
从混乱 → 有序 用标题、列表、分隔线组织好提示词,让 AI 精准识别
从抽象 → 具体 把主观感受("好看一点")翻译成具体描述("暖色调、柔和光线、电影感构图")

五、漫剧编剧提示词模板

你是一位资深动漫编剧,有 10 年漫剧创作经验,
擅长三幕剧结构,精通古风神话题材。

【任务】
请为我创作一个[时长]的漫剧剧本。

【主题】
(一句话描述核心主题)

【主角设定】
- 姓名:
- 年龄:
- 性格:
- 背景:
- 目标:

【风格要求】
- 整体风格:
- 目标受众:
- 情绪基调:

【输出要求】
1. 严格按照三幕剧结构
2. 拆分为 [X] 个分镜
3. 每个分镜包含:镜号、场景、画面描述、台词/旁白、时长
4. 输出格式:Markdown 表格

💡 实操技巧

  1. 用好分隔符:用标题、列表、分隔线(---)把提示词组织清楚,AI 更容易理解
  2. 从抽象到具体:把你的主观感受翻译成具体的描述性语言
  3. 建立提示词库:保存好用的提示词模板,复用经过验证的版本
  4. 把 AI 当下属:给任务、给标准、给示例,而不是让它猜你想要什么
  5. 一次只改 2~3 个点:迭代修改时每次别改太多,否则 AI 容易忘之前的要求

⚠️ 常见误区

误区 后果 正确做法
❌ 提示词太短 输出泛泛而谈,没有针对性 详细描述需求:身份 + 任务 + 格式
❌ 一次塞太多要求 AI 顾此失彼,部分要求被忽略 复杂任务拆成 2~3 轮对话,逐步叠加
❌ 不满意就重开 每次从零开始,效率极低 迭代修改,说清楚哪里要改
❌ 只说"不好"不说"哪里不好" AI 不知道改什么 具体指出问题:"第 3 个分镜节奏太慢"
❌ 不用 Markdown 组织提示词 AI 理解成本高,容易漏信息 用标题、列表、加粗把结构理清楚

📝 本章小结

和 AI 沟通的核心是 把模糊的需求变成清晰的指令。

记住 6 个关键词:

身份 → 任务 → 格式 → 例子 → 步骤 → 迭代

你和 AI 是合作者关系: - 你提供:方向、判断、审美、修改意见 - AI 提供:算力、速度、创意、第一稿

两者配合才能产出高质量内容。掌握了高效沟通,你和 AI 的潜力才能共同被激发。


上一篇:03-AIGC基础与视频生成原理-整理版.md 下一篇:05-Markdown剧本格式规范-整理版.md


05 · Markdown 剧本格式规范

📌 核心知识点 - Markdown 是一种轻量级标记语言,纯文本格式,兼容性极强 - 用简单的符号实现标题、列表、加粗、表格等排版 - AI 漫剧剧本统一用 Markdown 格式,方便 AI 理解和后续自动化处理 - 飞书文档 / Notion / Obsidian 都完美支持 Markdown

🔧 涉及工具:飞书文档、Notion、Obsidian、VS Code 📋 前置知识:无


一、为什么用 Markdown 写剧本

四大优势

优势 说明
纯文本格式 任何设备、任何软件都能打开,不会有兼容性问题
AI 友好 大模型天生理解 Markdown 结构,生成和解析都很顺畅
结构清晰 标题层级一目了然,剧本 / 分镜 / 台词分区明确
方便转换 可以一键导出 PDF、Word、HTML 等格式

没有格式的文字在 AI 眼里是什么样?

没有 Markdown 格式的一大段话 = 一整块豆腐块
  → 没有重点
  → 没有结构
  → 就像读没有标点符号的课文
  → AI 很难准确理解你的意思

💡 用 Markdown 组织内容,不只是为了好看,更是为了让 AI 准确理解你的需求。


二、Markdown 基础语法(剧本常用)

1. 标题(6 级)

用 # 号表示,数量代表级别。

# 一级标题     剧名 / 大章节
## 二级标题    幕 / 场
### 三级标题   分镜 / 段落
#### 四级标题  细节说明

剧本中的层级关系:

# 千手观音·妙善传说          ← 剧名(H1)
  ## 第一幕:降世            ← 幕(H2)
    ### 镜1:王宫外景        ← 分镜(H3)
      画面 / 台词 / 时长...  ← 内容

2. 文本样式

**加粗文字**   →  用于强调关键词、角色名
*斜体文字*     →  用于旁白、心理活动
~~删除线~~     →  修改时用

3. 列表

- 无序列表项 1    用于列举角色、道具、提示词元素
- 无序列表项 2

1. 有序列表第 1 项   用于步骤、分镜编号
2. 有序列表第 2 项

4. 引用与代码块

> 引用块:用于台词、旁白展示

代码块:用于提示词、脚本、命令

5. 表格 ⭐ 做分镜表必备

| 镜号 | 场景 | 画面描述 | 台词 | 时长 |
|------|------|----------|------|------|
| 1 | 大殿内 | 主角站在中央 | "你是谁?" | 3s |

渲染效果:

镜号 场景 画面描述 台词 时长
1 大殿内 主角站在中央 "你是谁?" 3s

6. 分隔线

---    (用于场景之间的分隔,视觉上更清晰)

三、漫剧剧本的 Markdown 模板

完整模板

# 千手观音·妙善传说

## 基本信息
- **类型**:古风神话 / 感人 / 3 分钟
- **风格定位**:国风 Q 版手办风格
- **目标受众**:青少年及以上,对传统文化感兴趣的观众

---

## 第一幕:降世

### 镜 1:王宫外景
| 项目 | 内容 |
|------|------|
| **场景** | 古代王宫,夕阳西下 |
| **画面** | 宫殿轮廓在金色余晖中,飞鸟掠过 |
| **旁白** | 相传古代有个兴林国,国王老来得女... |
| **运镜** | 镜头从天空缓缓下降,落在王宫上 |
| **时长** | 4 秒 |

---

### 镜 2:产房内
| 项目 | 内容 |
|------|------|
| **场景** | 宫内产房 |
| **画面** | 王后躺在床上,侍女伺候,婴儿啼哭 |
| **台词** | 国王:"寡人有后了!就叫妙善吧。" |
| **运镜** | 固定镜头,中景 |
| **时长** | 5 秒 |

---

## 第二幕:修行
(... 继续往下写 ...)

分镜总览表模板

在剧本开头放一个总览表,方便全局把握:

## 分镜总览

| 镜号 | 所属幕 | 场景 | 核心内容 | 时长 |
|------|--------|------|----------|------|
| 1 | 第一幕 | 王宫外景 | 开场,展示王宫 | 4s |
| 2 | 第一幕 | 产房内 | 妙善出生 | 5s |
| 3 | 第一幕 | 大殿 | 国王议婚事 | 6s |
| ... | ... | ... | ... | ... |

四、推荐工具与工作流

工具对比

工具 优点 适合场景
飞书文档 实时保存、多端同步、AI 可直接读写、协作方便 日常剧本工作流首选
Notion 数据库强大、可做项目管理 多项目管理爱好者
Obsidian 本地存储、隐私安全、插件丰富 喜欢本地管理的用户
VS Code 纯代码编辑、配合 Git 版本控制 程序员 / 技术向用户
Markdown 在线编辑器 左右分栏实时预览 学习 Markdown 语法阶段

推荐工作流

1. 用大模型生成剧本(指定 Markdown 格式输出)
         ↓
2. 复制到飞书文档中,人工修改调整
         ↓
3. 分镜表确认后,进入画面生成环节
         ↓
4. 随时可以把 Markdown 复制到其他工具中使用

💡 实操技巧

  1. 统一模板:建立自己的剧本模板,每次新建直接套用,格式不跑偏
  2. 层级清晰:剧名 → 幕 → 场景 → 镜头,严格用标题层级区分,不要跳级
  3. 表格做分镜表:用 Markdown 表格做分镜总览,一目了然
  4. 飞书文档最方便:实时保存、多端同步、AI 可直接读写,新手首选
  5. 善用分隔线:场景之间用 --- 分隔,视觉上更清晰

⚠️ 常见误区

误区 后果 正确做法
❌ 格式混乱,想到哪写到哪 AI 解析容易出问题,人读着也累 用统一模板,按层级组织
❌ 用 Word 写剧本 格式复杂,AI 难以解析,复制粘贴麻烦 转 Markdown 格式
❌ 标题层级乱跳 结构不清晰,AI 理解有误 H1 → H2 → H3 逐级深入
❌ 全是大段文字不用列表 找信息费劲 能列点就列点,结构化输出

📝 本章小结

Markdown 是 AI 漫剧创作的"通用语言":

  • AI 能懂 → 生成和解析都顺畅
  • 你能读 → 结构清晰,找信息快
  • 任何软件都能打开 → 兼容性无敌

剧本创作只需要掌握最常用的几个语法:

标题 + 列表 + 表格 + 加粗 + 分隔线

配合飞书文档使用,是目前最高效的剧本工作流。


上一篇:04-AI沟通大法-整理版.md 下一篇:06-AI编剧常见问题-整理版.md


06 · AI 编剧常见问题

📌 核心知识点 - AI 写剧本就像"驾驶想象力飞船":引擎很强,但方向盘在你手里 - 5 大常见问题:故事套路化、人物扁平、逻辑断裂、对话生硬、主题模糊 - 解决思路:给够背景信息、控制生成粒度、人工打磨关键情节 - AI 是"第一稿生产力",最终质量靠人的审美和判断

🔧 涉及工具:豆包、Gemini、Claude 📋 前置知识:04-AI沟通大法


一、AI 编剧的本质

一个生动的比喻

AI 就像一个才华横溢但毫无主见的编剧实习生。 它读过人类历史上所有的剧本,但你必须告诉它: 写什么、怎么写、写成什么样。

核心矛盾

AI 什么都能生成,但未必是你想要的。

新手的致命错误:开局一张纸,故事全靠"给"

期望 AI 能凭空制造一个完整、新颖、有趣的故事。

  • ❌ "给我写一个有趣的科幻故事剧本"

两个问题: 1. 脱离现实:AI 会尽情想象,但和现实脱节很大 2. 千篇一律:没有差异化输入,输出的都是最常见的套路组合


二、五大常见问题与对策

问题 1:故事套路化,缺乏新意

表现:看开头就知道结尾,桥段都是老一套。

原因:AI 是基于海量文本训练的,它倾向于输出「最常见」的组合——也就是最套路的组合。

对策:

方法 说明 例子
喂独特设定 给 AI 独特的世界观和设定,打破常规 "主角不是天选之子,是冒牌货"
加反套路元素 故意反着来 "勇者不想拯救世界,只想回家躺平"
用假设打破常规 「如果…会怎样」式提问 "如果反派赢了呢?"

问题 2:人物扁平,像工具人

表现:角色没有性格,说话都一个味儿,行动没有动机。

对策:

  1. 📝 提前写好完整的人物小传 - 性格、背景、动机、口头禅 - 每个角色单独存一份文档
  2. 🗣️ 给每个角色独特的说话方式 - 语速快慢、用词习惯、口头禅
  3. 🎯 让角色的行动符合性格 - 而不是为了推进剧情强行行动

💡 人物小传越详细,AI 写出来的角色越立体。


问题 3:剧情逻辑断裂

表现:前因后果对不上,人物突然就到了某个地方,行为没有铺垫。

对策:

  1. ⛔ 不要让 AI 一次写完整个故事,分段生成
  2. ✅ 每段生成后检查逻辑连贯性,再继续下一段
  3. 📐 三级递进法:
第一级:故事大纲    (整体框架)
    ↓ 确认后再细化
第二级:详细章节    (每幕/每场的内容)
    ↓ 确认后再细化
第三级:具体场景    (每个分镜的细节)

问题 4:对话生硬,像说明书

表现:人物说话像念稿子,没有生活气息,全是信息灌输。

对策:

  1. 🎭 给角色设定说话风格(语速、用词、口头禅)
  2. 💬 让对话有潜台词(话里有话,不是直接说)
  3. 🤸 用动作和表情辅助对话,不是光靠嘴说

对比:

生硬版 自然版
"我现在非常生气,因为你背叛了我。" (握紧拳头,声音发抖)"你……居然是你。"

问题 5:主题模糊,不知道在讲什么

表现:故事看完了,但不知道想表达什么,看完就忘。

对策:

  1. 🎯 动笔前先确定核心主题 - 例:"本片探讨的是选择与代价"
  2. 📍 每个主要情节都服务于主题 - 无关的情节果断砍掉
  3. 🔄 结尾回扣主题 - 让观众看完有所回味

三、AI 编剧的正确工作流

四步工作法

Step 1: 给足背景       → 世界观、人设、基调一次性说清
    ↓
Step 2: 先出大纲       → 让 AI 出 3~5 个大纲,选最好的
    ↓
Step 3: 拆分场景       → 大纲确认后,逐场景生成细节
    ↓
Step 4: 人工打磨       → AI 出第一稿,人改关键情节/对白/节奏

每一步的质量控制点

步骤 做什么 检查什么
给背景 输入世界观、人设、主题 AI 是否理解了你的设定
出大纲 让 AI 出多个版本 故事结构是否合理、有没有亮点
拆场景 逐场景细化 逻辑是否连贯、人物行为是否合理
人工打磨 修改对白、节奏、高潮 情感是否打动人、节奏是否紧凑

四、新手 → 专家的升级路径

维度 新手做法 专家做法
提示词 一句话许愿式 详细设定 + 格式要求 + 参考示例
生成方式 一次写完整个剧本 大纲→章节→场景,三级递进
对 AI 的期待 一键出完美稿 AI 出第一稿,人负责质量把关
修改方式 不满意就重开对话 迭代修改,逐步逼近目标
关键情节 全靠 AI 写 高潮、转折点人工写

💡 实操技巧

  1. 多生成几个版本:同一个需求让 AI 出 3 版,挑最好的元素组合
  2. "继续"指令很有用:写得不错的时候说"继续,保持风格",比重写效率高
  3. 关键情节自己写:高潮、转折点这些核心情节,人工写质量更有保障
  4. 保存人设文档:主要角色的设定单独存一个文件,每次写剧本都喂给 AI
  5. 建立剧本库:好的剧本、好的桥段都收集起来,以后可以参考和改编

⚠️ 常见误区

误区 后果 正确做法
❌ 一句话让 AI 写完整部剧本 质量不可能高,套路化严重 拆分步骤,逐级细化
❌ 完全照搬 AI 输出 有明显的"AI 味",缺乏灵魂 人工打磨,加入自己的想法
❌ 不给背景直接写 AI 不知道你的世界观,只能瞎编 先给足设定,再让它写
❌ 贪多求快 越急着出稿,返工越多 慢慢来,前期越细,后期越顺
❌ 只看第一版 错过更好的可能 多生成几版,择优组合

📝 本章小结

AI 编剧不是"一键出稿",而是"人机协作"。

角色 负责什么
AI 快速出第一稿、提供创意灵感、处理重复性工作
你(人) 方向把控、质量打磨、逻辑校验、情感注入

掌握「大纲先行、分段生成、人工打磨」的工作流,才能用好 AI 这个超级编剧助手。记住:AI 是引擎,你是司机。


上一篇:05-Markdown剧本格式规范-整理版.md 下一篇:07-三幕剧结构详解-整理版.md


07 · 三幕剧结构详解

📌 核心知识点 - 三幕剧是西方叙事学最基础、最强大的工具 - 结构:建置(Setup)→ 对抗(Confrontation)→ 结局(Resolution) - 每个转折点都是"钩子",抓住观众注意力 - AI 写剧本时用三幕剧框架约束,故事就不会散 - 好故事的核心是「人物弧光」,不是事件堆砌

🔧 涉及工具:所有 AI 编剧工具 📋 前置知识:06-AI编剧常见问题


一、为什么要学三幕剧

三幕剧结构是西方叙事学中最重要、最基础、最强大的一个工具。

对于想用 AI 生成故事的人来说,掌握三幕剧就等于给 AI 装上了「故事骨架」——否则 AI 写出来的东西很容易散。

💡 三幕剧不是束缚创意的公式,而是保证故事"好看"的底层逻辑。

一个比喻:过山车

把三幕剧想象成一次过山车之旅:

幕 对应过山车 观众感受
第一幕 缓缓爬上第一个高坡 熟悉环境、认识同伴,紧张感和期待感慢慢积累
第二幕 在轨道上疯狂翻滚穿梭 充满尖叫、刺激、绝望、惊喜,旅程最长最核心
第三幕 最后的最高冲刺,然后平稳回到终点 释放所有情绪,带着满足感离开

二、三幕剧完整结构

整体结构图

  第一幕:建置 25%        第二幕:对抗 50%         第三幕:结局 25%
┌───────────────┐  ┌───────────────────────────┐  ┌───────────────┐
│ 开端 → 激励事件 │→│ 上升动作 → 中点 → 低潮  │→│ 高潮 → 结局     │
└───────────────┘  └───────────────────────────┘  └───────────────┘
         ↑                    ↑                              ↑
    打破平静            最精彩的部分                    情绪释放

时长比例

幕 占比 3 分钟视频 10 分钟视频
第一幕:建置 25% 约 45 秒 约 2 分 30 秒
第二幕:对抗 50% 约 1 分 30 秒 约 5 分钟
第三幕:结局 25% 约 45 秒 约 2 分 30 秒

三、各幕详解

第一幕:建置(Setup)

核心任务:介绍主角、世界观、日常状态,然后用「激励事件」打破平静。

节点 说明 例子(千手观音)
开端 展示主角的日常生活,让观众认识并代入角色 妙善公主在宫中生活,天性慈悲
激励事件 ⭐ 一件事打破了主角的平静生活,故事正式开始 妙庄王为妙善安排婚事,妙善拒绝
第一幕转折 主角做出一个决定,正式踏上冒险/解决问题之路 妙善被贬为庶民,前往香山修行

⚠️ 短视频注意:激励事件尽早出现,最好在 15 秒内出现,否则观众划走了。


第二幕:对抗(Confrontation)

核心任务:主角遇到重重阻碍,在挣扎中成长。这是全剧最长、最核心的部分。

节点 说明 例子(千手观音)
上升动作 主角尝试解决问题,但遇到一个比一个大的困难 妙善在香山修行,经历各种考验
中点转折 ⭐ 故事中间的关键转折,可以是「伪胜利」或「伪失败」 妙庄王身染恶疾,需双手双眼入药
低潮 主角跌到谷底,一切看起来都失败了 众人退缩,妙善独自承受
第二幕转折 主角从低谷中领悟到关键道理 / 找到新方法 妙善毅然割手挖眼,以孝心救父

💡 中点要有反转:第二幕中间必须有一次大反转,否则观众会走神。 💡 低谷要足够低:跌得越低,高潮反弹才越爽。


第三幕:结局(Resolution)

核心任务:最终对决,故事收尾,情感释放。

节点 说明 例子(千手观音)
高潮 ⭐ 主角与最终对手/困难的正面对决 佛陀降临,妙善化作千手千眼圣像
结局 冲突解决,展示主角的变化 千手观音普度众生
余韵 新的日常状态,呼应开头 世间传颂妙善的故事

四、人物弧光(Character Arc)

好故事的核心不是「发生了什么事」,而是「主角变成了什么样的人」。

开始的主角            经历事件             结束的主角
(有缺陷/不成熟) ──────────────→  (成长/改变/觉悟)

经典人物弧光类型

类型 变化方向 例子
成长弧 弱点 → 克服 → 成长 胆小 → 经历考验 → 变得勇敢
堕落弧 好人 → 被诱惑 → 堕落 正直的人 → 权力腐蚀 → 黑化
救赎弧 坏人 → 觉醒 → 赎罪 罪犯 → 遇到契机 → 改过自新
牺牲弧 自我 → 牺牲 → 升华 自私的人 → 经历冒险 → 学会奉献

💡 没有人物弧光的故事,事件再热闹也只是流水账。


五、用 AI 写三幕剧的提示词模板

你是一位资深动漫编剧,精通三幕剧结构。

请按以下要求创作一个 [类型] 漫剧剧本:

【故事主题】:(一句话说清核心主题)
【主角设定】:(姓名、性格、背景、目标)
【时长】:3 分钟(约 12 个分镜)
【风格】:古风 / 现代 / 科幻 / ...

请严格按照三幕剧结构输出:

## 第一幕:建置(约占 25% 时长)
- 开端:展示主角日常
- 激励事件:打破平静的事件
- 第一幕转折:主角做出决定

## 第二幕:对抗(约占 50% 时长)
- 上升动作:遇到的困难和尝试
- 中点转折:中间的关键反转
- 低谷:主角跌到谷底
- 第二幕转折:找到新方法/新领悟

## 第三幕:结局(约占 25% 时长)
- 高潮:最终对决
- 结局:冲突解决
- 人物弧光:主角发生了什么变化

输出格式:Markdown

💡 实操技巧

  1. 先填结构再填肉:先把三幕的关键节点都定好,再写具体内容
  2. 激励事件尽早出现:短视频节奏快,激励事件最好在 15 秒内出现
  3. 中点要有反转:第二幕中间必须有一次大反转,否则观众会走神
  4. 低谷要足够低:跌得越低,高潮反弹才越爽
  5. 结尾呼应开头:结局和开头形成对照,人物弧光更明显

⚠️ 常见误区

误区 后果 正确做法
❌ 第一幕太长 观众早就划走了 短视频第一幕别超过总时长的 1/4
❌ 第二幕太平 全是流水账,没有起伏和反转 加中点转折,让故事有意外
❌ 结局仓促 高潮一下就完了,没有余韵 给结局留足空间,有余韵
❌ 主角没有变化 故事结束时主角和开始时一模一样 设计人物弧光,让主角成长
❌ 事件堆砌 发生了很多事,但不知道为什么 每个事件都要服务于主题和人物

📝 本章小结

三幕剧是故事的「骨架」:

建置(25%)→ 对抗(50%)→ 结局(25%)

四个关键转折点: 1. 🎯 激励事件 —— 故事开始 2. 🔄 中点转折 —— 剧情反转 3. 📉 低谷 —— 跌到谷底 4. 🔥 高潮 —— 最终对决

用三幕剧框架约束 AI 输出,故事就不会散。

记住:好故事的核心是人物的变化(人物弧光),而不是事件的堆砌。


上一篇:06-AI编剧常见问题-整理版.md 下一篇:08-文生图提示词实战与避坑-整理版.md


08 · 文生图提示词实战与避坑

📌 核心知识点 - 别把 AI 当"读心术":你不说清楚,AI 不可能知道你想要什么 - 提示词万能公式:主体 + 动作 + 环境 + 风格 + 构图光影 + 质量参数 - 常见错误:描述太抽象、主次不分、风格混乱、缺乏细节 - 好提示词是迭代出来的,不是一次写出来的

🔧 涉及工具:即梦 AI、ComfyUI、Midjourney 等文生图工具 📋 前置知识:04-AI沟通大法


一、新手最常犯的错误

根本误区:把 AI 当读心术

新手最大的问题:把 AI 当成了能读懂你心思的神笔马良,而不是一个需要精确指令的超级画师。

AI 这位画师虽然技艺高超,能画任何风格,但它没有任何主观想法。你说的每一个字,都是它下笔的依据。


四大常见误区

误区 表现 问题
描述过于空洞 "一幅漂亮的风景画" 漂亮的标准是什么?是山是海?是白天是黑夜?AI 完全不知道
描述太抽象 "好看一点""高级一点""有感觉" 这些主观感受 AI 无法理解
主次不分 所有元素一股脑塞进提示词 AI 不知道什么是重点,画面会很乱
风格混乱 同时说"国风"+"赛博朋克"+"油画风" AI 会混乱,出来的东西四不像

抽象 → 具体 的转换练习

❌ 抽象描述 ✅ 具体描述
好看一点 精致五官、皮肤细腻、眼神清澈、柔和侧光
高级感 低饱和色调、简约构图、电影感光影、高对比度
有氛围 黄昏金色阳光、薄雾、丁达尔效应、景深虚化
可爱 Q 版、大眼睛、圆润线条、明亮色彩

二、提示词万能公式

【主体】 + 【动作/姿态】 + 【环境/背景】 + 【风格】 + 【构图/光影】 + 【技术参数】

完整示例

一个穿着白色古装的年轻女子,            ← 【主体】
站在云端,双手合十,衣袂飘飘,         ← 【动作/姿态】
背景是雪山和金色夕阳,                  ← 【环境/背景】
国风工笔画风格,Q 版手办质感,          ← 【风格】
居中构图,柔和侧光,电影感,              ← 【构图/光影】
8K,超高清,高细节                     ← 【技术参数】

💡 重要的放在前面:提示词的顺序很重要,越靠前权重越高,AI 越重视。


三、提示词的六大组成元素

1. 主体描述(最重要)⭐

类型 描述维度 例子
人物 年龄、性别、外貌特征、服装、表情 18岁少女,黑色长发,面容清丽,白色汉服
物品 形状、颜色、材质 一把古剑,青铜色,刻有龙纹
动物 品种、颜色、动作 一只白色的猫,趴在窗台上

2. 环境与场景

  • 室内 / 室外
  • 具体地点(王宫、森林、海边、书房……)
  • 天气(晴天、雨天、雪天……)
  • 时间(清晨、正午、黄昏、夜晚……)

3. 艺术风格

类别 例子
绘画风格 油画、水彩、素描、工笔画、赛博朋克、宫崎骏风格
3D 风格 皮克斯、手办、粘土、Blender 渲染
摄影风格 人像摄影、纪实摄影、胶片质感、拍立得

⚠️ 一次只选一个主风格,不要多个风格混在一起。

4. 构图与镜头

维度 选项
景别 特写、近景、中景、全景、远景
角度 平视、仰视、俯视、鸟瞰
构图 居中、三分法、对称、引导线、框架式

5. 光影与色彩

维度 选项
光线 自然光、侧光、逆光、柔光、硬光、电影感光影
色调 暖色调、冷色调、高对比、低饱和、莫兰迪色

6. 质量词(加分项)

8K、超高清、高细节、masterpiece(杰作)、best quality(最佳质量)、ultra detailed(超高细节)


四、提示词进阶:从新手到专业

四个级别对比

级别 提示词 可控度 效果
❌ 新手级 一个美女 ⭐ 随机生成,完全不可控
⚠️ 入门级 一个古装美女,国画风,高清 ⭐⭐ 有大概方向,但细节随机
✅ 进阶级 一个穿着白色汉服的 18 岁少女,黑色长发,面容清丽,站在桃花树下,花瓣飘落,国风水彩画风格,柔和春日光线,半身特写,8K 高细节 ⭐⭐⭐⭐ 结果高度可控
🏆 专业级 进阶级 + 具体参考图 + LoRA 模型 + ControlNet 构图控制 ⭐⭐⭐⭐⭐ 精准还原

五、负面提示词(Negative Prompt)

告诉 AI 不要什么,比只说"要什么"更能提升质量。

常用负面词

低质量、模糊、变形、多手指、丑陋、畸形、
比例失调、水印、文字、多余的肢体、
解剖学错误、面部不对称、眼睛不一致

什么时候加负面词?

  • 人物经常出现多手指、变形 → 加负面词
  • 画面有水印、文字 → 加负面词
  • 整体质量不稳定 → 加负面词

💡 实操技巧

  1. 从简到繁迭代:先写基础版本看大效果,再逐步添加细节调整
  2. 收藏好的提示词:生成满意的图后,把提示词存下来,下次改改就能用
  3. 中英文混输也可以:很多模型中英文都能识别,哪个好用哪个
  4. 用参考图辅助:文字描述不清的,直接给 AI 看参考图
  5. 负面提示词很重要:告诉 AI 不要什么,比只说要什么更精准
  6. 多抽卡择优:同一组提示词多生成几张,挑最好的

⚠️ 常见误区

误区 后果 正确做法
❌ 提示词越长越好 堆砌关键词没用,结构清晰才重要 按公式组织,重点在前
❌ 一次就想完美 期望值太高,容易受挫 提示词是调出来的,不是写出来的
❌ 全是形容词 "美丽的""帅气的"没用,AI 不知道具体什么样 具体描述特征,不用主观形容词
❌ 风格冲突 "写实风格+卡通渲染"会打架 确定一个主风格,其他做点缀
❌ 忽略负面提示词 容易出现畸形、低质量画面 养成加负面词的习惯
❌ 主次不分 AI 不知道重点是什么 重要描述放前面

📝 本章小结

文生图提示词的核心是 把你脑子里的画面,翻译成 AI 能理解的具体描述。

记住万能公式:

主体 + 动作 + 环境 + 风格 + 构图光影 + 质量参数

再加一个关键心法: - 从简到繁迭代,不要追求一次完美 - 配合参考图和负面提示词,才能得到稳定的高质量结果 - 多抽卡择优,好图是试出来的


上一篇:07-三幕剧结构详解-整理版.md 下一篇:09-Gemini实战指南-整理版.md


09 · Gemini 实战指南

📌 核心知识点 - Gemini 2.5 Pro 是免费模型中最好用的之一 - 支持长文本、图片理解、代码生成、多模态交互 - 适合做剧本创作、分镜描述、提示词优化等创意工作 - 配合即梦 / ComfyUI,形成「创意 → 画面」完整链路

🔧 涉及工具:Gemini 2.5 Pro(Google AI Studio) 📋 前置知识:04-AI沟通大法


一、Gemini 是什么

Gemini 2.5 Pro 是 Google 推出的大语言模型,在免费模型中表现突出。支持多模态(文字、图片、代码),上下文窗口大,适合创意类工作。

相比其他模型的优势

优势 说明
免费额度充足 日常使用基本够用
多模态能力强 图文理解都不错,能直接读图片
长文本处理好 上下文窗口大,可以喂整本书
创意写作稳定 故事、剧本等创意工作表现好

使用前提

  • 需要翻墙(科学上网)
  • 必须使用美国节点(日本、新加坡、香港等都不行)
  • 访问地址:Google AI Studio(aistudio.google.com)

界面布局

┌─────────────────────────────────────────┐
│ 左侧区域        │   中间对话区            │
│ 对话历史        │   输入框 + 上传按钮     │
│ 模型选择        │                        │
└─────────────────────────────────────────┘

二、Gemini 能帮漫剧制作做什么

1. 📝 剧本创作

  • 生成故事大纲、分镜脚本
  • 优化对白、调整节奏
  • 按三幕剧结构完善故事
  • 扩写 / 缩写剧情

2. 🎨 画面描述(提示词生成)

  • 把简单的场景描述扩展成详细的绘画提示词
  • 优化提示词结构,提升生图质量
  • 生成负面提示词
  • 翻译提示词(中英互译)

3. 🖼️ 图片理解与分析 ⭐

  • 上传参考图,让 Gemini 描述画面内容
  • 分析构图、色彩、风格,转化为文字提示词
  • 对比两张图的差异
  • 从分镜图反推提示词

4. 💻 技术辅助

  • 写 ComfyUI 工作流的说明文档
  • 解决报错、排查问题
  • 生成批量处理脚本
  • 学习新工具时当老师

三、使用 Gemini 的正确姿势

1. 给足上下文

不要一上来就说"帮我写个剧本",先把背景设定、人物、风格都说清楚。

❌ 帮我写个剧本
✅ 你是资深动漫编剧,这是我的角色设定 [...],
   主题是 [...],风格是古风神话,
   请帮我写一个 3 分钟的漫剧剧本,按三幕剧结构。

2. 用图片辅助沟通

说不清的画面,直接截图或上传参考图,Gemini 能看懂。

[上传一张人物参考图]

请描述这张图中的人物特征,并生成一组
可以在 ComfyUI 中复现这个角色的提示词。

3. 迭代优化

第一次结果不满意,说清楚哪里要改,逐步逼近目标。

整体不错,在这个基础上修改:
1. 把主角的性格调得更倔强
2. 第二幕的冲突再激烈一些
3. 结尾留个悬念

四、漫剧制作常用提示词模板

模板 1:场景描述 → 绘画提示词

我需要把这段场景描述转换成 AI 绘画提示词:

【场景】:
(粘贴你的场景描述)

【风格】:国风 Q 版手办风格

【要求】:
- 翻译成详细的绘画提示词
- 包含:主体、动作、环境、风格、构图、光影
- 同时给出负面提示词
- 输出格式:分点列出

模板 2:剧本分镜拆解

这是一段漫剧剧本,请帮我拆成分镜脚本:

【剧本】:
(粘贴剧本内容)

【要求】:
- 拆成 5-8 个分镜
- 每个分镜包含:镜号、画面描述、台词、时长
- 注意镜头语言(景别、角度、运镜)
- 输出 Markdown 表格格式

模板 3:图片 → 提示词(反推)

[上传一张参考图]

请分析这张图片,然后:
1. 用文字详细描述画面内容
2. 生成一组可以复现这张图的文生图提示词
3. 给出推荐的负面提示词
4. 风格归类(属于什么画风)

模板 4:分镜 → 运镜提示词

这是一个分镜的画面描述,请帮我写成
图生视频的运镜提示词:

【分镜描述】:
(粘贴分镜内容)

【情绪基调】:
(紧张/温馨/宏大/悲伤...)

【要求】:
- 用于即梦/可灵AI的图生视频
- 包含镜头运动 + 主体动作 + 环境动态
- 单镜头 3-5 秒,动作幅度不要太大

五、漫剧制作中的 Gemini 工作流

第一步:剧本创作
   用 Gemini 写剧本、拆三幕、改对白
         ↓
第二步:分镜拆解
   把剧本拆成分镜脚本,加上镜头语言
         ↓
第三步:提示词生成
   把每个分镜的描述转换成绘画提示词
         ↓
第四步:画面生成
   把提示词复制到即梦 / ComfyUI 生成静帧
         ↓
第五步:视频动态
   再用 Gemini 生成运镜提示词,去做图生视频

💡 实操技巧

  1. 开新对话不纠结:一个话题聊歪了,直接开新对话,比在旧对话里纠正效率高
  2. 善用「继续」指令:生成到一半被截断,说"继续"就行
  3. 图片 + 文字组合:上传参考图 + 文字描述,效果远好于纯文字
  4. 保存好的对话:好用的提示词和对话存成模板,下次直接复用
  5. 多模态用起来:不要只用来聊天,图片理解和代码能力是很多人低估的宝藏

⚠️ 常见误区

误区 后果 正确做法
❌ 上下文不给全 AI 只能瞎猜 把背景、人设、风格一次性说清
❌ 期待 100% 准确 免费模型会有幻觉,关键信息可能错 重要信息要自己验证
❌ 只用来聊天 浪费了多模态和代码能力 多用图片上传、代码生成功能
❌ 不满意就重开 每次从零开始,效率低 说清楚哪里不对,迭代修改

📝 本章小结

Gemini 2.5 Pro 是 AI 漫剧制作的「全能助手」:

写剧本 → 拆分镜 → 出提示词 → 解难题,全流程都能胜任

作为免费模型,性价比极高。配合即梦 / ComfyUI 使用,可以形成从创意到画面的完整工作流。

记住:Gemini 是创意中枢,把它用好,整个漫剧制作的效率会大幅提升。


上一篇:08-文生图提示词实战与避坑-整理版.md 下一篇:10-图生视频与动态效果-整理版.md


10 · 图生视频与动态效果

📌 核心知识点 - 图生视频(Image-to-Video)是 AI 漫剧的主流动态方案 - 动态效果不是越强越好,要服务于叙事 - 新手常见问题:乱动、变形、穿模、画面崩坏 - 提示词公式:镜头运动 + 主体动作 + 环境变化 - 核心心法:宁静勿动,以运镜代动作

🔧 涉及工具:即梦 AI、ComfyUI、可灵、Vidu 等 📋 前置知识:08-文生图提示词实战与避坑


一、AI 图生视频的现状

AI 视频生成是令人兴奋的新领域,但也带来了新的挑战。

一个比喻

当前的 AI 更像一个听指令的魔法师:你给他一张静态的画,他能让画活过来,但你必须用精准的咒语(提示词)告诉他如何活、哪里活。否则魔法就会失控,产生各种各样奇怪甚至恐怖的效果。

当前技术边界

方面 现状
单镜头时长 建议 2~5 秒,太长容易崩
动作幅度 微动作稳定,大动作容易变形
人物一致性 是最大挑战,需要专门方案
手部/面部特写 容易出问题,尽量避开
质量上限 闭源平台(可灵、即梦)> 开源方案

二、动态提示词的写法

核心公式

镜头运动 + 主体动作 + 环境变化

完整示例

镜头缓慢推进,                              ← 【镜头运动】
人物微微转头看向远方,风吹动衣摆和头发,    ← 【主体动作】
背景云朵缓慢飘动,雪花缓缓落下              ← 【环境变化】

💡 重点在前:和文生图一样,提示词越靠前的内容权重越高。


镜头运动方式速查表

运镜方式 英文关键词 效果 常用程度
推镜 push in / zoom in 镜头向前推进,强调主体 ⭐⭐⭐⭐⭐
拉镜 pull out / zoom out 镜头后拉,展示环境 ⭐⭐⭐⭐
横移 pan left/right 左右平移,展示空间 ⭐⭐⭐⭐
环绕 orbit / circle around 360 度环绕,立体感 ⭐⭐
升降 crane up/down 上下移动,宏大感 ⭐⭐⭐
静止 static / still 固定镜头,只有微动 ⭐⭐⭐⭐⭐

主体动作分级

级别 例子 稳定性 推荐度
微动作 眨眼、微笑、转头、呼吸感、头发飘动 高 ⭐⭐⭐⭐⭐ 新手首选
中等动作 走路、转身、挥手、说话 中 ⭐⭐⭐ 谨慎使用
大动作 打斗、奔跑、跳跃、大幅度转身 低 ⭐ 新手慎用

💡 新手记住:能不动就不动,动就微动。


环境动态元素

类别 例子 效果
自然元素 风吹树叶、水流、云动、雪花飘落、花瓣飞舞 增加画面生气
光影变化 日出日落、灯光闪烁、光斑移动 增加氛围感
粒子效果 灰尘、光斑、烟雾、萤火 增加梦幻感
前景遮挡 树叶飘动、窗格影子 增加层次感

三、常见动态错误与解决

错误 1:画面乱动,没有重点

表现:整个画面到处都在动,不知道看哪里,看得头晕。

原因:提示词没说清楚什么该动、什么不该动。

对策: - 明确指定「只有 XX 在动,其他保持静止」 - 优先保证主体不动,只加微动(呼吸感、眨眼)

错误 2:人物变形 / 崩坏

表现:脸歪了、手多了、身体扭曲、五官乱飞。

原因:大幅度动作 + 模型能力不足。

对策: - 减少动作幅度,以微动态为主 - 避开大角度转身、剧烈运动 - 手部尽量藏起来(放口袋、放身后、被遮挡) - 避开手部特写、面部大表情

错误 3:穿模

表现:身体穿过衣服、头发穿过脸、人物嵌进背景。

原因:AI 对空间关系理解不准确。

对策: - 选择动作幅度小的镜头 - 人物和背景层次不要太复杂 - 用遮罩(mask)分层控制(进阶操作)

错误 4:画风突变

表现:生成的视频和原图风格不一样,像换了个模型。

原因:图生视频模型有自己的「风格偏好」,会改变原图风格。

对策: - 在提示词中强调风格关键词("保持原画风格") - 用参考图模式(如果平台支持) - 降低运动强度,运动越小,风格保留越好


四、不同场景的动态建议

对话场景 → 微动态为主

静止镜头,人物轻微眨眼和呼吸,
嘴角微动说话,头发被风吹动一丝,
背景基本静止

重点在表演和台词,画面不要抢戏。

风景 / 空镜 → 环境动态

镜头缓慢横移,云朵飘动,水面波光粼粼,
阳光透过树叶形成光斑移动

空镜就是用来展示环境和氛围的,可以动态丰富一些。

动作场景 → 镜头运动代替人物运动

镜头快速推进(模拟冲锋感),人物姿态保持,
披风被风吹起,背景快速后移

💡 用镜头运动制造动感,比让人物做大动作更稳定、效果更好。

情感场景 → 慢推 + 微表情

镜头缓慢推向人物面部,
人物眼中泛起泪光,嘴角微微颤抖,
呼吸轻微起伏,背景虚化

越安静的镜头,情感力量越强。


💡 实操技巧

  1. 宁静勿动:新手先从「微微呼吸感」开始,不要追求大动作
  2. 短镜头剪辑:每个镜头 2~3 秒,靠剪辑组接,不要一镜到底
  3. 多生成选最好:同一个提示词生成 3~5 版,挑最稳的那一版
  4. 首帧很重要:静帧质量直接决定视频质量,静帧先调好
  5. 运镜制造动感:用镜头运动(推、拉、摇)代替人物运动,更稳定
  6. 藏手藏脚:人物手和脚容易崩,构图时尽量藏起来或避开特写

⚠️ 常见误区

误区 后果 正确做法
❌ 追求「电影级长镜头」 目前技术做不到稳定长镜头 拆成短镜头,靠剪辑组接
❌ 动作越大越好 动作越大,崩坏概率越高 以微动态为主
❌ 全画面都在动 没有视觉重点,观众看得晕 只有重点在动,其他静止
❌ 直接对低质量静帧生视频 输入垃圾,输出垃圾 先把静帧调到满意
❌ 每个镜头都动 像 PPT 转场,廉价感 该静就静,动静结合

📝 本章小结

图生视频是 AI 漫剧的核心动态技术。

核心原则:「宁静勿动,以运镜代动作」

  • ✅ 用镜头运动制造动感
  • ✅ 人物以微动态为主
  • ✅ 新手从 2~3 秒的短镜头开始练
  • ✅ 靠剪辑组接成长视频

比追求单镜头长动态更实际,效果也更好。


上一篇:09-Gemini实战指南-整理版.md 下一篇:11-动态运镜与镜头语言-整理版.md


11 · 动态运镜与镜头语言

📌 核心知识点 - 运镜是让 AI 视频从「会动的图片」变成「有叙事感短片」的灵魂 - 新手常见错误:运镜无目的、乱用 360 度旋转、节奏混乱 - 每种运镜都有其叙事功能,不是为了炫技 - 导演思维:用镜头说话,而不是全靠台词

🔧 涉及工具:即梦 AI、ComfyUI、各种图生视频工具 📋 前置知识:10-图生视频与动态效果


一、为什么运镜很重要

运镜是让 AI 视频从「会动的图片」飞跃到「有叙事感短片」的灵魂所在。

一个比喻

请把 AI 想象成一个技术一流但毫无主见的虚拟摄影师。你就是导演,你的提示词就是你对他下达的拍摄指令。如果你的指令模糊不清,他就会用最呆板、最基础的方式来交差。

好的运镜 = ?

好的运镜 = 服务于叙事 + 引导观众注意力 + 营造情绪

不是为了动而动,而是为了讲故事而动。


二、六大基础运镜方式与叙事功能

1. 推镜(Push In / Zoom In)⭐ 最常用

效果:镜头向主体推进,画面从大变小。

叙事功能: - 强调重要信息(人物表情、关键物品) - 带入角色内心世界 - 制造紧张感

适用场景: - 主角听到重要消息时,推到面部特写 - 展示关键线索(一封信、一个标记)

提示词示例:镜头缓慢推向人物面部,聚焦眼神

2. 拉镜(Pull Out / Zoom Out)

效果:镜头向后拉,画面从小变大。

叙事功能: - 展示环境,揭示场景全貌 - 制造孤独感、渺小感 - 揭示意外信息(拉远后发现主角处于危险中)

适用场景: - 从人物特写拉开,展示身处宏大场景 - 结尾拉远,余韵悠长

提示词示例:镜头缓慢后拉,揭示人物身处的宏大场景

3. 横移(Pan / Track)

效果:镜头左右平移。

叙事功能: - 展示空间环境 - 跟随人物移动 - 左右揭示信息(平移中发现新事物)

适用场景: - 展示房间 / 场景全貌 - 跟随人物走路的侧面镜头

提示词示例:镜头跟随人物向左平移,背景同步移动

4. 升降镜(Crane / Jib)

效果:镜头上下移动。

叙事功能: - 升镜:从地面升到高空,展示宏大场面 - 降镜:从高空降到地面,带入场景 - 制造仪式感、史诗感

适用场景: - 开场从天空降落到故事场景 - 大战前的俯瞰镜头

提示词示例:镜头从高空缓缓下降,落在主角身上

5. 环绕运镜(Orbit / Arc)

效果:镜头围绕主体旋转。

叙事功能: - 360 度展示人物 / 物体 - 制造炫酷感、强调重要性 - 时间凝固的感觉(子弹时间)

适用场景: - 主角首次登场的炫酷亮相 - 重要物品的展示

⚠️ 慎用:环绕很容易让人物变形,新手建议少用。一部片子用 1~2 次就够了。


6. 固定镜头(Static / Still)⭐ 最被低估

效果:镜头不动,只有画面内的元素在动。

叙事功能: - 稳定、客观、真实感 - 让观众专注于内容本身 - 对话场景的默认选择

适用场景: - 对话戏 - 表演为主的镜头 - 需要观众冷静观察的场景

💡 最好用也最容易被忽略的运镜。不是每个镜头都要动! 💡 80% 的镜头用微动态 + 固定镜头就够了。


三、运镜节奏与情绪

不同的运镜方式传递不同的情绪:

情绪 运镜特点 代表场景
平静 缓慢、稳定、固定镜头 人物静坐思考、风景空镜
紧张 快速推进、手持感、近距离 追逐戏、倒计时、悬念
宏大 升降、大远景、慢镜头 战争场面、自然景观、开场
温馨 缓慢推镜、柔光、稳定 重逢、温情时刻、回忆
混乱 快速切换、晃动、倾斜构图 打斗、灾难场景、逃亡
孤独 拉镜、远景、人物变小 独处、失落、离别

💡 导演思维:想表达什么情绪,就选对应的运镜方式。运镜不是为了炫技,是为了讲故事。


四、新手运镜四大常见错误

错误 1:每个镜头都在动

问题:生怕观众不知道「这是视频」,每个镜头都推来拉去。

纠正:固定镜头是基础,动是为了叙事,不是为了炫技。

80% 的镜头用微动态 + 固定镜头就够了。

错误 2:运镜速度太快

问题:推镜推得像开了倍速,观众头晕。

纠正:慢一点,再慢一点。

短视频里「缓慢推进」比「快速推进」高级得多。

错误 3:运镜没有动机

问题:为什么推?为什么拉?不知道,就是「想让它动起来」。

纠正:每次运镜前问自己:

这个动作为了表达什么? 答不上来就别加。

错误 4:乱用环绕旋转

问题:觉得 360 度旋转很酷,到处都用。

纠正:环绕运镜一部片子用 1~2 次就够了(主角登场、高潮时刻),用多了廉价感,还容易让人物变形。


五、运镜设计的「三段式」原则

高级运镜不是全程乱动,而是有起有落:

起幅(静止 0.5 秒) → 运动过程(2~3 秒) → 落幅(静止 0.5 秒)
阶段 作用
起幅 让观众看清初始画面,建立认知
运动 完成叙事功能(强调、展示、转移注意力)
落幅 让观众看清结果,消化信息

💡 有起幅有落幅的运镜,比全程都在动的运镜高级得多。


💡 实操技巧

  1. 先设计分镜再想运镜:先确定这个镜头要讲什么,再决定用什么运镜
  2. 慢就是高级:AI 视频里,慢动作慢运镜比快的更有质感
  3. 「三段式」运镜:起幅 → 运动 → 落幅,比全程乱动高级
  4. 用运镜「说话」:要表现孤独,就用拉镜;要表现紧张,就用推镜
  5. 对话戏尽量不动:让观众专注于台词和表演
  6. 动静结合:有动有静才有节奏,全动等于没动

⚠️ 常见误区

误区 后果 正确认识
❌ 运镜越复杂越厉害 炫技盖过内容 服务于故事的运镜才是好运镜
❌ 每个镜头都要动 观众看得累,没有重点 固定镜头也是一种运镜选择
❌ 速度越快越有张力 观众头晕,廉价感 慢推比快推更有压迫感
❌ 环绕 = 炫酷 用多了像 PPT 转场,人物还容易崩 全片用 1~2 次就够了
❌ 运镜和情绪脱节 感觉怪怪的,说不出哪里不对 情绪决定运镜,不是为了动而动

📝 本章小结

运镜的核心是 用镜头讲故事,而不是让画面「动起来就行」。

记住每种运镜的叙事功能: - 推镜 = 强调、紧张、带入 - 拉镜 = 展示、孤独、揭示 - 横移 = 跟随、展示空间 - 升降 = 宏大、仪式感 - 环绕 = 炫酷、强调(慎用) - 固定 = 稳定、专注内容

新手三原则:

宁慢勿快,宁稳勿炫,先学会用固定镜头拍好戏,再玩花活。


上一篇:10-图生视频与动态效果-整理版.md 下一篇:12-即梦人物一致性实战-整理版.md


12 · 即梦人物一致性实战

📌 核心知识点 - 即梦 AI 的图片参考功能是在线工具中一致性最好的方案之一 - 四大参考模式:智能参考、人像特征、人像写真、主体识别 - 智能参考 = 保证构图相似 - 人像特征 = 保证角色长相相似(漫剧最常用) - 人像写真 = 可以做多人合影 - 注意「模型降级」问题:参考图会降低生成质量,需要权衡

🔧 涉及工具:即梦 AI(jimeng.jianying.com) 📋 前置知识:08-文生图提示词实战与避坑


一、为什么选即梦做一致性

如果不想部署 ComfyUI、不想折腾云端部署,即梦 AI 的智能参考功能是最便捷的人物一致性方案。

即梦的优势

优势 说明
在线工具,开箱即用 不需要显卡,不需要装软件,浏览器就能用
界面友好,操作简单 新手也能快速上手
多种参考模式,各有分工 四种模式覆盖不同场景
V3 模型效果提升明显 免费模型中效果一流
和剪映生态打通 后期剪辑方便,账号通用

二、四大图片参考模式详解

模式对比总表

参考模式 核心作用 一致性类型 推荐场景 注意事项
智能参考 保构图 构图一致 固定角度的分镜 人物长相可能变
人像特征 ⭐ 保人脸 角色一致 漫剧主角统一首选 参考图要清晰正面
人像写真 可合影 多人一致 对话戏、群像戏 多人参考要选好图
主体识别 保主体形状 物体一致 产品、动物、道具 类似 ControlNet

模式 1:智能参考

核心功能:保证构图相似

效果:生成的图在构图、姿势、场景布局上和参考图接近,但人物长相可能变化较大。

适用场景: - 分镜图需要统一构图时 - 已经有满意的构图,想换角色 / 服装 / 风格 - 场景角度固定的对话戏

相似度控制: - 相似度低:只参考大概构图 - 相似度高:构图几乎一模一样,但人物和细节会变


模式 2:人像特征 ⭐ 最常用(漫剧主力)

核心功能:保证人物长相相似

效果:生成的人物面部特征和参考图一致(脸像),但姿势、场景、构图可以完全不同。

适用场景: - 同一个角色在不同场景、不同角度的镜头 - 漫剧制作中保证主角全程脸不崩 - 多镜头中保持角色统一

使用建议: - 用正面清晰的面部特写做参考图效果最好 - 参考图质量要高,模糊的图参考效果差 - 相似度建议中等偏高(70%~85%),太低不像,太高容易复制背景


模式 3:人像写真

核心功能:多人合影 / 更自然的人像生成

效果:可以同时参考多个人物,生成多人同框的画面。

适用场景: - 两个角色对话的镜头 - 群像戏 - 需要多人同时出场的场景


模式 4:主体识别

核心功能:识别主体(不一定是人),保持主体特征

效果:类似 ControlNet 的边缘检测 / 主体分割,保留主体形状。

适用场景: - 产品图生成 - 非人物主体的一致性 - 动物、物品、道具等


三、实操步骤(人像特征模式)⭐

Step 1:准备参考图

选一张高质量的角色定妆照,要求: - ✅ 清晰的正面面部特写 - ✅ 光线均匀,五官清晰 - ✅ 表情自然(不要大笑 / 闭眼) - ✅ 背景尽量干净 - ❌ 不要侧脸太严重的 - ❌ 不要模糊不清的 - ❌ 不要表情太夸张的

💡 参考图是关键中的关键。花时间做一张高质量的角色定妆照,后面所有镜头都受益。

Step 2:选择模式

打开即梦 AI → 图片生图 → 选择「人像特征」参考模式

Step 3:上传参考图 + 写提示词

  • 上传参考图
  • 调整相似度(建议 70%~85% 起步)
  • 写提示词:描述你想要的新场景、新姿势、新服装

提示词示例:

同一个女孩,穿着蓝色古装,站在花园里,侧身回望,
花瓣飘落,国风手办风格,柔和光线,半身中景

⚠️ 提示词里少描写面部特征,让参考图主导面部,避免冲突。

Step 4:生成 + 调整

问题 调整方向
生成的人不像参考图 提高相似度
太像了,连背景都复制了 降低相似度
质量下降明显 降低一点相似度,或者换个角度
还是不满意 多生成几张,选最好的

💡 批量生成择优:同参数生成 4~8 张,从中挑最像的用。


四、漫剧制作的一致性工作流

全流程

Step 1:制作角色定妆照
   (用文生图生成一张最满意的角色正面图)
         ↓
Step 2:所有分镜都用这张图做参考
   (人像特征模式,70%~85% 相似度)
         ↓
Step 3:生成每个分镜的静帧
   (场景、姿势、角度可以随意换)
         ↓
Step 4:检查一致性
   (脸像不像?服装对不对?)
         ↓
Step 5:进入图生视频环节

多角色怎么办?

每个角色单独做一张定妆照
   ↓
单人镜头 → 用对应角色的参考图
双人镜头 → 用人像写真模式,上传两张参考图
群像戏   → 主要角色保证一致,背景角色可以随意

五、常见问题与解决

问题 1:生成的人不像参考图

可能原因: - 相似度调太低了 - 参考图不清晰 / 角度太偏 - 提示词描述的面部特征和参考图冲突

解决: - 提高相似度到 85% 以上 - 换一张正面清晰的参考图 - 提示词里少描写面部特征,让参考图主导


问题 2:模型降级(质量变差)

表现:开了参考之后,画面质量明显下降,不如纯文生图精致。

原因:这是参考模式的通病——参考图会「拉低」基础模型的表现。

对策: - 权衡一致性和质量,找到平衡点 - 如果质量下降太严重,考虑用 SD / ComfyUI 方案 - 生成后再用 AI 放大 / 修复工具二次处理


问题 3:多人合影时脸混了

表现:两个人的脸长得差不多,或者特征混在一起。

对策: - 两个人的参考图特征差异要大(发型、服装、年龄差明显) - 提示词里明确描述两个人的区别 - 实在不行就先生成单人,再后期合成


问题 4:侧面 / 背面不像

表现:正面挺像的,转个角度就不像了。

对策: - 这是正常现象,目前技术限制 - 侧面镜头可以适当提高相似度 - 非常侧的角度,可以接受一定程度的「不太像」,观众看剧情不会太纠结 - 重要镜头尽量用正面 / 半侧面


💡 实操技巧

  1. 参考图是关键:花时间做一张高质量的角色定妆照,后面所有镜头都用它参考
  2. 相似度找平衡点:70%~85% 是黄金区间,多试几次找到最佳值
  3. 同一角色同一张参考图:不要频繁换参考图,否则一致性会崩
  4. 先保证脸像,再调其他:脸像才是真的像,衣服姿势都可以后期调
  5. 批量生成择优:同参数生成 4~8 张,从中挑最像的用
  6. 重要镜头多花时间:主角特写、高光镜头多生成几次选最好的
  7. 接受 80 分的一致:100% 一致目前做不到,80% 像已经足够了

⚠️ 常见误区

误区 后果 正确认识
❌ 期望 100% 一致 永远不满意,浪费大量时间 即梦是「相似」不是「复制」,80% 像已经很不错了
❌ 一张参考图走天下 某些角度效果不好 不同角度 / 表情可以微调策略
❌ 相似度拉满 100% 相似度会把背景瑕疵都复制过去 70%~85% 是黄金区间
❌ 忽略模型降级 为了一致性牺牲太多质量,得不偿失 找到一致性和质量的平衡点
❌ 参考图随便选 参考图质量差,生成质量也差 花时间做好参考图,磨刀不误砍柴工

📝 本章小结

即梦 AI 的图片参考功能是零基础做人物一致性的最佳入门方案。

四种模式各有分工:

🎯 智能参考保构图 → 固定角度分镜用 👤 人像特征保人脸 → ⭐ 漫剧主角统一首选 👥 人像写真做合影 → 对话戏、群像戏 📦 主体识别保物体 → 产品、动物、道具

核心心法: - 一张好的参考图 > 调 100 次参数 - 70%~85% 相似度是黄金区间 - 接受不完美,80 分就够了,观众看的是故事


上一篇:11-动态运镜与镜头语言-整理版.md