AI漫剧制作全教程 · 课程总览与学习规划
📌 课程来源:AI漫剧制作全教程(2026全新内容) 🎤 讲师:老程 📝 形式:分集精简笔记(干货 + 实操案例) 📊 体量:约 8.6 万字 → 结构化提炼版
📚 五大模块总览
本课程共 12 集,分为 5 大模块,从认知入门到实战进阶,循序渐进:
| 模块 | 包含集数 | 主题 | 核心目标 |
|---|---|---|---|
| 模块一 | 01 / 02 / 03 | 认知入门与工具准备 | 建立全流程认知,装好工具 |
| 模块二 | 04 / 05 / 06 / 07 | AI编剧心法 | 学会和AI沟通,写出好剧本 |
| 模块三 | 08 / 09 | 静帧画面生成 | 掌握提示词,生成高质量静帧 |
| 模块四 | 10 / 11 | 动态视频制作 | 让画面动起来,学会运镜叙事 |
| 模块五 | 12 | 人物一致性(核心难点) | 解决人物变脸问题 |
模块一:认知入门与工具准备
| 序号 | 笔记文件 | 核心内容 |
|---|---|---|
| 01 | 01-AI漫剧实操教程·总览篇 | 全流程SOP、市场前景、学习路线图 |
| 02 | 02-ComfyUI入门与安装 | 软件介绍、安装部署、56个内置功能 |
| 03 | 03-AIGC基础与视频生成原理 | AIGC概念、应用场景、技术路线 |
模块二:AI编剧心法
| 序号 | 笔记文件 | 核心内容 |
|---|---|---|
| 04 | 04-AI沟通大法 | 提示词方法论、6大沟通原则 |
| 05 | 05-Markdown剧本格式规范 | 剧本格式、排版语法、模板 |
| 06 | 06-AI编剧常见问题 | AI编剧坑点、质量控制 |
| 07 | 07-三幕剧结构详解 | 叙事学基础、故事结构 |
模块三:静帧画面生成
| 序号 | 笔记文件 | 核心内容 |
|---|---|---|
| 08 | 08-文生图提示词实战与避坑 | 提示词万能公式、纠错指南 |
| 09 | 09-Gemini实战指南 | Gemini 2.5 Pro 实操技巧、模板 |
模块四:动态视频制作
| 序号 | 笔记文件 | 核心内容 |
|---|---|---|
| 10 | 10-图生视频与动态效果 | 图生视频、动态效果、常见错误 |
| 11 | 11-动态运镜与镜头语言 | 镜头语言、运镜叙事、节奏控制 |
模块五:人物一致性(核心难点)
| 序号 | 笔记文件 | 核心内容 |
|---|---|---|
| 12 | 12-即梦人物一致性实战 | 智能参考 / 人像特征 / 人像写真 |
🔧 工具链全景图
【前期·剧本】 【中期·画面】 【后期·成片】
豆包 / Gemini ──→ Markdown剧本 ──→ 分镜拆解
│
▼
┌───────────┴───────────┐
▼ ▼
即梦AI(在线) ComfyUI(本地/云端)
智能参考 Flex Context
人像特征 LoRA / ControlNet
人像写真 万物迁移工作流
│ │
└───────────┬───────────┘
▼
静帧图片素材
│
▼
图生视频动态化
│
▼
配音 + 剪辑 + 字幕 = 成片
🎯 学习路径建议
零基础路线(推荐顺序)
Step 1: 01 总览篇 ─────────→ 建立全流程认知,知道每一步在干什么
↓
Step 2: 模块二 编剧(04-07)→ 内容为王,先学会和AI沟通写剧本
↓
Step 3: 模块三 画面(08-09)→ 掌握提示词,生成合格的静帧
↓
Step 4: 模块五 一致性(12)─→ 解决最核心的人物统一问题
↓
Step 5: 模块四 动态(10-11)→ 让画面动起来,加上运镜
↓
Step 6: 模块一 工具(02-03)→ 按需回看工具部署细节
速查路线(遇到问题直接跳转)
| 遇到的问题 | 直接看哪一集 |
|---|---|
| 人物不一致、变脸 | 第12集 · 即梦人物一致性实战 |
| 写不出好剧本、AI写的太烂 | 第 4 / 6 / 7 集 |
| 画面效果差、提示词不会写 | 第8集 · 文生图提示词实战 |
| 视频不动 / 动得奇怪 / 崩坏 | 第 10 / 11 集 |
📝 笔记使用说明
每篇笔记的统一结构
📌 本章核心知识点 ← 一句话知道本章学什么
🔧 涉及工具 / 📋 前置知识 ← 需要准备什么
一、正文(按逻辑分小节)
- Step 1/2/3 操作步骤
- 表格对比 / 案例展示
- ```提示词/代码``` 示例块
💡 实操技巧 ← 讲师踩坑总结的经验
⚠️ 常见误区 ← 新手高频错误,务必注意
📝 本章小结 ← 一句话回顾核心
符号速查表
| 符号 | 含义 |
|---|---|
| 💡 | 经验技巧,来自讲师实操踩坑 |
| ⚠️ | 新手高频错误,务必注意 |
| 🔧 | 涉及的工具 / 软件 |
| 📋 | 学习本章需要的前置知识 |
| ⭐ | 重点推荐 / 最常用 |
| ❌ | 错误做法 / 不推荐 |
| ✅ | 正确做法 / 推荐 |
📂 文件清单
./
├── 00-课程总览与学习规划-整理版.md ← 本文件
├── 01-AI漫剧实操教程·总览篇-整理版.md
├── 02-ComfyUI入门与安装-整理版.md
├── 03-AIGC基础与视频生成原理-整理版.md
├── 04-AI沟通大法-整理版.md
├── 05-Markdown剧本格式规范-整理版.md
├── 06-AI编剧常见问题-整理版.md
├── 07-三幕剧结构详解-整理版.md
├── 08-文生图提示词实战与避坑-整理版.md
├── 09-Gemini实战指南-整理版.md
├── 10-图生视频与动态效果-整理版.md
├── 11-动态运镜与镜头语言-整理版.md
└── 12-即梦人物一致性实战-整理版.md
🔄 更新记录
- 2026-08-22:创建总览规划,完成全部 12 集结构化整理
01 · AI漫剧实操教程(总览篇)
📌 核心知识点 - AI漫剧是2026年内容风口,平台扶持力度大(高分成 + 保底激励) - 全流程6步走:剧本 → 分镜 → 静帧 → 动态 → 配音 → 剪辑 - 人物一致性是核心难点,有即梦(在线)和 ComfyUI(本地)两套方案 - 零基础可上手,不需要画画基础,不需要高端显卡
🔧 涉及工具:豆包 / Gemini(编剧)、即梦AI、ComfyUI、Topaz Video(放大)、剪映 / PR(剪辑) 📋 前置知识:无(零基础入门)
一、为什么做AI漫剧:市场与机会
1.1 风口现状
| 维度 | 具体情况 |
|---|---|
| 市场规模 | 千亿级蓝海市场,正在爆发 |
| 平台分成 | 高达 90% 的分成比例 |
| 激励政策 | 官方保底激励,作品入库即有收益 |
| 变现方式 | 流量分成 + 贴片广告 |
1.2 门槛已被AI打破
很多人犹豫的两个问题: - ❓ 我不会画画 → AI时代,不需要画画基础 - ❓ 买不起显卡 → 在线工具(即梦等)免费可用,本地方案也有低配路线
💡 你缺的只是一套标准化的 SOP 流程。只要有一台电脑,你就等于拥有了一个动漫工作室。
1.3 本期案例:千手观音的由来
本教程以「千手观音的由来」为实战案例,贯穿全流程讲解。故事梗概:
妙庄国王有三女,小女妙善天性慈悲、淡泊名利。妙庄王欲为其安排婚事以巩固权势,妙善拒绝,被贬为庶民,往香山修行。多年后妙庄王身染恶疾,需至亲至仁者的双手双眼入药。妙善得知后,毅然割手挖眼为父治病。妙庄王痊愈后前往香山,见女儿惨状痛悔祈祷。忽金光万丈,佛陀降临,妙善化作千手千眼之圣像,普度众生。
二、全流程 SOP 总览
AI漫剧制作共分 7 大环节,环环相扣,前一步是后一步的基础:
┌─────────────┐ ┌─────────────┐ ┌─────────────┐ ┌─────────────┐
│ 1. 剧本创作 │ → │ 2. 人设+分镜 │ → │ 3. 静帧生成 │ → │ 4. 图生视频 │
└─────────────┘ └─────────────┘ └─────────────┘ └─────────────┘
↓
┌─────────────┐ ┌─────────────┐ ┌─────────────┐
│ 7. 最终输出 │ ← │ 6. 剪辑合成 │ ← │ 5. 配音配乐 │
└─────────────┘ └─────────────┘ └─────────────┘
各环节核心产出
| 步骤 | 环节 | 核心产出 | 关键工具 |
|---|---|---|---|
| 1 | 剧本创作 | 完整故事剧本(含风格定位、角色、对白) | 豆包 / GPT / Gemini |
| 2 | 人设 + 分镜 | 人物设定表 + 分镜脚本 + 初始 Prompt | 大语言模型 + 飞书文档 |
| 3 | 静帧生成 | 每个分镜对应的静态图片(人物一致、风格统一) | ComfyUI / 即梦 / MidJourney |
| 4 | 图生视频 | 每个分镜的动态视频片段 | 可灵 / 即梦 / ComfyUI(Fusion X) |
| 5 | 配音配乐 | 旁白 + 角色配音 + BGM + 音效 | 各类 TTS 工具 |
| 6 | 剪辑合成 | 拼接片段、加字幕、调色、转场 | 剪映 / PR |
| 7 | 最终输出 | 视频放大、导出成片 | Topaz Video / 剪辑软件 |
三、第一步:剧本创作
3.1 剧本包含的四要素
故事脚本
├── ① 故事剧本(整体框架、情节走向)
├── ② 人物设计(服装、外形、性格、行为特点)
├── ③ 分镜脚本(逐镜头拆解)
└── ④ Prompt 初始生成(人物 + 分镜的提示词预备)
⚠️ 为什么要提前生成人物和场景的 Prompt? 为了保证人物一致性。前期把人物特征、风格的 Prompt 统一好,后续每一张图都基于同一套描述,人物才不会"变脸"。
3.2 剧本怎么写:交给大语言模型
操作步骤:
- 你先有一个灵感或主题(例如:千手观音的由来)
- 把主题丢给大模型,让它帮你发散成完整剧本
- 在模型产出的基础上,融合你自己的想法进行修改
参考 Prompt 模板:
你是一个专业的动画编剧。
现在请以「千手观音的由来」为主题,
帮我生成一个一分半钟以上的动画剧本。
产出示例(千手观音案例):
| 项目 | 内容 |
|---|---|
| 标题 | 千手观音的由来 |
| 总时长 | 约 1 分 50 秒 |
| 风格定位 | 古风写意、感人、神话 |
| 目标受众 | 青少年及以上,对传统文化或神话故事感兴趣的观众 |
| 结构 | 片头 + 起承转合 + 高潮 + 结尾 |
四、第二步:人物设计与分镜脚本
4.1 人物设计
人物设定必须统一的四个维度:
- 👕 服装外形 — 服饰、发型、配饰、颜色
- 😊 外貌特征 — 脸型、五官、年龄感
- 🧠 性格特点 — 内向 / 外向、善良 / 威严等
- 🚶 行为举止 — 习惯性动作、说话方式
为什么前期必须做人物设计? → 为了人物一致性。前期统一了,后续每一张图的角色才能是同一个人。不做这一步,每张图的人物都长得不一样,整部片就崩了。
参考 Prompt 模板:
请帮我生成剧本中每个人物的人物设定,
需要具备:服装外形、性格、行为特点。
4.2 分镜脚本
分镜脚本 = 把剧本拆成一个一个的镜头
每个镜头包含: - 🎬 镜头画面(场景、角色、动作) - 📷 镜头运动(推 / 拉 / 摇 / 移 / 固定) - 💬 对白 / 旁白 - 🔊 音效 - ⏱️ 持续时间
参考 Prompt 模板:
帮我把这个剧本转变成分镜脚本。
每个镜头包含:画面描述、角色、镜头运动、
对白/旁白、音效、时长。
💡 实操建议:分镜脚本建议存到飞书文档 / Notion 里,方便后续随时查阅和修改。一个分镜对应一张静帧图,有多少个分镜就要生成多少张图。
五、第三步:风格选择与工具选型
5.1 整体画风怎么定
开工前必须先定风格,否则后面每张图画风不一样,整部片就乱了。
三种画风获取方式对比:
| 方式 | 说明 | 难度 | 推荐度 |
|---|---|---|---|
| 找现有风格模型 | 网上搜现成的 LoRA(如 GBT 手办风、新海诚风、宫崎骏风) | ⭐ | ⭐⭐⭐⭐⭐ |
| 自己练 LoRA | 截喜欢的动漫角色高清图,训练专属 LoRA | ⭐⭐⭐ | ⭐⭐⭐ |
| IP-Adapter 风格迁移 | 用参考图迁移风格 | ⭐⭐ | ⭐⭐(不推荐) |
❌ 为什么不推荐 IP-Adapter 控制整体风格? 容易出现颜色溢出、干扰主体、画面杂乱。质量取决于底模效果。目前仅支持 SD 1.5 和 SDXL。整体风格不建议用,但可以用在局部调整。
5.2 工具平台选择
| 平台 | 类型 | 优势 | 适合人群 |
|---|---|---|---|
| 即梦AI | 国内在线平台 | 免费、V3 模型效果好、操作简单、人物一致性方案成熟 | 新手、快速出片 |
| MidJourney | 海外在线平台 | 图像质量高、有 --cref 保持人物一致 |
追求画质、有翻墙条件 |
| ComfyUI | 本地开源 | 精细控制、批量生产、可自定义工作流 | 进阶玩家、有一定配置 |
5.3 底模选择指南
根据你的电脑配置和需求选择:
| 底模系列 | 适合人群 | 特点 |
|---|---|---|
| SD 1.5 | AI 绘画新手 | 容易起步,LoRA 资源丰富,好调教,对配置要求低 |
| SDXL | 商业接单 | 商用插图的中坚力量,效果稳定 |
| Flux | 追求前沿效果 | 新一代扩散模型,高端绘画 / 影视 / 工业设计首选,出图慢、对配置要求高 |
💡 本教程案例使用的是 Flux 1-dev FP8 底模 + GBT 手办风格 LoRA。
六、第四步:人物形象生成(一致性关键)
6.1 为什么不能直接出图?
很多新手的误区:直接写一段提示词就出图。比如:
"可爱的人物,东方女神,云层之上,雪山背景,一个年轻女子坐在金莲座上,清纯安详的面容,白丝绸蒙眼,额上红珠纱纹,乌黑飘逸的长发,精致的发饰……"
这样出的图 每次人物都不一样,做不了连贯的动画。
🔑 人物一致性是 AI 动画短片最重要的核心问题,必须专门解决。
6.2 两种人物生成方案
| 方案 | 做法 | 难度 | 效果 |
|---|---|---|---|
| 简单做法 | 生成 1 张面部特写 + 1 张全身形象 | ⭐ | 基础可用 |
| 推荐做法 | 即梦智能参考 / ComfyUI Flex Context / InstantID 等专业方案 | ⭐⭐⭐ | 一致性强 |
简单做法原理: - 面部特写 → 用 InstantID 保证脸部一致 - 全身形象 → 保证服装、体型、姿势一致
(详细操作见后续分集)
七、第五步:分镜静帧生成
7.1 第一步:确定构图
两种出图方式:
| 方式 | 做法 | 优点 | 缺点 |
|---|---|---|---|
| 直接出图 | 根据分镜 Prompt 反复抽卡调试 | 灵感多、惊喜多 | 时间成本不可控 |
| 参考出图 | 找一张构图参考图,用图生图 / ControlNet 反推 | 构图可控、符合预期 | 需要找参考图 |
参考出图的两种技术路径: - ControlNet:控制构图,强度不要太高(否则会丢失风格) - 直接图生图:简单直接,但要注意尺寸匹配问题
7.2 第二步:细化细节(重点)
构图确定后,按顺序做三件事:
① 人物一致性 → ② 其他画面调整 → ③ 确定是否需要首尾帧
① 人物一致性(万物迁移法)
思路:构图确定了,但人物的脸、衣服不对 → 用「万物迁移」工作流,把正确的角色特征迁移过去。
操作步骤(ComfyUI):
- 打开万物迁移工作流
- 上方上传参考角色图(正确的服装 / 身体 / 脸部)
- 下方上传待调整的分镜图
- 右键 → 在遮罩编辑器中打开
- 用画笔涂抹要迁移的部位(先涂衣服 → 运行 → 再涂脸部 → 运行)
- 点击运行,生成调整后的图
| 优点 | 缺点 |
|---|---|
| 方法简单,思路直观 | 比较笨,需要调试 |
| 能在保留构图的前提下换角色 | 不太可控,不是百分百精准 |
② 其他画面调整
同样用局部重绘的方式处理: - 背景细节优化 - 道具 / 装饰添加 - 光影 / 色调微调
③ 确定是否需要首尾帧
- 如果图生视频的运动幅度不大 → 一张图就够
- 如果镜头有明显的起止状态 → 需要生成首帧和尾帧两张图,让视频模型在两者之间插值
(详细操作见后续分集)
八、第六步:图生视频与动态效果
8.1 运镜提示词怎么写
推荐公式:
镜头 + 主体 + 运动 + 其他描述
示例:
中景镜头,妙善公主静坐书房窗边诵经,镜头缓缓推近至特写,窗外雪花飘落,柔和暖光。
不会写怎么办? 把分镜图发给 GPT,让它帮你写:
[上传分镜图片]
妙善公主在书房窗户旁静坐着。
帮我根据图片写一段运镜提示词,用于可灵AI图生视频。
8.2 闭源平台 vs 开源项目
| 类别 | 代表工具 | 优势 | 劣势 | 推荐场景 |
|---|---|---|---|---|
| 闭源平台 | 可灵、即梦、Runway | 质量高、人物表情自然、动作丝滑、一致性好 | 付费 / 有额度限制 | 有人物、有情感表达的镜头 |
| 开源项目 | Fusion X、AnimateDiff、CogVideo | 免费、可本地部署 | 吃配置(需 16G+ 显存)、人物情感表达弱 | 风景空镜、转场特效、无人物场景 |
8.3 重点开源模型:Fusion X
特点: - 万象 2.1 新出的视频模型 - 仅需 6~10 步 就能出高质量效果 - 比基础 One 模型快 30%~50% - 光照与运镜表现接近闭源商业模型 - 可快速导入 ComfyUI,一键上手
支持的场景: - ✅ 文生视频 - ✅ 图生视频 - ✅ 视频扩展 - ✅ 首尾帧视频生成 - ✅ 局部重绘 - ✅ 动作迁移
⚠️ 经验总结:一旦需要表达人物情感、说话,一定要用闭源模型。开源模型目前还做不好图生视频中的人物表情和口型。
(详细操作见后续分集)
九、第七步:配音、剪辑与最终输出
9.1 配音制作
根据分镜脚本中的旁白和对白,使用 TTS 工具生成音频。 - 旁白:选择合适的音色 - 角色配音:不同角色用不同音色,增强代入感 - 音效:根据场景添加环境音、动作音
(详细操作见后续分集)
9.2 剪辑合成
在剪映 / PR 中完成: 1. 把所有视频片段按分镜顺序拼接 2. 对齐配音音轨 3. 添加转场效果 4. 添加 BGM 和音效 5. 添加字幕
9.3 最终输出
- 视频放大:用 Topaz Video 提升分辨率
- 调色:统一全片色调
- 导出:选择平台适配的格式和码率
💡 实操技巧
- 风格先定:开工前先确定整体画风(如 Q 版皮克斯 3D、国风手绘等),后续所有生成都围绕统一风格
- 人物从简:新手做人物一致性,角色设计越简单越好(服饰、发型不要太复杂),面部 + 全身各一张参考图即可
- 工具组合:即梦适合快速出图 + 智能参考,ComfyUI 适合精细控制 + 批量生产,两者结合效率最高
- 分镜先行:不要边想边做,先把全部分镜脚本和静帧搞定,再统一进动态环节
⚠️ 常见误区
| 误区 | 后果 | 正确做法 |
|---|---|---|
| ❌ 一上来就做复杂人设 | 人物一致性会崩 | 从简单角色开始练手 |
| ❌ 全程只用一个工具 | 各环节效果打折扣 | 不同工具有不同优势,组合使用 |
| ❌ 跳过剧本直接画图 | 没有好故事,画面再美也没人看 | 剧本是灵魂,先把故事讲好 |
| ❌ 追求一帧完美 | 进度卡死,做不完 | 先跑通全流程,再迭代质量 |
📝 本章小结
AI漫剧制作是一个标准化的 SOP 流程:
写剧本 → 拆故事 → 定人设 → 出分镜 → 做动态 → 配音效 → 剪成片
核心难点是人物一致性,但通过即梦智能参考或 ComfyUI Flex Context / 万物迁移等方案可以有效解决。
新手路径建议: 先用即梦跑通完整流程(门槛低、速度快),建立全局认知 → 再逐步深入 ComfyUI 的高级玩法,追求更精细的控制和更高的质量。
02 · ComfyUI 入门与安装
📌 核心知识点 - ComfyUI 是一站式 AI 工具平台,官方正版免费,内置 56 个 AI 功能 - 安装三步曲:下载 → 解压 → 双击启动 - 节点式工作流,灵活可组合,适合从入门到进阶全阶段 - 2026 年 5 月新版官方原生支持中文,新手门槛大幅降低
🔧 涉及工具:ComfyUI 📋 前置知识:无
一、ComfyUI 是什么
ComfyUI 是全球公认功能最全面、生态最丰富、最贴近生产力的免费开源 AI 软件。你用它就能玩遍所有叫得上名的国内外最新最前沿的 AI 功能。
它不是野鸡套壳网站,而是全球开发者社区共同维护的顶级开源项目。
2026 年 5 月新版三大亮点(特别利好中国用户)
| 亮点 | 说明 | 意义 |
|---|---|---|
| 全中文官方界面 | 原生支持中文,不是第三方翻译插件 | 英文不好的朋友入门第一道坎直接抹平 |
| 56 个内置模板 | 官方精选 56 个经典 AI 功能,开箱即用 | 零基础也能直接上手,不用学节点 |
| 工作流预览 | 模板直接展示在工作流预览区 | 点一下就能用,不用自己搭节点 |
内置功能覆盖范围
AI绘画:文生图 / 图生图 / 扩图 / 高清放大 / 局部重绘 / 区域控制
AI视频:文生视频 / 图生视频 / 首尾帧视频 / 视频扩展
AI音频:音乐生成 / 音效生成
AI 3D:3D 建模 / 3D 渲染
... 以及更多前沿功能
节点式工作流的优势
| 特点 | 说明 |
|---|---|
| 可视化 | 每个节点做什么一目了然 |
| 可组合 | 像搭积木一样组合不同功能 |
| 可复用 | 调好的工作流存成 JSON,下次直接用 |
| 可分享 | 社区有大量现成工作流可以直接用 |
| 灵活度高 | 从简单到复杂,想怎么搭就怎么搭 |
二、安装步骤
Step 1:下载安装包
- 从官方渠道获取正版软件
- 已预配置 56 个 AI 功能,无需单独安装插件
- 下载后是一个压缩包
Step 2:解压
- ⚠️ 解压到非中文路径(路径中不要有中文和空格,否则 90% 概率报错)
- 建议预留足够磁盘空间(模型文件较大,通常几十 GB 起步)
- 推荐路径示例:
D:\ComfyUI\或D:\AI\ComfyUI\
Step 3:启动
- 双击启动脚本(
run_nvidia_gpu.bat或类似文件) - 等待终端加载完成(第一次启动会下载必要文件,需要等一会儿)
- 浏览器自动打开本地地址(通常是
http://127.0.0.1:8188) - 看到界面就表示安装成功了
💡 首次启动慢是正常的,需要加载模型和依赖。后续启动会快很多。
三、界面初识
界面三大区域
| 区域 | 位置 | 功能 |
|---|---|---|
| 左侧菜单栏 | 左边 | 节点库、工作流管理、模型管理 |
| 中间工作区 | 中央 | 节点画布,拖拽连接节点 |
| 右侧参数面板 | 右边 | 选中节点的参数调整 |
56 个内置模板在哪找
左侧菜单 → 工作流预览 → 选择你想要的功能模板 → 点击加载
内置模板涵盖: - 🎨 绘画类:文生图、图生图、高清修复、局部重绘 - 🎬 视频类:文生视频、图生视频、视频风格化 - 🔧 工具类:放大、抠图、上色
四、新手第一个工作流:文生图
操作路径
加载「文生图」模板 → 在正向提示词框输入描述 → 点击「生成」按钮 → 等待出图
基础文生图工作流包含的节点
| 节点 | 作用 |
|---|---|
| Checkpoint 加载器 | 选择底模(Flux / SDXL 等) |
| 正向提示词 | 描述你想要什么 |
| 负面提示词 | 描述你不想要什么 |
| 采样器 | 设置生成步数、CFG 等参数 |
| VAE | 解码图像 |
| 保存图像 | 输出结果 |
💡 新手不需要理解每个节点的原理,直接用内置模板就行。先跑通,再深入。
💡 实操技巧
- 路径别用中文:安装路径和模型存放路径都用英文/数字,否则容易报错
- 先跑通基础工作流:不要一上来就搞复杂节点,先跑通文生图基础流程
- 工作流可保存复用:调好的工作流存成 JSON,下次直接加载
- 善用社区资源:GitHub、B站、小红书上有大量现成的 ComfyUI 工作流可以下载
- 边用边学:不需要先学完所有节点再开始,遇到不懂的节点再查
⚠️ 常见误区
| 误区 | 后果 | 正确做法 |
|---|---|---|
| ❌ 盲目堆节点 | 节点多≠效果好,反而容易乱 | 理解每个节点作用,够用就行 |
| ❌ 路径有中文/空格 | 90% 的新手报错都是这个原因 | 全英文路径,如 D:\ComfyUI\ |
| ❌ 一上来就想搞复杂工作流 | 容易被劝退 | 从简单的文生图开始,逐步加功能 |
| ❌ 每次都从零搭节点 | 浪费时间 | 直接用内置模板或下载社区工作流 |
📝 本章小结
ComfyUI 是 AI 漫剧制作的核心工具平台,采用节点式工作流设计,灵活度极高。
- 安装简单:下载 → 解压 → 双击启动,三步搞定
- 门槛降低:官方中文 + 56 个内置模板,零基础也能上手
- 上限很高:从简单文生图到复杂的视频生成工作流都能做
- 生态丰富:全球最大的 AI 绘画开源社区,资源无限
新手建议:先加载内置的「文生图」模板跑通一次,建立信心,再慢慢探索更多功能。
上一篇:01-AI漫剧实操教程·总览篇-整理版.md 下一篇:03-AIGC基础与视频生成原理-整理版.md
03 · AIGC 基础与视频生成原理
📌 核心知识点 - AIGC = AI Generated Content,人工智能生成内容,是多模态的 - 应用场景远不止"美女跳舞":电商海报、老照片修复、动画制作、影视特效等 - AI 视频生成三大技术路线:文生视频、图生视频、视频续写 - 漫剧制作的核心路线是"图生视频"(先静后动)——人物一致性最好控制
🔧 涉及工具:各类 AI 绘画 / 视频生成工具 📋 前置知识:无
一、什么是 AIGC
基本概念
AIGC = Artificial Intelligence Generated Content 中文:生成式人工智能
落脚点是 C(Content,内容),但内容是多模态的,涵盖包罗万象。
AIGC 覆盖的内容领域
广义艺术范畴:音乐、美术、绘画、戏剧、电影 ...
+
游戏、文本、代码、3D、视频、音频 ...
=
几乎所有内容生产领域
为什么 AIGC 是生产力革命
以几个行业为例:
| 行业 | 传统方式 | AI 方式 | 效率提升 |
|---|---|---|---|
| 视频制作 | 脚本→拍摄→配音→特效→剪辑,团队几周 | AI 智能体一键生成,一人几小时 | 数十倍 |
| 电商设计 | 设计师画详情页,1~2 天/张 | AI 生成底图 + 排版,1 小时/张 | 500%+ |
| 影视特效 | 几十人团队,数周做 1 分钟短片 | 一人操作,1 小时出片 | 百倍级 |
AI 影视制作的分工模式
前期策划(分镜、剧本) → 大语言模型(GPT / Kimi / 豆包 / 文心 / DeepSeek)
画面内容(生成视频) → AI 视频工具(可灵 / 即梦 / 海螺 / ComfyUI)
后期合成(剪辑、配音) → 剪辑软件 + AI 配音工具
💡 一人成军:以前需要几十人团队的工作,现在一个人 + AI 就能完成。
二、AI 视频生成的三大技术路线
路线对比表
| 技术路线 | 输入 | 优势 | 劣势 | 适合场景 |
|---|---|---|---|---|
| 文生视频(Text-to-Video) | 一段文字 | 创意自由、从零开始 | 可控性差、人物容易崩、一致性差 | 创意短片、抽象概念 |
| 图生视频 ⭐(Image-to-Video) | 一张静态图 | 人物/场景可控、一致性好 | 需要先有静帧 | AI 漫剧主流方案 |
| 视频续写(Video-to-Video) | 一段视频 | 在已有素材基础上扩展 | 需要视频素材 | 延长镜头、风格化 |
为什么漫剧选"图生视频"路线
核心理由:人物一致性可控
文生视频:直接从文字生成视频 → 每张帧的人物都可能不一样 → 崩
图生视频:先出好静帧(人物确认好) → 再让画面动起来 → 稳
"先静后动"工作流:
Step 1: 用文生图生成高质量静帧 → 确认人物、构图、风格都满意
Step 2: 用图生视频让静帧动起来 → 只加运动,不改变人物和风格
三、图生视频实操演示
操作流程(以可灵 AI 为例)
① 上传首帧图片
↓
② 书写创意描述(运镜提示词)
↓
③ 点击「立即生成」
↓
④ 等待生成 → 得到动态视频
提示词示例
果冻切割案例:
【首帧图】:一个由梵高星空组成的果冻方块,人手拿着一把刀放在方块上方
【运镜描述】:缓慢地切果冻,在海洋里,水里有各式各样的鱼在游动,
自然光,光影斑驳,杰作,高清,极致的细节
提示词写作要点
和文生图类似,但要加上运动描述: - 主体在做什么动作 - 镜头怎么运动 - 环境中有什么在动
详细的运镜提示词写法见第 10、11 集。
四、AI 视频的应用边界
已经能做好的
- ✅ 风景空镜(云动、水动、光影变化)
- ✅ 人物微动态(眨眼、呼吸、轻微转头)
- ✅ 镜头运动(推、拉、摇、移)
- ✅ 短片段(2~5 秒)质量稳定
- ✅ 风格化视频(动漫、油画等艺术风格)
目前还做不好的
- ❌ 长视频(超过 10 秒容易崩)
- ❌ 大幅度动作(奔跑、打斗容易变形)
- ❌ 精确的口型同步
- ❌ 复杂的多人互动
- ❌ 一镜到底的完整叙事
💡 正确心态:AI 是工具,不是魔法。了解它的能力边界,扬长避短,才能用出最好效果。
💡 实操技巧
- 先静后动:先把静帧画面调到满意,再进视频生成环节,不要反过来
- 一镜一生成:每个分镜单独生成动态,不要试图一镜到底
- 短视频为主:单镜头 2~5 秒足够,太长容易崩坏
- 用剪辑弥补时长:多个短镜头剪辑在一起,比一个长镜头更稳也更好看
⚠️ 常见误区
| 误区 | 后果 | 正确认识 |
|---|---|---|
| ❌ 追求"一键生成完整视频" | 质量不可控,人物崩坏 | 目前技术做不到,拆解成短镜头 |
| ❌ 直接用文生视频做漫剧 | 人物一致性无法保证 | 用"先静后动"的图生视频路线 |
| ❌ 单镜头拉太长 | 超过 5 秒后画面容易崩 | 单镜 2~5 秒,靠剪辑组接 |
| ❌ 静帧随便做,反正要动 | 输入垃圾,输出垃圾 | 静帧质量决定了视频质量的上限 |
📝 本章小结
AIGC 是 AI 生成内容的统称,应用场景广泛,正在深刻改变内容生产方式。
做 AI 漫剧的核心技术路线是 "先静后动":
文生图出高质量静帧 → 图生视频让画面动起来
这种方式在人物一致性和画面质量之间取得了最佳平衡,是目前 AI 漫剧制作的主流方案。理解了这个底层逻辑,后面的学习就有了方向。
上一篇:02-ComfyUI入门与安装-整理版.md 下一篇:04-AI沟通大法-整理版.md
04 · AI 沟通大法
📌 核心知识点 - AI 不是搜索引擎,简短关键词得不到好结果 - 6 大沟通原则:给身份、给任务、给格式、给例子、分步骤、做迭代 - 从"命令式"转向"赋能式":把 AI 当合作者,不是工具 - 提示词质量直接决定产出质量——垃圾进,垃圾出
🔧 涉及工具:豆包、ChatGPT、Gemini 等大语言模型 📋 前置知识:无
一、新手最常见的沟通误区
误区 1:把 AI 当搜索引擎
习惯性输入简短关键词,希望 AI 像谷歌一样直接给答案。 - ❌ 输入"压力大怎么办" - 结果:得到百度百科式的通用回答,泛泛而谈,没有针对性
误区 2:只说需求不说身份
不给 AI 设定角色,它就不知道用什么视角和深度来回答。 - ❌ "给我写个剧本" - 结果:不知道给谁写、什么风格、什么水平,输出很平庸
误区 3:不指定输出格式
想要列表?表格?文章?不说清楚,AI 输出的结构就很乱。 - ❌ "帮我分析一下" - 结果:一大段文字,找信息都费劲
误区 4:一次就想完美
期望第一次就得到满意结果,不愿意迭代修改。 - ❌ 不满意就重新开一个对话 - 结果:每次都从零开始,效率极低
二、6 大沟通原则
原则 1:给身份(Role)⭐
先告诉 AI「你是谁」,它的输出立刻就有专业感。
| 反面示例 | 正面示例 |
|---|---|
| 给我写个剧本 | 你是一位资深动漫编剧,有 10 年漫剧创作经验,擅长三幕剧结构,请帮我写一个 3 分钟的古风玄幻漫剧剧本 |
为什么给身份有效? AI 会调用对应角色的知识库、语气、专业深度来回答,而不是用通用视角。
原则 2:给任务(Task)
明确告诉 AI 你要什么,越具体越好。
❌ 写个故事
✅ 写一个 3 分钟的古风漫剧剧本,主角是 18 岁的公主,
主题是"成长与牺牲",有 10 个左右分镜
原则 3:给格式(Format)
指定输出格式:Markdown、列表、表格、分镜脚本格式等。
请用 Markdown 格式输出,包含以下字段:
- 场景编号
- 画面描述
- 台词
- 时长
为什么要给格式? - 结构化的输出你更容易读 - AI 也更容易理解你的要求 - 方便后续复制到其他工具中使用
原则 4:给例子(Example)
给 AI 看一个你期望的样本,它能更快 get 到你的风格要求。
这是我喜欢的风格示例:
【镜1】大殿内,国王坐在王座上,眉头紧锁
台词:"妙善,你真的不愿意吗?"
时长:4秒
请按照这个格式,继续写下面的分镜。
原则 5:分步骤(Step by Step)
复杂任务拆成多步,比一次性说清楚效果更好。
第一步:先给我 3 个故事大纲,我选一个
第二步:基于选中的大纲,写出完整的分镜脚本
第三步:把每个分镜的提示词也写出来
原则 6:做迭代(Iterate)⭐
第一次不满意很正常,告诉 AI 哪里要改,逐步逼近理想结果。
很好,在这个基础上修改:
1. 把主角性格调得更倔强一些
2. 第三幕的冲突再激烈一点
3. 结尾留个悬念
迭代比重写效率高得多,因为 AI 已经理解了你的整体需求,只需要微调。
三、从"命令式"到"赋能式"
两种沟通方式的对比:
| 沟通方式 | 例子 | 效果 |
|---|---|---|
| 命令式 | "告诉我怎么缓解压力" | 通用答案,缺乏深度,像查百度 |
| 赋能式 | "你是资深心理咨询师,请从心理学角度分析压力的来源和应对策略" | 专业、有深度、有温度 |
💡 把 AI 想象成一个才华横溢但毫无主见的实习生。你给的方向越清晰,它的产出就越棒。
四、五大思维转变
| 转变方向 | 具体变化 |
|---|---|
| 从模糊 → 精准 | 把"写个故事"变成"为谁写、写什么、什么风格" |
| 从命令 → 赋能 | 把"告诉我"变成"你是专家,请你分析" |
| 从单词 → 迭代 | 把"不行"变成"很好,在这个基础上修改一下" |
| 从混乱 → 有序 | 用标题、列表、分隔线组织好提示词,让 AI 精准识别 |
| 从抽象 → 具体 | 把主观感受("好看一点")翻译成具体描述("暖色调、柔和光线、电影感构图") |
五、漫剧编剧提示词模板
你是一位资深动漫编剧,有 10 年漫剧创作经验,
擅长三幕剧结构,精通古风神话题材。
【任务】
请为我创作一个[时长]的漫剧剧本。
【主题】
(一句话描述核心主题)
【主角设定】
- 姓名:
- 年龄:
- 性格:
- 背景:
- 目标:
【风格要求】
- 整体风格:
- 目标受众:
- 情绪基调:
【输出要求】
1. 严格按照三幕剧结构
2. 拆分为 [X] 个分镜
3. 每个分镜包含:镜号、场景、画面描述、台词/旁白、时长
4. 输出格式:Markdown 表格
💡 实操技巧
- 用好分隔符:用标题、列表、分隔线(---)把提示词组织清楚,AI 更容易理解
- 从抽象到具体:把你的主观感受翻译成具体的描述性语言
- 建立提示词库:保存好用的提示词模板,复用经过验证的版本
- 把 AI 当下属:给任务、给标准、给示例,而不是让它猜你想要什么
- 一次只改 2~3 个点:迭代修改时每次别改太多,否则 AI 容易忘之前的要求
⚠️ 常见误区
| 误区 | 后果 | 正确做法 |
|---|---|---|
| ❌ 提示词太短 | 输出泛泛而谈,没有针对性 | 详细描述需求:身份 + 任务 + 格式 |
| ❌ 一次塞太多要求 | AI 顾此失彼,部分要求被忽略 | 复杂任务拆成 2~3 轮对话,逐步叠加 |
| ❌ 不满意就重开 | 每次从零开始,效率极低 | 迭代修改,说清楚哪里要改 |
| ❌ 只说"不好"不说"哪里不好" | AI 不知道改什么 | 具体指出问题:"第 3 个分镜节奏太慢" |
| ❌ 不用 Markdown 组织提示词 | AI 理解成本高,容易漏信息 | 用标题、列表、加粗把结构理清楚 |
📝 本章小结
和 AI 沟通的核心是 把模糊的需求变成清晰的指令。
记住 6 个关键词:
身份 → 任务 → 格式 → 例子 → 步骤 → 迭代
你和 AI 是合作者关系: - 你提供:方向、判断、审美、修改意见 - AI 提供:算力、速度、创意、第一稿
两者配合才能产出高质量内容。掌握了高效沟通,你和 AI 的潜力才能共同被激发。
上一篇:03-AIGC基础与视频生成原理-整理版.md 下一篇:05-Markdown剧本格式规范-整理版.md
05 · Markdown 剧本格式规范
📌 核心知识点 - Markdown 是一种轻量级标记语言,纯文本格式,兼容性极强 - 用简单的符号实现标题、列表、加粗、表格等排版 - AI 漫剧剧本统一用 Markdown 格式,方便 AI 理解和后续自动化处理 - 飞书文档 / Notion / Obsidian 都完美支持 Markdown
🔧 涉及工具:飞书文档、Notion、Obsidian、VS Code 📋 前置知识:无
一、为什么用 Markdown 写剧本
四大优势
| 优势 | 说明 |
|---|---|
| 纯文本格式 | 任何设备、任何软件都能打开,不会有兼容性问题 |
| AI 友好 | 大模型天生理解 Markdown 结构,生成和解析都很顺畅 |
| 结构清晰 | 标题层级一目了然,剧本 / 分镜 / 台词分区明确 |
| 方便转换 | 可以一键导出 PDF、Word、HTML 等格式 |
没有格式的文字在 AI 眼里是什么样?
没有 Markdown 格式的一大段话 = 一整块豆腐块
→ 没有重点
→ 没有结构
→ 就像读没有标点符号的课文
→ AI 很难准确理解你的意思
💡 用 Markdown 组织内容,不只是为了好看,更是为了让 AI 准确理解你的需求。
二、Markdown 基础语法(剧本常用)
1. 标题(6 级)
用 # 号表示,数量代表级别。
# 一级标题 剧名 / 大章节
## 二级标题 幕 / 场
### 三级标题 分镜 / 段落
#### 四级标题 细节说明
剧本中的层级关系:
# 千手观音·妙善传说 ← 剧名(H1)
## 第一幕:降世 ← 幕(H2)
### 镜1:王宫外景 ← 分镜(H3)
画面 / 台词 / 时长... ← 内容
2. 文本样式
**加粗文字** → 用于强调关键词、角色名
*斜体文字* → 用于旁白、心理活动
~~删除线~~ → 修改时用
3. 列表
- 无序列表项 1 用于列举角色、道具、提示词元素
- 无序列表项 2
1. 有序列表第 1 项 用于步骤、分镜编号
2. 有序列表第 2 项
4. 引用与代码块
> 引用块:用于台词、旁白展示
代码块:用于提示词、脚本、命令
5. 表格 ⭐ 做分镜表必备
| 镜号 | 场景 | 画面描述 | 台词 | 时长 |
|------|------|----------|------|------|
| 1 | 大殿内 | 主角站在中央 | "你是谁?" | 3s |
渲染效果:
| 镜号 | 场景 | 画面描述 | 台词 | 时长 |
|---|---|---|---|---|
| 1 | 大殿内 | 主角站在中央 | "你是谁?" | 3s |
6. 分隔线
--- (用于场景之间的分隔,视觉上更清晰)
三、漫剧剧本的 Markdown 模板
完整模板
# 千手观音·妙善传说
## 基本信息
- **类型**:古风神话 / 感人 / 3 分钟
- **风格定位**:国风 Q 版手办风格
- **目标受众**:青少年及以上,对传统文化感兴趣的观众
---
## 第一幕:降世
### 镜 1:王宫外景
| 项目 | 内容 |
|------|------|
| **场景** | 古代王宫,夕阳西下 |
| **画面** | 宫殿轮廓在金色余晖中,飞鸟掠过 |
| **旁白** | 相传古代有个兴林国,国王老来得女... |
| **运镜** | 镜头从天空缓缓下降,落在王宫上 |
| **时长** | 4 秒 |
---
### 镜 2:产房内
| 项目 | 内容 |
|------|------|
| **场景** | 宫内产房 |
| **画面** | 王后躺在床上,侍女伺候,婴儿啼哭 |
| **台词** | 国王:"寡人有后了!就叫妙善吧。" |
| **运镜** | 固定镜头,中景 |
| **时长** | 5 秒 |
---
## 第二幕:修行
(... 继续往下写 ...)
分镜总览表模板
在剧本开头放一个总览表,方便全局把握:
## 分镜总览
| 镜号 | 所属幕 | 场景 | 核心内容 | 时长 |
|------|--------|------|----------|------|
| 1 | 第一幕 | 王宫外景 | 开场,展示王宫 | 4s |
| 2 | 第一幕 | 产房内 | 妙善出生 | 5s |
| 3 | 第一幕 | 大殿 | 国王议婚事 | 6s |
| ... | ... | ... | ... | ... |
四、推荐工具与工作流
工具对比
| 工具 | 优点 | 适合场景 |
|---|---|---|
| 飞书文档 | 实时保存、多端同步、AI 可直接读写、协作方便 | 日常剧本工作流首选 |
| Notion | 数据库强大、可做项目管理 | 多项目管理爱好者 |
| Obsidian | 本地存储、隐私安全、插件丰富 | 喜欢本地管理的用户 |
| VS Code | 纯代码编辑、配合 Git 版本控制 | 程序员 / 技术向用户 |
| Markdown 在线编辑器 | 左右分栏实时预览 | 学习 Markdown 语法阶段 |
推荐工作流
1. 用大模型生成剧本(指定 Markdown 格式输出)
↓
2. 复制到飞书文档中,人工修改调整
↓
3. 分镜表确认后,进入画面生成环节
↓
4. 随时可以把 Markdown 复制到其他工具中使用
💡 实操技巧
- 统一模板:建立自己的剧本模板,每次新建直接套用,格式不跑偏
- 层级清晰:剧名 → 幕 → 场景 → 镜头,严格用标题层级区分,不要跳级
- 表格做分镜表:用 Markdown 表格做分镜总览,一目了然
- 飞书文档最方便:实时保存、多端同步、AI 可直接读写,新手首选
- 善用分隔线:场景之间用
---分隔,视觉上更清晰
⚠️ 常见误区
| 误区 | 后果 | 正确做法 |
|---|---|---|
| ❌ 格式混乱,想到哪写到哪 | AI 解析容易出问题,人读着也累 | 用统一模板,按层级组织 |
| ❌ 用 Word 写剧本 | 格式复杂,AI 难以解析,复制粘贴麻烦 | 转 Markdown 格式 |
| ❌ 标题层级乱跳 | 结构不清晰,AI 理解有误 | H1 → H2 → H3 逐级深入 |
| ❌ 全是大段文字不用列表 | 找信息费劲 | 能列点就列点,结构化输出 |
📝 本章小结
Markdown 是 AI 漫剧创作的"通用语言":
- AI 能懂 → 生成和解析都顺畅
- 你能读 → 结构清晰,找信息快
- 任何软件都能打开 → 兼容性无敌
剧本创作只需要掌握最常用的几个语法:
标题 + 列表 + 表格 + 加粗 + 分隔线
配合飞书文档使用,是目前最高效的剧本工作流。
上一篇:04-AI沟通大法-整理版.md 下一篇:06-AI编剧常见问题-整理版.md
06 · AI 编剧常见问题
📌 核心知识点 - AI 写剧本就像"驾驶想象力飞船":引擎很强,但方向盘在你手里 - 5 大常见问题:故事套路化、人物扁平、逻辑断裂、对话生硬、主题模糊 - 解决思路:给够背景信息、控制生成粒度、人工打磨关键情节 - AI 是"第一稿生产力",最终质量靠人的审美和判断
🔧 涉及工具:豆包、Gemini、Claude 📋 前置知识:04-AI沟通大法
一、AI 编剧的本质
一个生动的比喻
AI 就像一个才华横溢但毫无主见的编剧实习生。 它读过人类历史上所有的剧本,但你必须告诉它: 写什么、怎么写、写成什么样。
核心矛盾
AI 什么都能生成,但未必是你想要的。
新手的致命错误:开局一张纸,故事全靠"给"
期望 AI 能凭空制造一个完整、新颖、有趣的故事。
- ❌ "给我写一个有趣的科幻故事剧本"
两个问题: 1. 脱离现实:AI 会尽情想象,但和现实脱节很大 2. 千篇一律:没有差异化输入,输出的都是最常见的套路组合
二、五大常见问题与对策
问题 1:故事套路化,缺乏新意
表现:看开头就知道结尾,桥段都是老一套。
原因:AI 是基于海量文本训练的,它倾向于输出「最常见」的组合——也就是最套路的组合。
对策:
| 方法 | 说明 | 例子 |
|---|---|---|
| 喂独特设定 | 给 AI 独特的世界观和设定,打破常规 | "主角不是天选之子,是冒牌货" |
| 加反套路元素 | 故意反着来 | "勇者不想拯救世界,只想回家躺平" |
| 用假设打破常规 | 「如果…会怎样」式提问 | "如果反派赢了呢?" |
问题 2:人物扁平,像工具人
表现:角色没有性格,说话都一个味儿,行动没有动机。
对策:
- 📝 提前写好完整的人物小传 - 性格、背景、动机、口头禅 - 每个角色单独存一份文档
- 🗣️ 给每个角色独特的说话方式 - 语速快慢、用词习惯、口头禅
- 🎯 让角色的行动符合性格 - 而不是为了推进剧情强行行动
💡 人物小传越详细,AI 写出来的角色越立体。
问题 3:剧情逻辑断裂
表现:前因后果对不上,人物突然就到了某个地方,行为没有铺垫。
对策:
- ⛔ 不要让 AI 一次写完整个故事,分段生成
- ✅ 每段生成后检查逻辑连贯性,再继续下一段
- 📐 三级递进法:
第一级:故事大纲 (整体框架)
↓ 确认后再细化
第二级:详细章节 (每幕/每场的内容)
↓ 确认后再细化
第三级:具体场景 (每个分镜的细节)
问题 4:对话生硬,像说明书
表现:人物说话像念稿子,没有生活气息,全是信息灌输。
对策:
- 🎭 给角色设定说话风格(语速、用词、口头禅)
- 💬 让对话有潜台词(话里有话,不是直接说)
- 🤸 用动作和表情辅助对话,不是光靠嘴说
对比:
| 生硬版 | 自然版 |
|---|---|
| "我现在非常生气,因为你背叛了我。" | (握紧拳头,声音发抖)"你……居然是你。" |
问题 5:主题模糊,不知道在讲什么
表现:故事看完了,但不知道想表达什么,看完就忘。
对策:
- 🎯 动笔前先确定核心主题 - 例:"本片探讨的是选择与代价"
- 📍 每个主要情节都服务于主题 - 无关的情节果断砍掉
- 🔄 结尾回扣主题 - 让观众看完有所回味
三、AI 编剧的正确工作流
四步工作法
Step 1: 给足背景 → 世界观、人设、基调一次性说清
↓
Step 2: 先出大纲 → 让 AI 出 3~5 个大纲,选最好的
↓
Step 3: 拆分场景 → 大纲确认后,逐场景生成细节
↓
Step 4: 人工打磨 → AI 出第一稿,人改关键情节/对白/节奏
每一步的质量控制点
| 步骤 | 做什么 | 检查什么 |
|---|---|---|
| 给背景 | 输入世界观、人设、主题 | AI 是否理解了你的设定 |
| 出大纲 | 让 AI 出多个版本 | 故事结构是否合理、有没有亮点 |
| 拆场景 | 逐场景细化 | 逻辑是否连贯、人物行为是否合理 |
| 人工打磨 | 修改对白、节奏、高潮 | 情感是否打动人、节奏是否紧凑 |
四、新手 → 专家的升级路径
| 维度 | 新手做法 | 专家做法 |
|---|---|---|
| 提示词 | 一句话许愿式 | 详细设定 + 格式要求 + 参考示例 |
| 生成方式 | 一次写完整个剧本 | 大纲→章节→场景,三级递进 |
| 对 AI 的期待 | 一键出完美稿 | AI 出第一稿,人负责质量把关 |
| 修改方式 | 不满意就重开对话 | 迭代修改,逐步逼近目标 |
| 关键情节 | 全靠 AI 写 | 高潮、转折点人工写 |
💡 实操技巧
- 多生成几个版本:同一个需求让 AI 出 3 版,挑最好的元素组合
- "继续"指令很有用:写得不错的时候说"继续,保持风格",比重写效率高
- 关键情节自己写:高潮、转折点这些核心情节,人工写质量更有保障
- 保存人设文档:主要角色的设定单独存一个文件,每次写剧本都喂给 AI
- 建立剧本库:好的剧本、好的桥段都收集起来,以后可以参考和改编
⚠️ 常见误区
| 误区 | 后果 | 正确做法 |
|---|---|---|
| ❌ 一句话让 AI 写完整部剧本 | 质量不可能高,套路化严重 | 拆分步骤,逐级细化 |
| ❌ 完全照搬 AI 输出 | 有明显的"AI 味",缺乏灵魂 | 人工打磨,加入自己的想法 |
| ❌ 不给背景直接写 | AI 不知道你的世界观,只能瞎编 | 先给足设定,再让它写 |
| ❌ 贪多求快 | 越急着出稿,返工越多 | 慢慢来,前期越细,后期越顺 |
| ❌ 只看第一版 | 错过更好的可能 | 多生成几版,择优组合 |
📝 本章小结
AI 编剧不是"一键出稿",而是"人机协作"。
| 角色 | 负责什么 |
|---|---|
| AI | 快速出第一稿、提供创意灵感、处理重复性工作 |
| 你(人) | 方向把控、质量打磨、逻辑校验、情感注入 |
掌握「大纲先行、分段生成、人工打磨」的工作流,才能用好 AI 这个超级编剧助手。记住:AI 是引擎,你是司机。
上一篇:05-Markdown剧本格式规范-整理版.md 下一篇:07-三幕剧结构详解-整理版.md
07 · 三幕剧结构详解
📌 核心知识点 - 三幕剧是西方叙事学最基础、最强大的工具 - 结构:建置(Setup)→ 对抗(Confrontation)→ 结局(Resolution) - 每个转折点都是"钩子",抓住观众注意力 - AI 写剧本时用三幕剧框架约束,故事就不会散 - 好故事的核心是「人物弧光」,不是事件堆砌
🔧 涉及工具:所有 AI 编剧工具 📋 前置知识:06-AI编剧常见问题
一、为什么要学三幕剧
三幕剧结构是西方叙事学中最重要、最基础、最强大的一个工具。
对于想用 AI 生成故事的人来说,掌握三幕剧就等于给 AI 装上了「故事骨架」——否则 AI 写出来的东西很容易散。
💡 三幕剧不是束缚创意的公式,而是保证故事"好看"的底层逻辑。
一个比喻:过山车
把三幕剧想象成一次过山车之旅:
| 幕 | 对应过山车 | 观众感受 |
|---|---|---|
| 第一幕 | 缓缓爬上第一个高坡 | 熟悉环境、认识同伴,紧张感和期待感慢慢积累 |
| 第二幕 | 在轨道上疯狂翻滚穿梭 | 充满尖叫、刺激、绝望、惊喜,旅程最长最核心 |
| 第三幕 | 最后的最高冲刺,然后平稳回到终点 | 释放所有情绪,带着满足感离开 |
二、三幕剧完整结构
整体结构图
第一幕:建置 25% 第二幕:对抗 50% 第三幕:结局 25%
┌───────────────┐ ┌───────────────────────────┐ ┌───────────────┐
│ 开端 → 激励事件 │→│ 上升动作 → 中点 → 低潮 │→│ 高潮 → 结局 │
└───────────────┘ └───────────────────────────┘ └───────────────┘
↑ ↑ ↑
打破平静 最精彩的部分 情绪释放
时长比例
| 幕 | 占比 | 3 分钟视频 | 10 分钟视频 |
|---|---|---|---|
| 第一幕:建置 | 25% | 约 45 秒 | 约 2 分 30 秒 |
| 第二幕:对抗 | 50% | 约 1 分 30 秒 | 约 5 分钟 |
| 第三幕:结局 | 25% | 约 45 秒 | 约 2 分 30 秒 |
三、各幕详解
第一幕:建置(Setup)
核心任务:介绍主角、世界观、日常状态,然后用「激励事件」打破平静。
| 节点 | 说明 | 例子(千手观音) |
|---|---|---|
| 开端 | 展示主角的日常生活,让观众认识并代入角色 | 妙善公主在宫中生活,天性慈悲 |
| 激励事件 ⭐ | 一件事打破了主角的平静生活,故事正式开始 | 妙庄王为妙善安排婚事,妙善拒绝 |
| 第一幕转折 | 主角做出一个决定,正式踏上冒险/解决问题之路 | 妙善被贬为庶民,前往香山修行 |
⚠️ 短视频注意:激励事件尽早出现,最好在 15 秒内出现,否则观众划走了。
第二幕:对抗(Confrontation)
核心任务:主角遇到重重阻碍,在挣扎中成长。这是全剧最长、最核心的部分。
| 节点 | 说明 | 例子(千手观音) |
|---|---|---|
| 上升动作 | 主角尝试解决问题,但遇到一个比一个大的困难 | 妙善在香山修行,经历各种考验 |
| 中点转折 ⭐ | 故事中间的关键转折,可以是「伪胜利」或「伪失败」 | 妙庄王身染恶疾,需双手双眼入药 |
| 低潮 | 主角跌到谷底,一切看起来都失败了 | 众人退缩,妙善独自承受 |
| 第二幕转折 | 主角从低谷中领悟到关键道理 / 找到新方法 | 妙善毅然割手挖眼,以孝心救父 |
💡 中点要有反转:第二幕中间必须有一次大反转,否则观众会走神。 💡 低谷要足够低:跌得越低,高潮反弹才越爽。
第三幕:结局(Resolution)
核心任务:最终对决,故事收尾,情感释放。
| 节点 | 说明 | 例子(千手观音) |
|---|---|---|
| 高潮 ⭐ | 主角与最终对手/困难的正面对决 | 佛陀降临,妙善化作千手千眼圣像 |
| 结局 | 冲突解决,展示主角的变化 | 千手观音普度众生 |
| 余韵 | 新的日常状态,呼应开头 | 世间传颂妙善的故事 |
四、人物弧光(Character Arc)
好故事的核心不是「发生了什么事」,而是「主角变成了什么样的人」。
开始的主角 经历事件 结束的主角
(有缺陷/不成熟) ──────────────→ (成长/改变/觉悟)
经典人物弧光类型
| 类型 | 变化方向 | 例子 |
|---|---|---|
| 成长弧 | 弱点 → 克服 → 成长 | 胆小 → 经历考验 → 变得勇敢 |
| 堕落弧 | 好人 → 被诱惑 → 堕落 | 正直的人 → 权力腐蚀 → 黑化 |
| 救赎弧 | 坏人 → 觉醒 → 赎罪 | 罪犯 → 遇到契机 → 改过自新 |
| 牺牲弧 | 自我 → 牺牲 → 升华 | 自私的人 → 经历冒险 → 学会奉献 |
💡 没有人物弧光的故事,事件再热闹也只是流水账。
五、用 AI 写三幕剧的提示词模板
你是一位资深动漫编剧,精通三幕剧结构。
请按以下要求创作一个 [类型] 漫剧剧本:
【故事主题】:(一句话说清核心主题)
【主角设定】:(姓名、性格、背景、目标)
【时长】:3 分钟(约 12 个分镜)
【风格】:古风 / 现代 / 科幻 / ...
请严格按照三幕剧结构输出:
## 第一幕:建置(约占 25% 时长)
- 开端:展示主角日常
- 激励事件:打破平静的事件
- 第一幕转折:主角做出决定
## 第二幕:对抗(约占 50% 时长)
- 上升动作:遇到的困难和尝试
- 中点转折:中间的关键反转
- 低谷:主角跌到谷底
- 第二幕转折:找到新方法/新领悟
## 第三幕:结局(约占 25% 时长)
- 高潮:最终对决
- 结局:冲突解决
- 人物弧光:主角发生了什么变化
输出格式:Markdown
💡 实操技巧
- 先填结构再填肉:先把三幕的关键节点都定好,再写具体内容
- 激励事件尽早出现:短视频节奏快,激励事件最好在 15 秒内出现
- 中点要有反转:第二幕中间必须有一次大反转,否则观众会走神
- 低谷要足够低:跌得越低,高潮反弹才越爽
- 结尾呼应开头:结局和开头形成对照,人物弧光更明显
⚠️ 常见误区
| 误区 | 后果 | 正确做法 |
|---|---|---|
| ❌ 第一幕太长 | 观众早就划走了 | 短视频第一幕别超过总时长的 1/4 |
| ❌ 第二幕太平 | 全是流水账,没有起伏和反转 | 加中点转折,让故事有意外 |
| ❌ 结局仓促 | 高潮一下就完了,没有余韵 | 给结局留足空间,有余韵 |
| ❌ 主角没有变化 | 故事结束时主角和开始时一模一样 | 设计人物弧光,让主角成长 |
| ❌ 事件堆砌 | 发生了很多事,但不知道为什么 | 每个事件都要服务于主题和人物 |
📝 本章小结
三幕剧是故事的「骨架」:
建置(25%)→ 对抗(50%)→ 结局(25%)
四个关键转折点: 1. 🎯 激励事件 —— 故事开始 2. 🔄 中点转折 —— 剧情反转 3. 📉 低谷 —— 跌到谷底 4. 🔥 高潮 —— 最终对决
用三幕剧框架约束 AI 输出,故事就不会散。
记住:好故事的核心是人物的变化(人物弧光),而不是事件的堆砌。
上一篇:06-AI编剧常见问题-整理版.md 下一篇:08-文生图提示词实战与避坑-整理版.md
08 · 文生图提示词实战与避坑
📌 核心知识点 - 别把 AI 当"读心术":你不说清楚,AI 不可能知道你想要什么 - 提示词万能公式:主体 + 动作 + 环境 + 风格 + 构图光影 + 质量参数 - 常见错误:描述太抽象、主次不分、风格混乱、缺乏细节 - 好提示词是迭代出来的,不是一次写出来的
🔧 涉及工具:即梦 AI、ComfyUI、Midjourney 等文生图工具 📋 前置知识:04-AI沟通大法
一、新手最常犯的错误
根本误区:把 AI 当读心术
新手最大的问题:把 AI 当成了能读懂你心思的神笔马良,而不是一个需要精确指令的超级画师。
AI 这位画师虽然技艺高超,能画任何风格,但它没有任何主观想法。你说的每一个字,都是它下笔的依据。
四大常见误区
| 误区 | 表现 | 问题 |
|---|---|---|
| 描述过于空洞 | "一幅漂亮的风景画" | 漂亮的标准是什么?是山是海?是白天是黑夜?AI 完全不知道 |
| 描述太抽象 | "好看一点""高级一点""有感觉" | 这些主观感受 AI 无法理解 |
| 主次不分 | 所有元素一股脑塞进提示词 | AI 不知道什么是重点,画面会很乱 |
| 风格混乱 | 同时说"国风"+"赛博朋克"+"油画风" | AI 会混乱,出来的东西四不像 |
抽象 → 具体 的转换练习
| ❌ 抽象描述 | ✅ 具体描述 |
|---|---|
| 好看一点 | 精致五官、皮肤细腻、眼神清澈、柔和侧光 |
| 高级感 | 低饱和色调、简约构图、电影感光影、高对比度 |
| 有氛围 | 黄昏金色阳光、薄雾、丁达尔效应、景深虚化 |
| 可爱 | Q 版、大眼睛、圆润线条、明亮色彩 |
二、提示词万能公式
【主体】 + 【动作/姿态】 + 【环境/背景】 + 【风格】 + 【构图/光影】 + 【技术参数】
完整示例
一个穿着白色古装的年轻女子, ← 【主体】
站在云端,双手合十,衣袂飘飘, ← 【动作/姿态】
背景是雪山和金色夕阳, ← 【环境/背景】
国风工笔画风格,Q 版手办质感, ← 【风格】
居中构图,柔和侧光,电影感, ← 【构图/光影】
8K,超高清,高细节 ← 【技术参数】
💡 重要的放在前面:提示词的顺序很重要,越靠前权重越高,AI 越重视。
三、提示词的六大组成元素
1. 主体描述(最重要)⭐
| 类型 | 描述维度 | 例子 |
|---|---|---|
| 人物 | 年龄、性别、外貌特征、服装、表情 | 18岁少女,黑色长发,面容清丽,白色汉服 |
| 物品 | 形状、颜色、材质 | 一把古剑,青铜色,刻有龙纹 |
| 动物 | 品种、颜色、动作 | 一只白色的猫,趴在窗台上 |
2. 环境与场景
- 室内 / 室外
- 具体地点(王宫、森林、海边、书房……)
- 天气(晴天、雨天、雪天……)
- 时间(清晨、正午、黄昏、夜晚……)
3. 艺术风格
| 类别 | 例子 |
|---|---|
| 绘画风格 | 油画、水彩、素描、工笔画、赛博朋克、宫崎骏风格 |
| 3D 风格 | 皮克斯、手办、粘土、Blender 渲染 |
| 摄影风格 | 人像摄影、纪实摄影、胶片质感、拍立得 |
⚠️ 一次只选一个主风格,不要多个风格混在一起。
4. 构图与镜头
| 维度 | 选项 |
|---|---|
| 景别 | 特写、近景、中景、全景、远景 |
| 角度 | 平视、仰视、俯视、鸟瞰 |
| 构图 | 居中、三分法、对称、引导线、框架式 |
5. 光影与色彩
| 维度 | 选项 |
|---|---|
| 光线 | 自然光、侧光、逆光、柔光、硬光、电影感光影 |
| 色调 | 暖色调、冷色调、高对比、低饱和、莫兰迪色 |
6. 质量词(加分项)
8K、超高清、高细节、masterpiece(杰作)、best quality(最佳质量)、ultra detailed(超高细节)
四、提示词进阶:从新手到专业
四个级别对比
| 级别 | 提示词 | 可控度 | 效果 |
|---|---|---|---|
| ❌ 新手级 | 一个美女 | ⭐ | 随机生成,完全不可控 |
| ⚠️ 入门级 | 一个古装美女,国画风,高清 | ⭐⭐ | 有大概方向,但细节随机 |
| ✅ 进阶级 | 一个穿着白色汉服的 18 岁少女,黑色长发,面容清丽,站在桃花树下,花瓣飘落,国风水彩画风格,柔和春日光线,半身特写,8K 高细节 | ⭐⭐⭐⭐ | 结果高度可控 |
| 🏆 专业级 | 进阶级 + 具体参考图 + LoRA 模型 + ControlNet 构图控制 | ⭐⭐⭐⭐⭐ | 精准还原 |
五、负面提示词(Negative Prompt)
告诉 AI 不要什么,比只说"要什么"更能提升质量。
常用负面词
低质量、模糊、变形、多手指、丑陋、畸形、
比例失调、水印、文字、多余的肢体、
解剖学错误、面部不对称、眼睛不一致
什么时候加负面词?
- 人物经常出现多手指、变形 → 加负面词
- 画面有水印、文字 → 加负面词
- 整体质量不稳定 → 加负面词
💡 实操技巧
- 从简到繁迭代:先写基础版本看大效果,再逐步添加细节调整
- 收藏好的提示词:生成满意的图后,把提示词存下来,下次改改就能用
- 中英文混输也可以:很多模型中英文都能识别,哪个好用哪个
- 用参考图辅助:文字描述不清的,直接给 AI 看参考图
- 负面提示词很重要:告诉 AI 不要什么,比只说要什么更精准
- 多抽卡择优:同一组提示词多生成几张,挑最好的
⚠️ 常见误区
| 误区 | 后果 | 正确做法 |
|---|---|---|
| ❌ 提示词越长越好 | 堆砌关键词没用,结构清晰才重要 | 按公式组织,重点在前 |
| ❌ 一次就想完美 | 期望值太高,容易受挫 | 提示词是调出来的,不是写出来的 |
| ❌ 全是形容词 | "美丽的""帅气的"没用,AI 不知道具体什么样 | 具体描述特征,不用主观形容词 |
| ❌ 风格冲突 | "写实风格+卡通渲染"会打架 | 确定一个主风格,其他做点缀 |
| ❌ 忽略负面提示词 | 容易出现畸形、低质量画面 | 养成加负面词的习惯 |
| ❌ 主次不分 | AI 不知道重点是什么 | 重要描述放前面 |
📝 本章小结
文生图提示词的核心是 把你脑子里的画面,翻译成 AI 能理解的具体描述。
记住万能公式:
主体 + 动作 + 环境 + 风格 + 构图光影 + 质量参数
再加一个关键心法: - 从简到繁迭代,不要追求一次完美 - 配合参考图和负面提示词,才能得到稳定的高质量结果 - 多抽卡择优,好图是试出来的
上一篇:07-三幕剧结构详解-整理版.md 下一篇:09-Gemini实战指南-整理版.md
09 · Gemini 实战指南
📌 核心知识点 - Gemini 2.5 Pro 是免费模型中最好用的之一 - 支持长文本、图片理解、代码生成、多模态交互 - 适合做剧本创作、分镜描述、提示词优化等创意工作 - 配合即梦 / ComfyUI,形成「创意 → 画面」完整链路
🔧 涉及工具:Gemini 2.5 Pro(Google AI Studio) 📋 前置知识:04-AI沟通大法
一、Gemini 是什么
Gemini 2.5 Pro 是 Google 推出的大语言模型,在免费模型中表现突出。支持多模态(文字、图片、代码),上下文窗口大,适合创意类工作。
相比其他模型的优势
| 优势 | 说明 |
|---|---|
| 免费额度充足 | 日常使用基本够用 |
| 多模态能力强 | 图文理解都不错,能直接读图片 |
| 长文本处理好 | 上下文窗口大,可以喂整本书 |
| 创意写作稳定 | 故事、剧本等创意工作表现好 |
使用前提
- 需要翻墙(科学上网)
- 必须使用美国节点(日本、新加坡、香港等都不行)
- 访问地址:Google AI Studio(aistudio.google.com)
界面布局
┌─────────────────────────────────────────┐
│ 左侧区域 │ 中间对话区 │
│ 对话历史 │ 输入框 + 上传按钮 │
│ 模型选择 │ │
└─────────────────────────────────────────┘
二、Gemini 能帮漫剧制作做什么
1. 📝 剧本创作
- 生成故事大纲、分镜脚本
- 优化对白、调整节奏
- 按三幕剧结构完善故事
- 扩写 / 缩写剧情
2. 🎨 画面描述(提示词生成)
- 把简单的场景描述扩展成详细的绘画提示词
- 优化提示词结构,提升生图质量
- 生成负面提示词
- 翻译提示词(中英互译)
3. 🖼️ 图片理解与分析 ⭐
- 上传参考图,让 Gemini 描述画面内容
- 分析构图、色彩、风格,转化为文字提示词
- 对比两张图的差异
- 从分镜图反推提示词
4. 💻 技术辅助
- 写 ComfyUI 工作流的说明文档
- 解决报错、排查问题
- 生成批量处理脚本
- 学习新工具时当老师
三、使用 Gemini 的正确姿势
1. 给足上下文
不要一上来就说"帮我写个剧本",先把背景设定、人物、风格都说清楚。
❌ 帮我写个剧本
✅ 你是资深动漫编剧,这是我的角色设定 [...],
主题是 [...],风格是古风神话,
请帮我写一个 3 分钟的漫剧剧本,按三幕剧结构。
2. 用图片辅助沟通
说不清的画面,直接截图或上传参考图,Gemini 能看懂。
[上传一张人物参考图]
请描述这张图中的人物特征,并生成一组
可以在 ComfyUI 中复现这个角色的提示词。
3. 迭代优化
第一次结果不满意,说清楚哪里要改,逐步逼近目标。
整体不错,在这个基础上修改:
1. 把主角的性格调得更倔强
2. 第二幕的冲突再激烈一些
3. 结尾留个悬念
四、漫剧制作常用提示词模板
模板 1:场景描述 → 绘画提示词
我需要把这段场景描述转换成 AI 绘画提示词:
【场景】:
(粘贴你的场景描述)
【风格】:国风 Q 版手办风格
【要求】:
- 翻译成详细的绘画提示词
- 包含:主体、动作、环境、风格、构图、光影
- 同时给出负面提示词
- 输出格式:分点列出
模板 2:剧本分镜拆解
这是一段漫剧剧本,请帮我拆成分镜脚本:
【剧本】:
(粘贴剧本内容)
【要求】:
- 拆成 5-8 个分镜
- 每个分镜包含:镜号、画面描述、台词、时长
- 注意镜头语言(景别、角度、运镜)
- 输出 Markdown 表格格式
模板 3:图片 → 提示词(反推)
[上传一张参考图]
请分析这张图片,然后:
1. 用文字详细描述画面内容
2. 生成一组可以复现这张图的文生图提示词
3. 给出推荐的负面提示词
4. 风格归类(属于什么画风)
模板 4:分镜 → 运镜提示词
这是一个分镜的画面描述,请帮我写成
图生视频的运镜提示词:
【分镜描述】:
(粘贴分镜内容)
【情绪基调】:
(紧张/温馨/宏大/悲伤...)
【要求】:
- 用于即梦/可灵AI的图生视频
- 包含镜头运动 + 主体动作 + 环境动态
- 单镜头 3-5 秒,动作幅度不要太大
五、漫剧制作中的 Gemini 工作流
第一步:剧本创作
用 Gemini 写剧本、拆三幕、改对白
↓
第二步:分镜拆解
把剧本拆成分镜脚本,加上镜头语言
↓
第三步:提示词生成
把每个分镜的描述转换成绘画提示词
↓
第四步:画面生成
把提示词复制到即梦 / ComfyUI 生成静帧
↓
第五步:视频动态
再用 Gemini 生成运镜提示词,去做图生视频
💡 实操技巧
- 开新对话不纠结:一个话题聊歪了,直接开新对话,比在旧对话里纠正效率高
- 善用「继续」指令:生成到一半被截断,说"继续"就行
- 图片 + 文字组合:上传参考图 + 文字描述,效果远好于纯文字
- 保存好的对话:好用的提示词和对话存成模板,下次直接复用
- 多模态用起来:不要只用来聊天,图片理解和代码能力是很多人低估的宝藏
⚠️ 常见误区
| 误区 | 后果 | 正确做法 |
|---|---|---|
| ❌ 上下文不给全 | AI 只能瞎猜 | 把背景、人设、风格一次性说清 |
| ❌ 期待 100% 准确 | 免费模型会有幻觉,关键信息可能错 | 重要信息要自己验证 |
| ❌ 只用来聊天 | 浪费了多模态和代码能力 | 多用图片上传、代码生成功能 |
| ❌ 不满意就重开 | 每次从零开始,效率低 | 说清楚哪里不对,迭代修改 |
📝 本章小结
Gemini 2.5 Pro 是 AI 漫剧制作的「全能助手」:
写剧本 → 拆分镜 → 出提示词 → 解难题,全流程都能胜任
作为免费模型,性价比极高。配合即梦 / ComfyUI 使用,可以形成从创意到画面的完整工作流。
记住:Gemini 是创意中枢,把它用好,整个漫剧制作的效率会大幅提升。
上一篇:08-文生图提示词实战与避坑-整理版.md 下一篇:10-图生视频与动态效果-整理版.md
10 · 图生视频与动态效果
📌 核心知识点 - 图生视频(Image-to-Video)是 AI 漫剧的主流动态方案 - 动态效果不是越强越好,要服务于叙事 - 新手常见问题:乱动、变形、穿模、画面崩坏 - 提示词公式:镜头运动 + 主体动作 + 环境变化 - 核心心法:宁静勿动,以运镜代动作
🔧 涉及工具:即梦 AI、ComfyUI、可灵、Vidu 等 📋 前置知识:08-文生图提示词实战与避坑
一、AI 图生视频的现状
AI 视频生成是令人兴奋的新领域,但也带来了新的挑战。
一个比喻
当前的 AI 更像一个听指令的魔法师:你给他一张静态的画,他能让画活过来,但你必须用精准的咒语(提示词)告诉他如何活、哪里活。否则魔法就会失控,产生各种各样奇怪甚至恐怖的效果。
当前技术边界
| 方面 | 现状 |
|---|---|
| 单镜头时长 | 建议 2~5 秒,太长容易崩 |
| 动作幅度 | 微动作稳定,大动作容易变形 |
| 人物一致性 | 是最大挑战,需要专门方案 |
| 手部/面部特写 | 容易出问题,尽量避开 |
| 质量上限 | 闭源平台(可灵、即梦)> 开源方案 |
二、动态提示词的写法
核心公式
镜头运动 + 主体动作 + 环境变化
完整示例
镜头缓慢推进, ← 【镜头运动】
人物微微转头看向远方,风吹动衣摆和头发, ← 【主体动作】
背景云朵缓慢飘动,雪花缓缓落下 ← 【环境变化】
💡 重点在前:和文生图一样,提示词越靠前的内容权重越高。
镜头运动方式速查表
| 运镜方式 | 英文关键词 | 效果 | 常用程度 |
|---|---|---|---|
| 推镜 | push in / zoom in | 镜头向前推进,强调主体 | ⭐⭐⭐⭐⭐ |
| 拉镜 | pull out / zoom out | 镜头后拉,展示环境 | ⭐⭐⭐⭐ |
| 横移 | pan left/right | 左右平移,展示空间 | ⭐⭐⭐⭐ |
| 环绕 | orbit / circle around | 360 度环绕,立体感 | ⭐⭐ |
| 升降 | crane up/down | 上下移动,宏大感 | ⭐⭐⭐ |
| 静止 | static / still | 固定镜头,只有微动 | ⭐⭐⭐⭐⭐ |
主体动作分级
| 级别 | 例子 | 稳定性 | 推荐度 |
|---|---|---|---|
| 微动作 | 眨眼、微笑、转头、呼吸感、头发飘动 | 高 | ⭐⭐⭐⭐⭐ 新手首选 |
| 中等动作 | 走路、转身、挥手、说话 | 中 | ⭐⭐⭐ 谨慎使用 |
| 大动作 | 打斗、奔跑、跳跃、大幅度转身 | 低 | ⭐ 新手慎用 |
💡 新手记住:能不动就不动,动就微动。
环境动态元素
| 类别 | 例子 | 效果 |
|---|---|---|
| 自然元素 | 风吹树叶、水流、云动、雪花飘落、花瓣飞舞 | 增加画面生气 |
| 光影变化 | 日出日落、灯光闪烁、光斑移动 | 增加氛围感 |
| 粒子效果 | 灰尘、光斑、烟雾、萤火 | 增加梦幻感 |
| 前景遮挡 | 树叶飘动、窗格影子 | 增加层次感 |
三、常见动态错误与解决
错误 1:画面乱动,没有重点
表现:整个画面到处都在动,不知道看哪里,看得头晕。
原因:提示词没说清楚什么该动、什么不该动。
对策: - 明确指定「只有 XX 在动,其他保持静止」 - 优先保证主体不动,只加微动(呼吸感、眨眼)
错误 2:人物变形 / 崩坏
表现:脸歪了、手多了、身体扭曲、五官乱飞。
原因:大幅度动作 + 模型能力不足。
对策: - 减少动作幅度,以微动态为主 - 避开大角度转身、剧烈运动 - 手部尽量藏起来(放口袋、放身后、被遮挡) - 避开手部特写、面部大表情
错误 3:穿模
表现:身体穿过衣服、头发穿过脸、人物嵌进背景。
原因:AI 对空间关系理解不准确。
对策: - 选择动作幅度小的镜头 - 人物和背景层次不要太复杂 - 用遮罩(mask)分层控制(进阶操作)
错误 4:画风突变
表现:生成的视频和原图风格不一样,像换了个模型。
原因:图生视频模型有自己的「风格偏好」,会改变原图风格。
对策: - 在提示词中强调风格关键词("保持原画风格") - 用参考图模式(如果平台支持) - 降低运动强度,运动越小,风格保留越好
四、不同场景的动态建议
对话场景 → 微动态为主
静止镜头,人物轻微眨眼和呼吸,
嘴角微动说话,头发被风吹动一丝,
背景基本静止
重点在表演和台词,画面不要抢戏。
风景 / 空镜 → 环境动态
镜头缓慢横移,云朵飘动,水面波光粼粼,
阳光透过树叶形成光斑移动
空镜就是用来展示环境和氛围的,可以动态丰富一些。
动作场景 → 镜头运动代替人物运动
镜头快速推进(模拟冲锋感),人物姿态保持,
披风被风吹起,背景快速后移
💡 用镜头运动制造动感,比让人物做大动作更稳定、效果更好。
情感场景 → 慢推 + 微表情
镜头缓慢推向人物面部,
人物眼中泛起泪光,嘴角微微颤抖,
呼吸轻微起伏,背景虚化
越安静的镜头,情感力量越强。
💡 实操技巧
- 宁静勿动:新手先从「微微呼吸感」开始,不要追求大动作
- 短镜头剪辑:每个镜头 2~3 秒,靠剪辑组接,不要一镜到底
- 多生成选最好:同一个提示词生成 3~5 版,挑最稳的那一版
- 首帧很重要:静帧质量直接决定视频质量,静帧先调好
- 运镜制造动感:用镜头运动(推、拉、摇)代替人物运动,更稳定
- 藏手藏脚:人物手和脚容易崩,构图时尽量藏起来或避开特写
⚠️ 常见误区
| 误区 | 后果 | 正确做法 |
|---|---|---|
| ❌ 追求「电影级长镜头」 | 目前技术做不到稳定长镜头 | 拆成短镜头,靠剪辑组接 |
| ❌ 动作越大越好 | 动作越大,崩坏概率越高 | 以微动态为主 |
| ❌ 全画面都在动 | 没有视觉重点,观众看得晕 | 只有重点在动,其他静止 |
| ❌ 直接对低质量静帧生视频 | 输入垃圾,输出垃圾 | 先把静帧调到满意 |
| ❌ 每个镜头都动 | 像 PPT 转场,廉价感 | 该静就静,动静结合 |
📝 本章小结
图生视频是 AI 漫剧的核心动态技术。
核心原则:「宁静勿动,以运镜代动作」
- ✅ 用镜头运动制造动感
- ✅ 人物以微动态为主
- ✅ 新手从 2~3 秒的短镜头开始练
- ✅ 靠剪辑组接成长视频
比追求单镜头长动态更实际,效果也更好。
上一篇:09-Gemini实战指南-整理版.md 下一篇:11-动态运镜与镜头语言-整理版.md
11 · 动态运镜与镜头语言
📌 核心知识点 - 运镜是让 AI 视频从「会动的图片」变成「有叙事感短片」的灵魂 - 新手常见错误:运镜无目的、乱用 360 度旋转、节奏混乱 - 每种运镜都有其叙事功能,不是为了炫技 - 导演思维:用镜头说话,而不是全靠台词
🔧 涉及工具:即梦 AI、ComfyUI、各种图生视频工具 📋 前置知识:10-图生视频与动态效果
一、为什么运镜很重要
运镜是让 AI 视频从「会动的图片」飞跃到「有叙事感短片」的灵魂所在。
一个比喻
请把 AI 想象成一个技术一流但毫无主见的虚拟摄影师。你就是导演,你的提示词就是你对他下达的拍摄指令。如果你的指令模糊不清,他就会用最呆板、最基础的方式来交差。
好的运镜 = ?
好的运镜 = 服务于叙事 + 引导观众注意力 + 营造情绪
不是为了动而动,而是为了讲故事而动。
二、六大基础运镜方式与叙事功能
1. 推镜(Push In / Zoom In)⭐ 最常用
效果:镜头向主体推进,画面从大变小。
叙事功能: - 强调重要信息(人物表情、关键物品) - 带入角色内心世界 - 制造紧张感
适用场景: - 主角听到重要消息时,推到面部特写 - 展示关键线索(一封信、一个标记)
提示词示例:镜头缓慢推向人物面部,聚焦眼神
2. 拉镜(Pull Out / Zoom Out)
效果:镜头向后拉,画面从小变大。
叙事功能: - 展示环境,揭示场景全貌 - 制造孤独感、渺小感 - 揭示意外信息(拉远后发现主角处于危险中)
适用场景: - 从人物特写拉开,展示身处宏大场景 - 结尾拉远,余韵悠长
提示词示例:镜头缓慢后拉,揭示人物身处的宏大场景
3. 横移(Pan / Track)
效果:镜头左右平移。
叙事功能: - 展示空间环境 - 跟随人物移动 - 左右揭示信息(平移中发现新事物)
适用场景: - 展示房间 / 场景全貌 - 跟随人物走路的侧面镜头
提示词示例:镜头跟随人物向左平移,背景同步移动
4. 升降镜(Crane / Jib)
效果:镜头上下移动。
叙事功能: - 升镜:从地面升到高空,展示宏大场面 - 降镜:从高空降到地面,带入场景 - 制造仪式感、史诗感
适用场景: - 开场从天空降落到故事场景 - 大战前的俯瞰镜头
提示词示例:镜头从高空缓缓下降,落在主角身上
5. 环绕运镜(Orbit / Arc)
效果:镜头围绕主体旋转。
叙事功能: - 360 度展示人物 / 物体 - 制造炫酷感、强调重要性 - 时间凝固的感觉(子弹时间)
适用场景: - 主角首次登场的炫酷亮相 - 重要物品的展示
⚠️ 慎用:环绕很容易让人物变形,新手建议少用。一部片子用 1~2 次就够了。
6. 固定镜头(Static / Still)⭐ 最被低估
效果:镜头不动,只有画面内的元素在动。
叙事功能: - 稳定、客观、真实感 - 让观众专注于内容本身 - 对话场景的默认选择
适用场景: - 对话戏 - 表演为主的镜头 - 需要观众冷静观察的场景
💡 最好用也最容易被忽略的运镜。不是每个镜头都要动! 💡 80% 的镜头用微动态 + 固定镜头就够了。
三、运镜节奏与情绪
不同的运镜方式传递不同的情绪:
| 情绪 | 运镜特点 | 代表场景 |
|---|---|---|
| 平静 | 缓慢、稳定、固定镜头 | 人物静坐思考、风景空镜 |
| 紧张 | 快速推进、手持感、近距离 | 追逐戏、倒计时、悬念 |
| 宏大 | 升降、大远景、慢镜头 | 战争场面、自然景观、开场 |
| 温馨 | 缓慢推镜、柔光、稳定 | 重逢、温情时刻、回忆 |
| 混乱 | 快速切换、晃动、倾斜构图 | 打斗、灾难场景、逃亡 |
| 孤独 | 拉镜、远景、人物变小 | 独处、失落、离别 |
💡 导演思维:想表达什么情绪,就选对应的运镜方式。运镜不是为了炫技,是为了讲故事。
四、新手运镜四大常见错误
错误 1:每个镜头都在动
问题:生怕观众不知道「这是视频」,每个镜头都推来拉去。
纠正:固定镜头是基础,动是为了叙事,不是为了炫技。
80% 的镜头用微动态 + 固定镜头就够了。
错误 2:运镜速度太快
问题:推镜推得像开了倍速,观众头晕。
纠正:慢一点,再慢一点。
短视频里「缓慢推进」比「快速推进」高级得多。
错误 3:运镜没有动机
问题:为什么推?为什么拉?不知道,就是「想让它动起来」。
纠正:每次运镜前问自己:
这个动作为了表达什么? 答不上来就别加。
错误 4:乱用环绕旋转
问题:觉得 360 度旋转很酷,到处都用。
纠正:环绕运镜一部片子用 1~2 次就够了(主角登场、高潮时刻),用多了廉价感,还容易让人物变形。
五、运镜设计的「三段式」原则
高级运镜不是全程乱动,而是有起有落:
起幅(静止 0.5 秒) → 运动过程(2~3 秒) → 落幅(静止 0.5 秒)
| 阶段 | 作用 |
|---|---|
| 起幅 | 让观众看清初始画面,建立认知 |
| 运动 | 完成叙事功能(强调、展示、转移注意力) |
| 落幅 | 让观众看清结果,消化信息 |
💡 有起幅有落幅的运镜,比全程都在动的运镜高级得多。
💡 实操技巧
- 先设计分镜再想运镜:先确定这个镜头要讲什么,再决定用什么运镜
- 慢就是高级:AI 视频里,慢动作慢运镜比快的更有质感
- 「三段式」运镜:起幅 → 运动 → 落幅,比全程乱动高级
- 用运镜「说话」:要表现孤独,就用拉镜;要表现紧张,就用推镜
- 对话戏尽量不动:让观众专注于台词和表演
- 动静结合:有动有静才有节奏,全动等于没动
⚠️ 常见误区
| 误区 | 后果 | 正确认识 |
|---|---|---|
| ❌ 运镜越复杂越厉害 | 炫技盖过内容 | 服务于故事的运镜才是好运镜 |
| ❌ 每个镜头都要动 | 观众看得累,没有重点 | 固定镜头也是一种运镜选择 |
| ❌ 速度越快越有张力 | 观众头晕,廉价感 | 慢推比快推更有压迫感 |
| ❌ 环绕 = 炫酷 | 用多了像 PPT 转场,人物还容易崩 | 全片用 1~2 次就够了 |
| ❌ 运镜和情绪脱节 | 感觉怪怪的,说不出哪里不对 | 情绪决定运镜,不是为了动而动 |
📝 本章小结
运镜的核心是 用镜头讲故事,而不是让画面「动起来就行」。
记住每种运镜的叙事功能: - 推镜 = 强调、紧张、带入 - 拉镜 = 展示、孤独、揭示 - 横移 = 跟随、展示空间 - 升降 = 宏大、仪式感 - 环绕 = 炫酷、强调(慎用) - 固定 = 稳定、专注内容
新手三原则:
宁慢勿快,宁稳勿炫,先学会用固定镜头拍好戏,再玩花活。
上一篇:10-图生视频与动态效果-整理版.md 下一篇:12-即梦人物一致性实战-整理版.md
12 · 即梦人物一致性实战
📌 核心知识点 - 即梦 AI 的图片参考功能是在线工具中一致性最好的方案之一 - 四大参考模式:智能参考、人像特征、人像写真、主体识别 - 智能参考 = 保证构图相似 - 人像特征 = 保证角色长相相似(漫剧最常用) - 人像写真 = 可以做多人合影 - 注意「模型降级」问题:参考图会降低生成质量,需要权衡
🔧 涉及工具:即梦 AI(jimeng.jianying.com) 📋 前置知识:08-文生图提示词实战与避坑
一、为什么选即梦做一致性
如果不想部署 ComfyUI、不想折腾云端部署,即梦 AI 的智能参考功能是最便捷的人物一致性方案。
即梦的优势
| 优势 | 说明 |
|---|---|
| 在线工具,开箱即用 | 不需要显卡,不需要装软件,浏览器就能用 |
| 界面友好,操作简单 | 新手也能快速上手 |
| 多种参考模式,各有分工 | 四种模式覆盖不同场景 |
| V3 模型效果提升明显 | 免费模型中效果一流 |
| 和剪映生态打通 | 后期剪辑方便,账号通用 |
二、四大图片参考模式详解
模式对比总表
| 参考模式 | 核心作用 | 一致性类型 | 推荐场景 | 注意事项 |
|---|---|---|---|---|
| 智能参考 | 保构图 | 构图一致 | 固定角度的分镜 | 人物长相可能变 |
| 人像特征 ⭐ | 保人脸 | 角色一致 | 漫剧主角统一首选 | 参考图要清晰正面 |
| 人像写真 | 可合影 | 多人一致 | 对话戏、群像戏 | 多人参考要选好图 |
| 主体识别 | 保主体形状 | 物体一致 | 产品、动物、道具 | 类似 ControlNet |
模式 1:智能参考
核心功能:保证构图相似
效果:生成的图在构图、姿势、场景布局上和参考图接近,但人物长相可能变化较大。
适用场景: - 分镜图需要统一构图时 - 已经有满意的构图,想换角色 / 服装 / 风格 - 场景角度固定的对话戏
相似度控制: - 相似度低:只参考大概构图 - 相似度高:构图几乎一模一样,但人物和细节会变
模式 2:人像特征 ⭐ 最常用(漫剧主力)
核心功能:保证人物长相相似
效果:生成的人物面部特征和参考图一致(脸像),但姿势、场景、构图可以完全不同。
适用场景: - 同一个角色在不同场景、不同角度的镜头 - 漫剧制作中保证主角全程脸不崩 - 多镜头中保持角色统一
使用建议: - 用正面清晰的面部特写做参考图效果最好 - 参考图质量要高,模糊的图参考效果差 - 相似度建议中等偏高(70%~85%),太低不像,太高容易复制背景
模式 3:人像写真
核心功能:多人合影 / 更自然的人像生成
效果:可以同时参考多个人物,生成多人同框的画面。
适用场景: - 两个角色对话的镜头 - 群像戏 - 需要多人同时出场的场景
模式 4:主体识别
核心功能:识别主体(不一定是人),保持主体特征
效果:类似 ControlNet 的边缘检测 / 主体分割,保留主体形状。
适用场景: - 产品图生成 - 非人物主体的一致性 - 动物、物品、道具等
三、实操步骤(人像特征模式)⭐
Step 1:准备参考图
选一张高质量的角色定妆照,要求: - ✅ 清晰的正面面部特写 - ✅ 光线均匀,五官清晰 - ✅ 表情自然(不要大笑 / 闭眼) - ✅ 背景尽量干净 - ❌ 不要侧脸太严重的 - ❌ 不要模糊不清的 - ❌ 不要表情太夸张的
💡 参考图是关键中的关键。花时间做一张高质量的角色定妆照,后面所有镜头都受益。
Step 2:选择模式
打开即梦 AI → 图片生图 → 选择「人像特征」参考模式
Step 3:上传参考图 + 写提示词
- 上传参考图
- 调整相似度(建议 70%~85% 起步)
- 写提示词:描述你想要的新场景、新姿势、新服装
提示词示例:
同一个女孩,穿着蓝色古装,站在花园里,侧身回望,
花瓣飘落,国风手办风格,柔和光线,半身中景
⚠️ 提示词里少描写面部特征,让参考图主导面部,避免冲突。
Step 4:生成 + 调整
| 问题 | 调整方向 |
|---|---|
| 生成的人不像参考图 | 提高相似度 |
| 太像了,连背景都复制了 | 降低相似度 |
| 质量下降明显 | 降低一点相似度,或者换个角度 |
| 还是不满意 | 多生成几张,选最好的 |
💡 批量生成择优:同参数生成 4~8 张,从中挑最像的用。
四、漫剧制作的一致性工作流
全流程
Step 1:制作角色定妆照
(用文生图生成一张最满意的角色正面图)
↓
Step 2:所有分镜都用这张图做参考
(人像特征模式,70%~85% 相似度)
↓
Step 3:生成每个分镜的静帧
(场景、姿势、角度可以随意换)
↓
Step 4:检查一致性
(脸像不像?服装对不对?)
↓
Step 5:进入图生视频环节
多角色怎么办?
每个角色单独做一张定妆照
↓
单人镜头 → 用对应角色的参考图
双人镜头 → 用人像写真模式,上传两张参考图
群像戏 → 主要角色保证一致,背景角色可以随意
五、常见问题与解决
问题 1:生成的人不像参考图
可能原因: - 相似度调太低了 - 参考图不清晰 / 角度太偏 - 提示词描述的面部特征和参考图冲突
解决: - 提高相似度到 85% 以上 - 换一张正面清晰的参考图 - 提示词里少描写面部特征,让参考图主导
问题 2:模型降级(质量变差)
表现:开了参考之后,画面质量明显下降,不如纯文生图精致。
原因:这是参考模式的通病——参考图会「拉低」基础模型的表现。
对策: - 权衡一致性和质量,找到平衡点 - 如果质量下降太严重,考虑用 SD / ComfyUI 方案 - 生成后再用 AI 放大 / 修复工具二次处理
问题 3:多人合影时脸混了
表现:两个人的脸长得差不多,或者特征混在一起。
对策: - 两个人的参考图特征差异要大(发型、服装、年龄差明显) - 提示词里明确描述两个人的区别 - 实在不行就先生成单人,再后期合成
问题 4:侧面 / 背面不像
表现:正面挺像的,转个角度就不像了。
对策: - 这是正常现象,目前技术限制 - 侧面镜头可以适当提高相似度 - 非常侧的角度,可以接受一定程度的「不太像」,观众看剧情不会太纠结 - 重要镜头尽量用正面 / 半侧面
💡 实操技巧
- 参考图是关键:花时间做一张高质量的角色定妆照,后面所有镜头都用它参考
- 相似度找平衡点:70%~85% 是黄金区间,多试几次找到最佳值
- 同一角色同一张参考图:不要频繁换参考图,否则一致性会崩
- 先保证脸像,再调其他:脸像才是真的像,衣服姿势都可以后期调
- 批量生成择优:同参数生成 4~8 张,从中挑最像的用
- 重要镜头多花时间:主角特写、高光镜头多生成几次选最好的
- 接受 80 分的一致:100% 一致目前做不到,80% 像已经足够了
⚠️ 常见误区
| 误区 | 后果 | 正确认识 |
|---|---|---|
| ❌ 期望 100% 一致 | 永远不满意,浪费大量时间 | 即梦是「相似」不是「复制」,80% 像已经很不错了 |
| ❌ 一张参考图走天下 | 某些角度效果不好 | 不同角度 / 表情可以微调策略 |
| ❌ 相似度拉满 | 100% 相似度会把背景瑕疵都复制过去 | 70%~85% 是黄金区间 |
| ❌ 忽略模型降级 | 为了一致性牺牲太多质量,得不偿失 | 找到一致性和质量的平衡点 |
| ❌ 参考图随便选 | 参考图质量差,生成质量也差 | 花时间做好参考图,磨刀不误砍柴工 |
📝 本章小结
即梦 AI 的图片参考功能是零基础做人物一致性的最佳入门方案。
四种模式各有分工:
🎯 智能参考保构图 → 固定角度分镜用 👤 人像特征保人脸 → ⭐ 漫剧主角统一首选 👥 人像写真做合影 → 对话戏、群像戏 📦 主体识别保物体 → 产品、动物、道具
核心心法: - 一张好的参考图 > 调 100 次参数 - 70%~85% 相似度是黄金区间 - 接受不完美,80 分就够了,观众看的是故事