FEATURED · 精选文章

AI漫剧制作全流程拆解:ComfyUI批量出图与角色一致性的工程实践

发布时间 / 2026/9/7 12:22:54
来源 / 创域科博编辑部
栏目 / 资讯中心
AI漫剧制作全流程拆解:ComfyUI批量出图与角色一致性的工程实践 AI漫剧制作这两年热度很高番茄豆包comfyui红果这套组合核心目标是把一个网文故事快速变成可发布的竖屏漫画短剧。它解决的实际问题不是单点生成图片也不是让AI替你“一键出片”而是把剧本、分镜、静帧、视频、配音、剪辑这条链路串成一个能批量复制的生产流程。适合想在短剧赛道做内容的人也适合想系统学comfyui实际应用、而不是只会画单张图的AI绘画玩家。整条链路里最值得先关注的不是哪个模型最新而是角色一致性怎么控制、批量出图怎么稳定、每个环节的验收标准是什么。下面按实际落地顺序拆一遍。先讲全流程结构再讲环境准备、剧本分镜、静帧生成、动态视频、配音剪辑最后讲批量生产时最容易踩的坑。整套方案里comfyui是承上启下的关键一环所以这部分会花比较多篇幅。1. 先拆清楚AI漫剧的完整生产链路1.1 一个完整漫剧项目由哪几个环节构成一个3分钟左右的漫剧通常不是“一段视频直接生成”而是由下面这些环节拼起来的剧本分镜脚本角色设定与角色一致性控制静帧图生成静帧转动态视频配音和音效字幕、剪辑、封面、发布每个环节都有明确的输入和输出。剧本输入是故事梗概输出是带场景、台词、动作的分场脚本分镜脚本输入是剧本输出是一行一个镜头、包含景别和运镜的列表角色设定输入是角色文字描述输出是一张能作为参考的角色立绘静帧图输入是分镜列表加角色设定输出是每个镜头的画面动态视频输入是静帧图输出是一段几秒钟的镜头最后才是配音、字幕和剪辑。这个结构看起来很常规但很多新手是反着来的先急着下载一个AI视频工具生成几段画面再想办法拼成故事。这样通常做到一半就卡住了因为画面之间没有统一风格、人物长相不一致、剧情也串不起来。先拆清楚流程后面所有工作才有地方落。1.2 为什么这套组合能串起来以及哪些工具可以替代“番茄豆包comfyui红果”这四个词分别对应流程中的不同位置。番茄主要承担故事源。番茄上有大量网文内容很多短剧改编IP的来源。但不是所有作品都能直接改编开拍之前要先确认版权和授权情况。如果只是参考题材、人设和爽点结构问题不大。豆包文本生成引擎。负责写剧本、润色台词、拆解分镜、生成旁白。实际用的时候豆包可以理解成“编剧助理”。你不给它足够细的指令它就给你一些泛泛的内容后面comfyui没法直接用。comfyui图像生产引擎。这是AI漫剧最核心的工具负责角色设定、静帧图、批量出图、风格统一。相比SD WebUIcomfyui对批量流程的控制更强也更容易保存和复用工作流。红果发布和反馈渠道。红果是目前短剧内容分发的重要渠道但能不能通过审核、能不能获得推荐取决于内容质量和平台规则不是“发布了就一定有流量”。这套组合不是唯一解。大模型可以做文本生成豆包、通义千问、Kimi、文心一言都可以图像部分也可以用SD WebUI、Midjourney但单张出图可以批量控制角色一致性和镜头一致性会麻烦很多视频部分也不一定要用单一工具后面会细说。1.3 新手最容易误判的两件事第一件AI漫剧不是全自动。你仍然需要判断剧本节奏、分镜是否合理、角色表情情绪、配音语气、剪辑点。如果你把全部工作扔给AI产出的东西大概率是“看起来像漫剧但观众看不下去”。真正值钱的是你的取舍和审核能力。第二件只学一个comfyui解决不了全部问题。很多人以为学会装comfyui就等于会做漫剧其实comfyui负责的只是画面部分。一个镜头能不能成立还要看剧本张力、台词密度、配音情绪、剪辑语感。先建立起全流程概念再逐个攻破会高效很多。2. 环境怎么准备ComfyUI部署、模型和插件2.1 本机部署还是云端GPU做AI漫剧comfyui的环境不能只看能不能启动还要看能不能批量生产。先说判断标准条件本地部署云端GPU系统Windows最省心macOS和Linux也可以通常是Linux容器或Windows云主机显卡NVIDIA显卡优先显存8GB以上比较稳按小时计费不用买卡显存4GB能跑但分辨率要降到512级别batch只能设1更建议用云GPU显存12GB以上可以挑战更高分辨率和更大批次按需使用即可磁盘模型文件很多建议预留50GB以上注意数据下载和回传时间适合人群常用、要频繁调整工作流的人本机配置不够或临时跑大任务我个人的建议是如果本机是NVIDIA显卡显存8GB以上优先本机部署。原因很简单调试工作流时本地日志、模型路径、插件节点都好处理不会被网络和云主机限制卡脖子。如果只是偶尔跑一批图或者显卡太老再考虑云GPU。如果你的机器配置接近4GB显存也不是完全不能做但要重点控制三点分辨率不要拉高、batch size只能设1、视频生成尽量交给在线工具或低分辨率短片段。能做和能批量做是两回事。2.2 整合包和手动安装怎么选comfyui的安装方式主要两种整合包和手动安装。新手优先考虑社区整合包也就是常说的“秋叶comfyui整合包”这类方案。整合包最大的价值不是体积小而是把Python、Torch、CUDA、常用插件这些容易出错的依赖一次性配好下载后解压就能启动。对刚接触的人来说这比手动配环境少踩很多坑。要注意整合包版本会持续更新不同版本默认带的插件和节点不同落地时以你下载的版本为准。手动安装适合已经熟悉Python虚拟环境、经常改源码、需要最新节点的人。好处是干净可控但如果你不熟悉依赖冲突和CUDA版本问题可能会卡在启动阶段。我的建议是先用整合包跑通流程等确实需要深度定制时再迁移到手动安装。安装完成后先确认一下启动日志里有没有“CUDA”“GPU”相关提示。如果一直跑CPU速度会很慢先别急着改参数。2.3 模型、LoRA和常用插件需要提前准备哪些comfyui本体只是一个执行框架真正决定画风的是模型和节点。做AI漫剧至少要准备这几样基础大模型写实类、二次元类、国漫风格类都要准备一两个。漫剧大多数是国漫风选一个你测试下来最稳定的当主力模型。VAE很多人会忽略。VAE不加载画面经常发灰、色彩断层。很多工作流会内置VAE Loader节点需要把VAE文件放到models/vae目录。LoRA用来控制角色特征或画风。角色一致性主要靠“角色LoRA固定提示词”组合后面细说。ControlNet控制人物姿态、场景构图。做漫剧分镜时不是每次都能靠提示词控制动作ControlNet的价值在这里。常用自定义节点包比如管理图像、批量加载提示词、人脸修复、高清放大这类节点。从社区下载工作流时经常提示缺少节点在那时补装。工作流本身也很关键。社区里有很多分享的漫剧工作流通常是json文件拉进comfyui就能看到节点图。但不要指望别人工作流下载下来就能直接跑大概率会遇到缺模型、缺插件、模型路径不对的问题。导入之后先看红色报错节点补齐再跑。2.4 怎么判断资源占用是否正常跑comfyui时正常表现和异常表现要分清楚。启动阶段第一次加载模型会占几秒到几十秒显存和内存都会有明显升高。出单张图时显存峰值通常在解码前如果显存不够会出现OOM任务直接中断。批量任务阶段batch size超过显存上限会报错出现这种情况不要急着加batch先把batch降到1分辨率降一档再逐步提高。如果界面卡住先打开任务管理器看显存、内存、磁盘占用。很多“无响应”其实是显存已经被占满程序在等待资源释放不是死了。另外生成的图片会默认保存到output目录如果你跑了很久一张图也没出来先看输出目录和日志不要盲目重启。注意这里不要一上来就开最大并发先用一条样例确认输入、输出和日志都正常。3. 剧本和分镜先让内容稳下来再谈画面3.1 用豆包生成剧本时要给足结构化提示词很多人用豆包写剧本只会说“帮我写一个漫剧剧本”。这个指令太宽了出来的内容往往节奏慢、角色多、场景杂根本没法拍。我建议把提示词结构化成这样你是漫剧编剧。请根据以下故事梗概写出一集90秒到120秒的漫剧剧本。 故事梗概…… 要求 1. 开头3秒必须有冲突或悬念 2. 一集最多3个主要角色 3. 输出格式场景号 / 场景地点与时间 / 人物 / 动作描述 / 台词 / 情绪 4. 台词要短单句不超过20字方便AI配音和字幕阅读 5. 结尾留钩子为什么要这么细因为漫剧观众没有耐心。开头没有冲突观众直接划走角色太多观众记不住台词太长AI配音会读得很拖字幕也放不下。把输出格式定死是为了让豆包生成的内容能直接进入分镜阶段不用你再来回翻译。豆包不是唯一选择其他大模型也完全可以但提示词结构是通用的。你给模型的信息越具体它返回的内容就越能直接用于生产。3.2 分镜脚本要包含哪些字段分镜脚本是把文字剧本翻译成“每一段画面是什么样”的中间文件。字段越完整后面comfyui出图越省力。一个适合漫剧的分镜表至少包含这些字段字段作用示例镜头号唯一标识方便后面命名SG-001场景告诉图像生成模型画面发生在哪现代都市办公室景别控制主体在画面里的大小近景运镜后面转视频时要用的运动描述缓慢推近人物及状态谁在画面里在做什么表情动作女主眉头紧锁双手抱臂台词这个镜头对应的对白或旁白“这事没那么简单”音效/氛围提示剪辑阶段要加什么雨声低气温预计时长后期对齐时间轴4秒如果你用的是豆包可以让它按这个表格输出。如果它输出格式不稳定就让它在代码块或表格里输出再手动整理一遍。分镜字段不要偷懒后面comfyui工作流里“提示词怎么填”“视频运动怎么描述”“剪辑时镜头怎么排”全都依赖这个表。3.3 不要一口气写完剧本再去做分镜一个很常见的翻车点先用豆包写完全部剧情比如20集剧本再去拆分成几百个分镜最后跑图时发现画风、角色形象、叙事节奏都不对前面工作全部作废。我更建议先做一集。拿第一集当试验田从剧本、分镜、角色设定、静帧、视频、配音、剪辑完整跑一遍。跑通后你才知道一个分镜提示词长什么样才稳定、一集大概要多少张静帧、每张图要花多长时间。那时候再去批量生产效率才高。4. 角色设计和静帧ComfyUI工作流的核心4.1 角色一致性不是靠运气AI漫剧最折磨人的问题之一是角色上一张图和下一张图长得不一样。这不是模型不够好而是你还没有建立角色一致性控制体系。角色一致性至少靠四件事叠加固定的角色提示词。面部特征、发型、瞳孔颜色、服装、配饰、整体色调写死之后每次出图都复制同一段不要随意改。固定seed。同一个seed在相同条件下会生成高度相似的构图和脸适合同一分镜内部做微调。不要每次换随机种子。参考图。用一张角色立绘作为参考图通过ControlNet的reference、IPAdapter这类节点把参考图特征带进新的生成图。角色LoRA。如果你要长期连载推荐给每个主角练一个LoRA用十几张正面、侧面、各种表情的图训练角色稳定性会高很多。实际测试时我会为每个角色建一个“角色提示词卡”内容包括外貌、服装、风格关键词、常用负面词。每次在comfyui里填入的角色词都从同一张卡复制这样至少不会因为手误导致角色走样。4.2 分镜轮到静帧图的参数建议跑静态帧时参数不能照搬别人工作流要根据自己的显卡和画风测试。下面是一组适合多数漫剧任务的起始参数可以先按这个跑再调参数起点建议说明分辨率768x1344或9:16档位竖屏短剧为主宽高尽量保持16倍数步数20-30太少了画面粗糙太多不一定更好CFG7左右太高对比度过强太低可能发灰采样器dpmpp_2m / euler a / euler不同采样器速度和质量差异建议各测一次batch size先设1显存高再增加到2-4不要一开始就拉大seed固定一个值先固定测试画面稳定后再微调分辨率这里特别说一下。竖屏短剧通常用9:16但很多新手直接用1080x1920结果显存不够、出图速度极慢。先把分辨率设在768x1344左右跑通流程后再用高清放大节点提高最终输出分辨率。这样既控制了显存压力也保证后期画质足够。4.3 批量出图时的输入管理和输出管理批量出图时最怕的不是单张跑不出而是出完图后不知道哪张对应哪个镜头。建议给每个分镜编号文件名结构就用镜头号_角色状态这种格式比如SG-023_女主惊讶.png。这样就算跑了几百张图后期剪辑时也能一眼认出来。批量提示词有两种常见做法一种是在工作流里用“Load Text File”这类节点从文本文件里按行读取提示词另一种是先用电子表格整理好分镜表把“正向提示词”列导成txt一行一个镜头。跑之前先在表格里检查有没有空行、有没有逗号乱码、有没有包含特殊符号。很多“批量任务跑到一半停住”的问题最后查出来都是文本文件里有个全角标点或空行。还有一点批量任务不要开多个comfyui窗口同时跑。除非你机器资源非常充足否则多个进程抢显存速度会明显下降严重时直接OOM。一个任务队列一个进程是最稳的。4.4 节点报错“节点在执行过程中发生错误”怎么查这是comfyui里最常见的报错之一英文提示通常是“node在执行过程中发生错误”后面的Error report里会写具体节点信息。不要看到报错就懵按顺序排查排查点怎么确认处理方式模型路径报错节点是加载器提示找不到文件去models目录检查模型文件名和路径模型类型底模、LoRA、VAE类型不匹配确认放到对应模型目录VAE缺失图片发灰或采样后报错补加载VAE或换内置的自动VAE显存不足第一次能出图批量就中断降低分辨率、batch设1、重启comfyui插件节点缺失报错提到某个自定义节点名通过插件管理器补装对应节点包输入类型不匹配Latent、Image、Mask连线不兼容检查节点输入类型不能乱连排查顺序建议是先看Error report里第一行提到的节点名再点开节点看具体错误信息。如果是缺少模型日志会写文件路径如果是类型不匹配连线的颜色会提示你。这个问题大概率不是模型画不出而是工作流哪里没接好。5. 静帧怎么变成动态视频5.1 漫剧不需要每帧都动很多新手拿到静帧后想着把每一帧都做成大幅度运动结果人物脸崩、背景扭曲。漫剧的视觉逻辑和影视剧不太一样观众主要靠配音、字幕和剪辑节奏理解剧情画面运动更多是“让静态画面更强”不是“每个镜头都是高动态特效”。最容易上手的方式是图生视频把一张已经生成好的静帧图作为首帧加上一段镜头运动描述输出几秒钟的动态视频。镜头运动不需要复杂常见的就是推近、拉远、从左到右平移、从右到左平移、轻微手持感。如果你用的是支持首尾帧的工具可以把两个分镜的静帧作为首帧和尾帧让AI自动生成中间过渡。这种适合镜头切换比较连续的情况但生成时间更长也更容易出现变形。5.2 动态生成的参数怎么影响质量和速度动态视频生成的关键参数和静态图完全不是一套逻辑参数影响建议起点视频长度越长越容易崩先跑5秒分辨率越高越慢先低分辨率验证帧率24或3024帧够用运动幅度越大越容易变形描述里写“缓慢”seed影响视频随机性同一镜头固定seed批量生成多个任务排队列先单个验证如果一镜头的运动描述写“快速旋转拉远”视频大概率会崩。改成“镜头缓慢后拉人像保持稳定”效果反而好很多。运动幅度不要依赖数值要依赖文字描述的情绪。描述得越“缓慢”“平稳”生成越稳定。5.3 低配环境下怎么保证连续输出低配环境做动态视频最稳妥的做法是先小尺寸、短片段、少运动。可以先跑768x1344或更低的512x896分辨率时长控制在5秒以内一个镜头只做一种简单运镜。跑通之后再挑重要镜头提升分辨率和时长不要全部镜头都高规格输出。这样既控制了时间成本也减少了画崩的概率。如果生成出来的视频有闪烁优先固定seed再把运动幅度调小最后才考虑换模型。很多人一看到闪烁就换模型其实问题往往是运动描述和seed没有固定。6. 配音、字幕和剪辑别让细节毁掉整个漫剧6.1 配音怎么选音色和语速漫剧观众很大程度靠声音认角色所以不同角色一定要用不同的音色主角和配角不能都一个声音。男声、女声、少年、老爷爷、AI感太强的音色要避开优先选自然度高的声音。语速不要快单句字数控制在15到20字给配音留下清晰断句空间。配音时还要注意情绪。豆包这类工具能生成语音但经常出现“同一句话不同情绪”的情况。如果一句台词是愤怒结果音色平静观众会觉得角色情感不对。批量生成前最好先单独试配几句台词确认情绪准确再批量搞。6.2 字幕和画面怎么对轨字幕不是简单把台词贴上去。漫剧节奏快字幕一行不要超过两行最好保持在屏幕中下方人名不能错特别是角色名字要统一配音和字幕要严格对齐该断句时断句不然听感很乱。如果你用自动字幕工具生成后一定要人工检查一遍。尤其是带名称、带专业词、带口语的词自动识别经常错错别字在漫剧里很扎眼。6.3 剪辑顺序和工具选择剪辑工具不一定要上PR。从剪映这类带自动字幕、音频对齐、模板封面的工具开始效率最高。漫剧剪辑顺序我一般这样走先铺台词轨配音文件按分镜顺序排好。再放画面。每个分镜对应的视频片段按照分镜表顺序对到对应台词上。补背景音乐和音效。BGM音量不要压过配音音效比如笑声、雨声、打斗声按分镜表里的“音效/氛围”字段来。最后调字幕、转场和封面。转场不用多漫剧常见的硬切就够复杂转场反而拖节奏。剪辑时最忌讳一个镜头拖太久。如果某句台词只有3秒那画面最多给4秒不要为了好看硬拉长。6.4 发布到红果这类平台重点注意什么发布前先确认平台的基础要求。竖屏比例、视频清晰度、标题字数、封面尺寸、简介规范都要提前查清楚。标题不要走极端夸张但别违规能让人一眼看出题材和钩子最好。内容合规是底线。不要使用版权不明的人物形象、音乐、动效素材不要试图生成或发布违规内容改编别人的小说或漫画前先确认授权情况。平台审核不是静止不变的发布前最好熟悉当前规则。注意第一次发布前建议连续做出3集再根据播放、评论和完播情况调整下一批方向。不要只发一集就判断这个方向行不行。7. 批量生产和长期更新时最容易踩的坑7.1 画风漂移怎么解决长期连载最麻烦的问题不是技术不会而是画风漂移。第一集女主是黑色长发更新到第五集突然变红发观众立刻出戏。原因是不同批次出图时提示词不统一、模型被换掉、seed全随机。解决方法四步走每个角色固定一套提示词写到“角色提示词卡”里批量出图时统一复制。每个风格阶段固定一个主力模型不要每集都换新模型。产生角色参考图后用参考图节点锁住角色长相。记录每次批量任务的参数。至少包括seed、模型、提示词、LoRA方便回溯。画风漂移不是一天出现的但一旦发现就要停下来调整不要继续批量跑。7.2 文件管理和参数管理批量生产后文件会爆炸式增长。我建议每一集单独建一个文件夹里面再细分第01集/ 01_剧本/ 02_分镜/ 03_角色设定/ 04_静帧/ 05_视频/ 06_配音/ 07_输出/ 08_日志/工作流参数/这样做的原因是一集可能跑了上百张图、几十段视频如果不按镜头号命名、不归档工作流参数后面找素材和调整风格会非常痛苦。输出文件名带镜头号日志文件夹里保存当天跑过的comfyui工作流JSON这样出了问题能回查是哪个节点、哪组参数。7.3 成本和效率怎么控制AI视频生成通常是整个链路里成本最高的部分。出静帧可能几秒一张图生视频可能几分钟才出一段在线工具还可能按生成次数计费。不要先把全部视频生成完再检查建议先做三条分镜的视频确认速度和可接受度再批量推进。如果你打算长期更新优先培养“批量种子验证”的习惯先出小图批量看构图和角色再从中挑出能用的单独放大和生成视频。不要对所有图都高清放大不是每张图都值得投入算力。7.4 内容合规与版权红线AI漫剧生产时版权问题容易被忽略。你用的参考图、角色立绘、音效、BGM、小说原本都要确认来源是否合规。用AI生成角色可以参考风格但不要直接用某个影视角色、真人明星、漫画角色的形象去改这类内容发布后很容易出问题。剧本层面也一样如果你准备改编番茄上的小说先确认授权规则。公开梗概可以当灵感但逐字使用正文需要授权。内容安全这条线我建议宁可保守一点。7.5 从最小路径到批量生产的顺序最后整理一下我认为最不容易翻车的顺序先跑通单条任务环境没问题能生成一张图。再跑3到5条分镜确认角色一致性、画风稳定。完整做出一集小样剧本、分镜、静帧、视频、配音、剪辑全部走一遍。复盘问题哪里慢、哪里崩、哪里审核不过统一调整。再批量生产建立稳定的角色卡和参数记录按集推进。这套流程的好处是每一步的问题都能在较小成本内暴露出来不会等到做完十集才发现角色全变了或者素材全都不能用在最终剪辑里。整体跑下来这套流程能做到的是一周稳定产出一定集数的漫剧它解决的是“能不能持续做出来”的问题而不是“随便做个视频就一定能爆”。真正决定观众留不留下来的还是角色够不够讨喜、剧情推进快不快、每集结尾有没有钩子。技术层面我最大的感受是把comfyui一个环节玩出花不如把整条链路的稳定性先跑通。你先做出一集能看的完整作品再回头优化画质和效率不会亏。
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻