一本五页绘本不到一块钱,Make 加 Flux 把插画排版全包了

一本五页绘本不到一块钱,Make 加 Flux 把插画排版全包了

在手机上点一下 Notion 里的「开始」链接,三分钟后,同一个知识库里躺着一本五页的儿童绘本,故事、插画、排版、生词注释全齐。这是我们实测跑通的一条产线的节奏,成本算下来,一本五页的绘本不到一块钱,其中九成是图的钱。

这两年老雷帮企业做内容产线,最常被问的一句话是,图文并茂的活儿 AI 到底接不接得住。文字早就不是问题,卡点一直在图上,五张图五种画风,拼在一起像五本不同的书。这条绘本产线值得拆,就因为它把图这关用工程手段摁住了,角色不崩,画风不散,还能整本批量出。

整条线架在 Make 上,链路是这么走的。Notion 当控制台,一行记录就是一笔订单,填好主题、语言、每段字数。点「开始」触发工作流,大模型按结构化格式一次生成完整故事框架,再逐段生成绘图提示词,交给 fal.ai 上的 Flux 模型配 LoRA 出插画,图文写进 Google Docs 排版,收尾由大模型做一遍整理,成品存回 Notion。听起来环节不少,实际跑一本只要三分钟,下面按交付的顺序一个个拆。

触发这关,别再轮询了

不少教程让工作流定时去查 Notion 的状态字段,查到了再干活。这样干有两个毛病,一个是浪费运行次数,Make 按次计费,空转的查询全是白烧的钱,另一个是不实时,任务填进去了,还要等下一个轮询周期。

我们的做法是在 Make 建一个 Custom Webhook,再到 Notion 数据库里加一个公式字段,用 link 函数把 Webhook 地址和这条记录的 ID 拼成一个「开始」链接。点一下,浏览器跳出来一个 Accepted,工作流当场就跑起来了。

这个细节对交付很关键。运营同事在手机上打开 Notion,填好主题点一下,产线就开动,从头到尾不用碰 Make 后台。把控制台放在客户已经天天在用的工具里,培训成本直接降到零。

调试期间还有个实用技巧,把定时触发关掉,工作流的开关打开让它守着,手机上点一次链接,回到 Make 界面就能逐个模块看运行结果,哪个环节吐了什么数据一目了然,比盲跑一整条线再翻日志省事得多。

故事和分镜,一次生成

产线的心脏是一个大模型模块,角色设定成绘本作者,用结构化 JSON 输出,一次吐出整本书的框架。标题、主角外貌的中英文描述、五个段落,每段配一段场景描述,角色在干什么、环境是什么、天气时间如何。

配置上有两个开关别漏。Response Format 必须选 JSON,让模型按结构吐数据,Parse JSON 打开,Make 会自动把返回值解析成可映射的字段,省掉单独挂一个解析模块。这两处没开,后面所有字段映射拿到的都是空值,排查起来还以为是提示词的锅。

两处设计决定了后面五张图的成色,马虎不得。

第一处是主角外貌要写死写细。身高体型、毛发颜色、服装特征,一样都不能含糊,这段描述是全局变量,后面每一张图的提示词都从这里取,等于给全部插画钉了一根锚。图和图之间角色长得一样不一样,就看这段写得细不细。

第二处是场景之间要拉开差距。提示词里要明确要求五个场景在地形、天气、时间上有明显区别。这个要求是实测换来的,早期版本五个场景描述写得很像,出来的图几乎一个模子,翻五页全是同一片草地。改完之后,一本绘本里既有白天的森林又有夜晚的河边,翻页才有故事感。

这里顺带把 Make 里最容易糊的概念说清。数组是有序的同类型元素集合,中括号包着,比如播放列表里的歌。集合是不同类型字段的组合,花括号包着,比如一条记录里的标题加正文。大模型吐出来的 paragraphs 是数组,里面每个元素是结构相同的集合,所以遍历器 Iterator 能把它拆成五份逐个处理。要是每个元素的字段名对不齐,遍历器就映射不上,这是调试时最常撞的墙,拿在线 JSON 可视化工具看一眼层级,比盯着原文猜快得多。

极简线性图标插画,结构化文档被图钉锚定,分支线把五张场景卡片依次展开,示意一次生成整本绘本的故事和分镜

画风这关,靠 LoRA 来锁

提示词锚住的是角色长相,锁不住的是笔触。不用 LoRA,同一个提示词跑五遍,能给你五种画风,水彩、扁平、厚涂各来一份。绘本要的是整本一套的视觉,这一关只能靠 LoRA 模型来锁。

生图平台我们用的是 fal.ai,理由有三个,接口文档清爽,HTTP 模块就能直接调,Flux 出图快,按量计费的门槛低,试错成本可控。

选 LoRA 的渠道,国内推荐 LiblibAI,中文界面,资源多,按「插画风格」加「LoRA 类型」加「Flux 模型」三个条件筛。老雷的建议是盯三个指标,运行次数多的说明质量被验证过,泛化好的换个主题也能出图,瑕疵率低的看手部和面部稳不稳。要商用,记得去找作者拿授权,这一步省不得。

有个工程问题提前交代。LoRA 文件要以直链 URL 的形式传给 fal.ai,而 Google Drive、Dropbox 这类网盘都不给直链。这个坑我们实测撞过,参数都对就是不出图,查来查去问题就出在链接上,换成支持直链的文件托管服务,或者走 AWS S3、Google Cloud 的对象存储拿公开链接,才把这一关迈过去。排障排到一半真的会怀疑人生。。。

参数照这组来,LoRA 权重 0.8 到 1.0,尺寸 1024×1024 或者 3 比 4 的竖版,迭代步数 27 到 28。还有一条红线,儿童内容的 Safe Checker 必须打开,这是底线配置,交付清单里要写成验收项。

角色锚点是给整条产线用的,不是给某一张图用的。
极简线性图标插画,锁头扣住调色盘和画笔,五张画风一致的小画卡片带勾排列,示意用 LoRA 锁住整本绘本的画风

排版这步,只许动结构不许动内容

图和文都齐了,接下来是组装。产线在遍历开始前先建一份 Google Docs 文档当容器,文档名映射故事标题,然后每张图生成完,连同对应段落一起追加进去。

等五段全部落位,再上一个整理模块,从 Docs 读全文,做三件事,优化 Markdown 的标题层级和段落间距,给重点词汇加粗,在文末加一节生词注释,难词给解释和英文翻译,对拿绘本做双语启蒙的家长来说很实用。

这里有条规矩要写死在提示词里,原文内容和图片链接一个都不许改,模型只动结构,不动内容。给每个工位画死边界是产线设计的常识,整理模块只许碰格式,正文和图片链接一个字符都不许过手,排版和内容两个职责一旦糊在一起,出了问题连验收都没法验。

fal.ai 这边顺便报个价,Flux 单张 2 到 10 秒出片,一张几分钱到一毛,一本五页的绘本图的部分不到一块钱,充几美元能用很久。成品存回 Notion 之后把状态字段改成「已完成」,这本书就算交付了,每一笔任务在库里可查,客户接手也直观。结构化输出偶尔会格式抽风,GPT-4o 开了 JSON 模式之后实测成功率在九成九以上,剩下的用 Error Handler 兜住跳过就行,别为千分之几的失败率上人工。

真正值钱的是可替换性

这套东西交付出去,客户拿到的不是一本绘本,是一条能变形的产线。

换个 LoRA 就是另一种画风,儿童插画换成建筑渲染、家居治愈、产品展示,提示词模板不用大动。改改提示词里的赛道描述,就是另一个选题方向。老雷一般会给客户留一张改造清单,画风在哪换、主题在哪换、篇幅在哪个字段调、出问题先看哪个模块的输出,照着清单一格格来。

角色一致性也要把话说在前头。提示词锚定加 LoRA 锁画风,能做到大体一致,主角不会五张图五张脸,但发丝级的一致做不到,那要上 ControlNet 和 IP-Adapter 这类进阶方案,成本和复杂度都上一个大台阶。需求评估的时候把这个边界画清楚,免得验收时扯皮。

老雷给大家提个醒,验收这类产线别只看单张图好不好看,抽一整本出来翻,看三样东西,五张图的角色是不是同一张脸,场景是不是拉开了差距,图文顺序有没有错位。顺手把 LoRA 权重、尺寸、步数、Safe Checker 状态四项参数写进交付文档,后面换人维护,不用从头摸参数。这三样都过关,产线才算交得出去。

绘本只是这条线最好讲的样本,把「故事」两个字换成你业务里任何一种图文内容,剩下的模块原样能跑。今晚就可以试,建一个 Notion 库,填一个主题,点一次「开始」,三分钟后你会想给第二个主题也点一下。

极简线性图标插画,传送带上的绘本与交换箭头,指向可替换的画风和主题方块,示意一条产线变形出多种图文业务