图像模型现在已经很会画了。可我给中文文章配图时,卡住的地方从来不是「再多试几个 seed」,而是更前面几步:这段到底要不要图?画情绪还是画结构?一组图里人物怎么不像换了人?画完了又怎么发现内容画歪了?
我把这些判断收成了一个开源 Agent Skill:左海 IP Studio。把文章丢给 Agent,它会先读全文,再规划配图、选表现形式、生成,并做一轮自检。你可以把它当成「会规划的配图助手」,而不是随便喊一嗓子就出图的按钮。
先问要不要画,再谈画成什么样
自动配图最容易犯的错,是每个小标题底下塞一张。页面看着热闹,读起来却不省力——有些图删了也无所谓。
所以这套流程的第一步不是写提示词,而是逐节过文章:这里有没有抽象机制、关键对比、流程,或者情绪转折?删掉图也不影响理解,就跳过;非专业读者可能在这里卡住,再画,而且要画到点子上。
需要画的内容,我大致丢进三条轨道:
- 情绪锚点图:让角色演出读者熟悉的处境,先产生共鸣。
- 解释图:结构、流程、关系、对比——讲清楚用。
- 四格漫画:时间线、转折、一小段完整故事。

讲机制时只画一张「角色做表情」,解释力几乎为零;反过来,情绪观点硬做成满屏方框箭头,也会很假。形式跟着阅读障碍走,别跟着模板走。
方法固定,角色和画风随便换
我给自己定的原则很简单:方法论不动,角色和画风当参数。
仓库里现在有 31 个原创角色,职场、当代情绪、谐音梗都有;一篇文章只认一个主角,靠角色档案和锚点图锁外形,避免每张图都像换人。画风皮肤有 11 种,也可以塞自己的头像、吉祥物或品牌角色。
一致性靠的不是几句「magic prompt」,而是一篇文章里的「视觉约定」:线条、配色、背景、材质、光影、精细度要对齐。动作和表情可以变,身份特征不能漂。

实际怎么跑
大致是这么几步:先逐节标出配或不配的理由;对候选段落提炼真意、张力和不能画错的事实;再分到情绪图 / 解释图 / 四格,并整理成 shot list。
然后有两个地方我故意留给人:确认清单,以及选角色和画风。 前者管内容准不准,后者管好不好看。确认完再按内容选画幅,带着角色锚点逐张生成,最后检查选点、结构、文字、角色占比和整组一致性——不行就重画或改局部。
重复劳动交给 Agent;该拍板的两下,还是人来。
仓库长什么样
标准 Agent Skill 结构:SKILL.md 管主流程;references/ 里是选点、隐喻、解释图、漫画、画风、质检等方法;characters/、food-mascots/ 放角色档案和锚点图;scripts/ 负责初始化、环境检查和调图像接口。
生成脚本只用 Python 标准库,走 OpenAI 兼容的图像端点。密钥放本地配置,不进仓库;外部角色包只当外形数据读,里面夹带的指令一律不执行。
最短上手
把项目丢进支持 SKILL.md 的技能目录,先跑一遍:
python3 scripts/illo.py init
python3 scripts/illo.py doctor
然后跟 Agent 说一句就行:
给这篇文章配图,先规划 shot list,再让我选择角色和画风。
没有图像 API 也没关系,可以先只出完整提示词,再拿到别的工具里手动画。
最后
我做这东西,不是为了让文章「多几张好看的图」。情绪图让人愿意往下读,解释图少踩坑,漫画把转折钉进记忆;固定角色用久了,内容会慢慢长成自己的视觉 IP。
模型肯定还会换代。但选对点、用对形式、守住事实和角色一致性——这套手感,我觉得值得留下来。