一次关于角色风格拆解、批量生成与人机协作流程的小型探索附录
以风格参考图为锚点,借助角色剪影参考,将风格与造型融合生成新角色
美式卡通 3D 风格:硬边光影、高饱和暖色、泥塑质感、夸张头身比。此图作为整个工作流的风格基准,所有生成结果都需严格对齐这个视觉语言。
从综合性价比、能力以及长上下文考量,选择 Kimi 2.6 作为核心多模态模型。其长上下文能力适合自动化框架调用,多模态识别能力优于 DeepSeek,为后续批量生成流程提供稳定的风格描述。
剪影决定角色的特征和特点的突出度。引入多组经典角色剪影作为造型参考,让 AI 在保持风格统一性的前提下,生成具有不同体态和姿态的角色变体。
同时调用 Nanobanana、GPT-Image、Seedream 5.0、Lib-Image 多个模型,对比同一提示词在不同模型下的风格表现差异,选择最优方案。
第一页调用香蕉 2进行手动垫图生成,以风格参考图为锚点,用剪影控制角色造型,输出初始角色。
第三、四页使用香蕉 2 + GPT Image互补验证。首先角色造型出来后风格可能不对,需要进行风格强化或角色造型强化。通常需要多轮出图调试。
Nanobanana 出图更加细腻细腻,GPT Image 性价比更高但会有糊点。根据不同场景选择:要质量用 Nanobanana,要效率用 GPT Image。
在无限画布上由 0 → 1 → 2 → 3 → 4 逐步迭代,对 AI 的掌控度更高
在 LiblibTV 等平台上通过无限画布逐步迭代。从第一笔开始,逐步推理角色造型,每一步都有明确的方向和目的。
在无限画布上由 0 → 1 → 2 → 3 → 4 逐步迭代。不是一次性生成,每一步都是有意识的调整和控制,从草图到精细化,逐渐探索角色的多种可能性。
逐步改变图像风格,进行颜色转换和元素提取。每一步都是一次有意识的风格边界探索,看到变化轨迹,及时纠偏。
通过平台内部的逐步推理能力,对角色造型进行深入探索。推理过程更加明确,对 AI 的掌控度更高,不会出现一次性生成的“黑匣子”问题。
基于 Hermes 框架的自动化工作流,从角色设计理论到批量生成的完整管线
接入多模态模型 Kimi 2.6 的 API,利用其长上下文和多模态能力为自动化框架提供支撑。
让 AI 搜索角色设计相关理论,以及 AI 绘画提示词如何转化的方法。这些理论不一定直接适合绘画提示词,但可以帮助转化为更原则性、更有沉淀的描述。
选择 Hermes 框架的核心原因是它可以自进化。不同于 Claude Code、Codex 等单次任务工具,Hermes 可以自己进化、迭代,不断优化工作流。
流程可复用、可标准化。通过 Skill 机制将角色设计原则沉淀为可复用的知识资产,下次直接调用。
Hermes 接入 ComfyUI,调用原有角色沉淀的 Scale 原理以及风格参考图,进行批量角色生成。
不是一次性出 1000 张。先逐张调通确保效果符合预期,然后再进行批量化产出。
产出过程中发现:加入风格锚点(如美式卡通 3D 风格描述)会大幅提升一致性。第一批效果不好,加入锚点后质量显著提升。
给角色注入世界观设定(雪地喷火兵、兽人喷火兵、摇滚喷火兵、赛博朋克喷火兵...),角色会更有趣味性。




8 阶段闭环:从单图参考到自进化资产库
AI 自动化 + 剪影参考,建立可进化的批量生成管线
在自动化流程中嵌入更多元素的剪影参考图,引入多角度、多体态剪影,让 AI 在更丰富的空间中生成变体,减少重复感。
将手绘剪影转换为 ControlNet 可识别的 Depth Map 或 Canny 边缘图,作为结构约束注入 ComfyUI 工作流。
建立"生成 → 评估 → 反馈 → 优化 → 再生成"的闭环。利用 Hermes Skill 将每轮迭代的经验定量化沉淀。
通过五维理论和规范化命名建立可量化评估体系。每 5 张自审核一次,反馈给 AI 下一轮优化。
多模型互补验证 + 可进化框架沉淀 + 云端自动化部署
各阶段实际工作流中的零碎资料与过程记录






更多过程截图将持续更新...
这个网页本身就是人机协作工作流的最佳案例
人构建骨架,AI 执行润色。
在语言模型对话过程中,人是在构建骨架——定义技术路线、决策方法、制定审美标准。语言模型负责执行和润色——将人的思路转化为可执行的步骤、生成代码、整理文档。
在图像生成时,人是在定义大致的技术路线——选择风格锚点、选择平台、制定迭代策略。AI 负责执行——批量生成、风格迁移、一致性校验。
人的审美判断、思维判断和方法决策,帮助 AI 更好地完成任务;AI 的批量执行能力,帮助人更高效地实现想法。这是一个互助的过程。