从一张参考图创建完整角色设计图
你 OC 的一张图片是肖像。角色设计图是一份工作文档。它应该说明角色从后面的样子,面部在不同表情下的表现,身体在不同姿势下的阅读方式,以及哪些服装细节是固定的设计元素而不是一次性选择。从第一个到第二个意味着填补原始图片从未显示的内容。
因此,我在 Tsubaki.3 中构建了一个原始角色参考,这是 PixAI 目前处于抢先体验阶段的模型,并从中运行了八次生成。每次使用相同的参考图像,没有第二个参考,没有手动清理。我测量的是设计的哪些部分幸存下来,模型必须发明哪些部分,以及发明的部分是否两次以相同的方式返回。
我对 Yatsuha 唯一的照片显示一条窄帆布带从她的右肩穿过胸部到左臀。无论那个带子承载什么都坐在她的背后,画面之外。我故意把它放在那里,因为单张插图通常会留下一些未完成的内容,我想知道 AI 角色设计图生成器如何处理这些未完成的部分。
你 OC 的一张图片是肖像。角色设计图是一份工作文档。它应该说明角色从后面的样子,面部在不同表情下的表现,身体在不同姿势下的阅读方式,以及哪些服装细节是固定的设计元素而不是一次性选择。从第一个到第二个意味着填补原始图片从未显示的内容。
因此,我在 Tsubaki.3 中构建了一个原始角色参考,这是 PixAI 目前处于抢先体验阶段的模型,并从中运行了八次生成。每次使用相同的参考图像,没有第二个参考,没有手动清理。我测量的是设计的哪些部分幸存下来,模型必须发明哪些部分,以及发明的部分是否两次以相同的方式返回。
1、有用的角色设计图应该包含什么?
根据你的用途,角色参考图可以包含转面图、表情图、一组姿势参考、服装变体或配饰特写。这里的转面图指的是从正面、侧面和背面以匹配比例绘制的相同图形。很少有设计图包含所有这些内容,也很少需要。
我关心的测试不同于"这看起来好不好"。如果图像有效,插图就成功了。如果参考回答了你否则必须猜测的问题,它就成功了:那件外套背面是什么,头发分界线在哪里,她蹲下时服装如何坐下。这个区别决定了动漫角色设计图是海报还是工具。
它还设定了更难的问题。单个参考无法回答所有问题,因此返回的一些内容必须是发明的,发明的信息本身没问题。当设计图每次询问时都发明不同的答案时,它就变成了问题。
2、从一个角色参考开始
Yatsuha 是一个小山天文台的夜间助手。我仅从文本生成了她一次,并将该单个输出用作随后每个 OC 角色设计图运行的参考。
这是产生她的提示词:
二十岁出头的年轻女性全身站立肖像,面向观众略微四分之三角度,站在纯浅灰色背景上,没有风景和道具。她留着齐下巴的深棕色头发,齐刘海,右侧塞在耳后,左侧垂在脸颊上,浅灰绿色眼睛。她脖子上围着深红色针织围巾,缠绕两圈,一端塞进外套,另一端垂在左侧。炭灰色罗纹毛衣外面,她穿着一件敞开的及膝绗缝橄榄色外套,左胸口袋里放着一个小折叠笔记本,一角露出来。一条窄帆布带从她的右肩穿过胸部到左臀,她背着的包在她的背后,看不见。她穿着深色阔腿裤和磨损的棕色短靴。双手都在身体两侧,完全在画面内。中性表情,均匀柔和的灯光,干净的动漫插图,无文字,完全着装,适合工作。
脸型和身体比例是分开跟踪的,因为两者都是绘画的属性,而不是我可以指向的物品。其他所有内容分为三组,这个分组是本文其余部分的衡量标准。
四个特征在每个设计图提示词中再次命名:头发长度和颜色、眼睛颜色、红色围巾、灰色毛衣上的橄榄色外套。四个仅出现在参考图像中:头发塞在耳后的那一侧、围巾尾巴垂在哪一侧、带有小黄铜滑块的带子,以及胸口袋里的赤陶笔记本。两个东西根本不在参考中:外套背面,以及带子末端的物体。
每次运行的设置都相同。Tsubaki.3,无样式预设,专业模式,方形格式,附加一张参考图像。提示助手(在到达模型之前重写你的措辞的面板功能)保持关闭,我在加载参考之前就关闭了它,因为一旦图像进入插槽,切换就会消失。负面提示(你告诉模型避免的事物列表)保持在其默认行上。当运行需要固定种子(确定随机起点的数字,以便相同提示返回相同图像)时,我会说明。
3、测试 1:生成正面、侧面和背面角色转面图
角色转面图生成器有容易的一半和困难的一半。正面视图是参考已持有信息的重绘。背面视图是设计图必须承诺参考从未显示的内容的地方。
使用参考图像中的角色,在纯浅灰色背景上创建角色转面图参考表:以相同高度和相同比例绘制的相同角色三次,以中性放松姿势站立,手臂稍微离开身体,从正面、侧面和背面显示,均匀间隔在单行中,每个视图都是全身,无文字和任何标签,干净的动漫插图,所有三个图形具有一致的线条粗细和一致的平面着色。角色是一个年轻女性,留着齐下巴的深棕色头发,浅灰绿色眼睛,深红色针织围巾,炭灰色罗纹毛衣外面穿着敞开的及膝绗缝橄榄色外套。完全着装,适合工作。
比例比我预期的保持得更好。三个独立绘制的图形,最终高度在五像素以内,侧面视图是真正的侧面,而不是略微旋转的正面。
侧面轮廓读作同一个人,具有相同的下巴线条和相同的头发长度,这是唯一无法判断头发不对称性的视图,因为任何侧面都会露出耳朵。两个仅参考的细节保持在视野中也做得很好。带子在正面和侧面图形上穿过胸部,带有小金属滑块,笔记本放在口袋里,浅色页面块可见。然后图形转身,带子消失了。肩膀上什么都没有,臀部什么都没有,没有任何东西暗示曾经有任何东西。外套背面是一个普通的绗缝面板,带有垂直中心接缝。
AI 角色转面图只有在重复时才有意义,因此我再次使用相同的提示词,逐字逐句,在不同的种子上运行。
第二次运行返回相同的外套背面、相同的中心接缝和相同的任何带子缺失。在这三次运行中,模型以相同的方式填充盲区,而不是每次都即兴创作新答案。
对于第三次运行,我保留了第一次转面图的种子,并添加了一个句子,命名包并要求在背面视图中显示。其他所有内容逐字逐句相同:
使用参考图像中的角色,在纯浅灰色背景上创建角色转面图参考表:以相同高度和相同比例绘制的相同角色三次,以中性放松姿势站立,手臂稍微离开身体,从正面、侧面和背面显示,均匀间隔在单行中,每个视图都是全身,无文字和任何标签,干净的动漫插图,所有三个图形具有一致的线条粗细和一致的平面着色。角色是一个年轻女性,留着齐下巴的深棕色头发,浅灰绿色眼睛,深红色针织围巾,炭灰色罗纹毛衣外面穿着敞开的及膝绗缝橄榄色外套。她背着一个扁平帆布信使包,挂在穿过胸部的带子上,包在背面视图中清晰可见。完全着装,适合工作。
包以与带子相同的沙色帆布出现,并落在参考所说的位置。左臀,由一条从右肩垂下的带子承载。然后两个问题随之而来。第二条带子从另一个肩膀出现并穿过第一条,这是任何单肩包都无法形成的形状。而同一设计图的正面和侧面视图完全失去了带子,以及侧面图形上的笔记本。
因此,这句话在背面视图上完成了它的任务,并在同一设计图的正面带走了两样东西。
4、测试 2:创建表情图
使用参考图像中的角色,在纯浅灰色背景上创建表情图:六个相同角色的头肩肖像,排列成两行三列的整洁网格,均匀间隔且相同比例,显示中性表情、快乐表情、愤怒表情、悲伤表情、惊讶表情和尴尬表情,每个面板中相同的脸型和相同的发型,无文字和任何标签,干净的动漫插图,所有六个肖像具有一致的线条粗细和一致的平面着色。角色是一个年轻女性,留着齐下巴的深棕色头发,浅灰绿色眼睛,深红色针织围巾。完全着装,适合工作。
这是测试中最强的设计图。六种表情,六种在视觉上都是独立的,六种都保持相同的四分之三头部角度。跨面板测量,面部本身几乎没有移动:最宽的读数为 260 像素,最窄为 243,高度在 408 到 425 之间。愤怒面板缩小眼睛并降低眉毛,而不重塑其下方的任何内容。
头部附近的仅参考细节也跨每个面板保持:右耳保持未覆盖,而左侧的头发垂在脸颊上,围巾每次放置方式相同。在大约 341 x 512 像素的每个肖像中,几像素宽的黄铜滑块也通过了。
然后我要求九个,使用三乘三网格和列表中多三种情绪:
使用参考图像中的角色,在纯浅灰色背景上创建表情图:九个相同角色的头肩肖像,排列成三行三列的整洁网格,均匀间隔且相同比例,显示中性表情、快乐表情、愤怒表情、悲伤表情、惊讶表情、尴尬表情、困倦表情、沉思表情和大笑表情,每个面板中相同的脸型和相同的发型,无文字和任何标签,干净的动漫插图,所有九个肖像具有一致的线条粗细和一致的平面着色。角色是一个年轻女性,留着齐下巴的深棕色头发,浅灰绿色眼睛,深红色针织围巾。完全着装,适合工作。
所有九个面板都在那里,网格保持三分之一,尽管它们之间的间距从六到十四像素不等,而不是单一的均匀宽度。成本落在我没有预测的地方:面部保持模型,而框架简化。九个肖像中的每一个都正对相机,头发对称地落在两侧,耳朵细节从整个设计图中消失。
表情也开始融合。惊讶和尴尬都返回为睁大眼睛、张开嘴巴和浓重的腮红,足够接近,任何一个面板都可以标记为任何一个。困倦和沉思主要不同,因为沉思面板在下巴处添加了一只手。六个清晰分离的表情构成了有用的 AI 表情图。九个给了我七个清晰分离的面孔和两个备用的。
5、测试 3:生成姿势参考
AI 姿势图要求与其他两种格式不同的内容,因为整个身体必须在移动时保持模型。
使用参考图像中的角色,在纯浅灰色背景上创建姿势参考表:四个相同角色的全身绘制,相同比例,均匀间隔在单行中,放松站立,重心在一条腿上,向前行走中步,蹲下并用一只手伸向地面,以及站立时一只手臂向上伸直,每个绘制中相同的身体比例和相同的服装,无文字和任何标签,干净的动漫插图,所有四个图形具有一致的线条粗细和一致的平面着色。角色是一个年轻女性,留着齐下巴的深棕色头发,浅灰绿色眼睛,深红色针织围巾,炭灰色罗纹毛衣外面穿着敞开的及膝绗缝橄榄色外套。完全着装,适合工作。
比例是我预期会在这里损坏的,但它们保持住了。两个直立图形的高度为 827 和 830 像素,体型在所有四个中保持相同,外套、围巾和靴子也随之而来。
布局是它崩溃的地方。提示要求四个图形均匀间隔在单行中。返回的是三个图形在共享基线上,蹲下的那个落在它们之间的间隙中,从比邻居更高的视点绘制。行走姿势也从未发生,因此前两个图形都是站立静止的变体。四个请求的姿势产生了三个不同的姿势。
带子在四个中的三个上幸存下来,从举起手臂的图形中消失。笔记本在所有四个上都存在,并且在该尺寸下比我预期的保持得更好:即使在最小的实例上,大约 32 x 20 像素,封面和浅色页面边缘也都还在。
因此,我单独运行了相同的蹲姿,一个图形,全帧:
使用参考图像中的角色,绘制相同角色蹲下并用一只手伸向地面,全身,纯浅灰色背景,无风景和道具,干净的动漫插图,无文字和任何标签。角色是一个年轻女性,留着齐下巴的深棕色头发,浅灰绿色眼睛,深红色针织围巾,炭灰色罗纹毛衣外面穿着敞开的及膝绗缝橄榄色外套。完全着装,适合工作。
笔记本渲染宽度为 71 像素,而设计图中为 32 像素,封面、浅色页面块和书脊厚度都可读。伸展的手是整个姿势集中最难的东西,返回时五指分开,透视正确。
设计图格式丢失了这些细节,因为 1024 像素框架的四分之一没有空间容纳它们,而不是因为模型无法绘制它们。
6、我的可选测试:服装变体
使用参考图像中的角色,在纯浅灰色背景上创建服装参考表:以相同高度和相同比例绘制的相同角色三次,以相同的放松正面姿势站立,均匀间隔在单行中,穿着三种不同的服装,第一种是休闲装,纯色连帽衫和牛仔裤,第二种是正装,合身深色西装外套和直裙,第三种是厚重冬装,带衬垫派克大衣和高靴,三种中相同的面孔、相同的发型和相同的深红色针织围巾,无文字和任何标签,干净的动漫插图,所有三个图形具有一致的线条粗细和一致的平面着色。角色是一个年轻女性,留着齐下巴的深棕色头发和浅灰绿色眼睛。完全着装,适合工作。
三个图形的高度在一像素以内;面部在所有三个中读作同一个人,红色围巾贯穿每套服装。围巾在提示中被命名,这就是重点:命名的细节传播良好。
冬季选项是橄榄色带衬垫派克大衣,颜色与她的原始外套足够接近,三个位置中的一个给了她已穿着服装的变体。而头发,提示留给参考,到达时没有干净的塞法:它在所有三个图形中向前落在两侧,一只耳朵从与参考相反的一侧的间隙中露出,一缕头发穿过它。三个图形彼此完全一致,因此设计图在内部一致,并且与参考一致不匹配。
7、角色在整个设计图中有多一致?
在八次输出中,每个提示中命名的四个特征在每个图形中都保持了。头发颜色、眼睛颜色、围巾和外套每次都正确返回。有趣的行为在于仅存在于参考图像中的四个特征,因为它们以明确的顺序出现,从二十六个视图中一个遗漏到十二个。
笔记本最强势。它仍在每个穿着橄榄色外套的图形中,尺寸从 71 像素到 32 像素不等,只有一个例外:我命名包的那次运行的侧面视图。
带子第二。除了那次运行和举起手臂的姿势图形外,它在每个正面和侧面视图上都保持。在两个普通背面视图上它完全缺失,在第三个背面视图上它加倍了。
围巾尾巴第三。它在十七个全身图形中的十个上达到,遗漏了第一个之后的两个转面正面视图,四个姿势图形中的两个,以及整个服装图。在它出现的地方,它在正面视图中垂在她的左侧,与参考匹配,在所有三个背面视图中垂在她的右侧。
头发不对称性是最脆弱的。仅计算面对观众的二十六个视图,因为侧面在几何上显示耳朵而不是选择,它在十四个中保持,在十二个中失败。它在转面正面视图、较小表情图的所有六个面板、所有四个姿势图形和单个姿势中幸存。它从较大表情图的所有九个面板中消失,其中头发对称下垂,没有耳朵露出,并且它在所有三个服装图形中失去了塞法,这使头发向前落在两侧,让一只耳朵从间隙中露出。
一个跨越排序的警告。笔记本和带子完全从服装图中缺失,因为它们所在的大衣被替换。这是正确的行为而不是漂移,它标志着整个方法的边缘:由对象承载的身份持续时间与对象一样长。
其他两样东西在整个集合中移动。身体比例保持稳定,姿势图形和服装图形读作与参考相同的体型。渲染风格大部分保持,例外是九面板表情图,它比集合中的任何其他内容都返回更平坦的阴影和更粗的轮廓。在缩放到相同高度的头部裁剪上测量硬边缘与柔和渐变,该设计图与其他设计图明显不同,而服装图和转面图接近参考。在集合的其他地方,看起来像风格变化的东西通常是尺寸变化:给图形四分之一框架的比给整个框架的阴影更少。
如果你正在设计一个角色并考虑设计图,这个排序值得借鉴。将身份放在对象上,将这些对象放在你计划保留的服装上,并将纯粹存在于轮廓中的任何内容视为你将首先丢失的内容。
8、AI 生成的角色设计图真的有用吗?
对于你自己的 OC,是的,有用有特定含义。六面板表情图是我会在规划漫画面板或选择 VTuber 姿势时保持打开的 AI 角色参考图,因为面部是它保持最好的部分。转面图给出了"那件外套背面是什么样子"的固定答案,两次运行对该答案达成一致使其可用而不是装饰性的。姿势图更薄,更像是轮廓研究而不是细节参考。
与某人共享设计时,它比单张插图走得更远,但达不到生产模型表的水平。在输出之间翻转头发分界线的设计图适合向协作者展示想法,但作为他们绘制的文档则失败了。其中原始参考从未显示的任何内容都是合理的答案,称其准确将是很牵强的。
在你手动构建设计图之前,有一件事值得了解。PixAI 有一个专用的角色设计图生成器预设,它接受单张图像并布局设置指南风格的页面,将设计分解为服装层、配饰和情绪,并以所选语言进行注释。那与这项工作不同。这里的测试是当你自己要求通用模型提供设计图格式时会发生什么。
9、一张参考图像的极限在哪里?
一张图像留下两种类型的间隙,它们的行为不同。
第一种是沉默,它涵盖了单张图像遗漏的大部分内容:服装背面细节、隐藏的配饰、确切的侧面轮廓、原始裁剪下方的全身比例,以及头发下方的任何内容。外套背面属于这里,沉默被证明是容易的情况。
第二种是承诺,参考指向它拒绝显示的内容。一条跑到臀部后面的带子是一个。一只消失在道具后面的手袖,或一只在手腕处裁剪的手,将是其他。这是需要规划的群体,因为设计图更有可能擦除承诺而不是保持它,修复它的成本在同一页面的其他地方。
它也与我上次测试此模型上的基于参考的生成时发现的情况相符,其中描述和参考一起比单独任何一个都更有效。PixAI 角色一致性指南涵盖了描述部分。
10、最终判断:Tsubaki.3 能从一张参考构建角色设计图吗?
它可以构建部分设计图,这些部分并不都同样好。
六面板表情图是最佳结果,优势明显,在每个面板中保持面部、框架和小配饰。转面图在严格参考意义上最有用,因为它回答了原始图像无法回答的问题,并且在重复运行中方式相同。姿势图最弱,提供了四个姿势中的三个并打破了行布局,尽管它保持了比例稳定。
身份在面部和命名服装上保持最稳定。最难保留的是仅存在于参考中且仅作为轮廓的细节。头发分界线首先消失,在面对观众的二十六个图形中遗漏了十二个。九个面板的成本比六个给出的更多,因此更小的设计图和更多的数量看起来是更好的交易。
仍然需要人工的工作:决定发明的背面是否是你想要的背面,修复布局,以及将你关心的姿势作为单个图像运行。
如果你的 OC 文件夹中有一张好图片,这是一个廉价的实验。将其作为参考加载,要求转面图,然后再次要求相同的转面图并比较两个背面。第二次运行比第一次告诉你更多关于设计图的信息。在 PixAI 上尝试,看看你的角色的哪些细节由对象承载,哪些由运气承载。
原文链接: Can AI Create a Complete Character Sheet from One Reference Image?
汇智网翻译整理,转载请标明出处