规则集 B 的选择
MOODBOARD
视觉一致性测量
设计师很少靠语言来说明一种风格。他们会把几张参考图钉在墙上,说:“就要这种感觉。”这个页面所做的,就是把“这种感觉”变成可以测量的数值。这里的风格画板由八幅参考画作组成。系统从中学习这些画共有的气质,再给任意一张新图片打出契合度分数。本页所有内容均来自开源 moodboard 引擎的同一次离线运行,所用方法和内容哈希见页尾。
下面五个小节共同组成一个闭环,并不是五段互不相关的演示。画板先定义风格;评分再把契合程度化成一个数,同时如实标出其中的不确定性;生成后的改动严格限于事先承诺的像素范围;只有明确重新训练系统,偏好才会改变;每次编辑先参考哪些图片,则由编辑意图决定。参考图送进生成器,判断结果再反馈给品味系统。这一来一回的闭环,就是整个系统。
画板
八幅已经进入公有领域的画作定义了这块画板:四幅出自克劳德·洛兰(Claude Lorrain),四幅出自梵高。画板把它们浓缩成一套共同的风格表示,涵盖色板、色调和构图。其中几幅画在这个空间里非常接近,因此系统算出的有效来源只有 4 个,而不是 8 个。
给新作品评分
每幅参考画作都有三种版本:原图、水平镜像,以及以中心为准裁切到九成大小。这样一共得到 24 个候选版本,再交给画板评分排序。完整排名见下表:每行对应一幅画,每列对应一种变体,每格列出画板给出的名次和分数。这个分数叫保形 p 值(conformal p-value),用来衡量候选图与画板本身的风格有多难区分;1.000 表示无法区分。方括号里是通过留一重采样得到的 90% 区间。
| 画作 | 原样 | 镜像 | 裁切 90% |
|---|---|---|---|
| 丝柏 | #1 · 1.000 [0.71, 1.00] | #10 · 0.889 [0.50, 0.88] | #18 · 0.778 [0.29, 0.75] |
| 花开果园 | #1 · 1.000 [1.00, 1.00] | #10 · 0.889 [0.79, 0.88] | #18 · 0.778 [0.59, 0.88] |
| 橄榄树 | #1 · 1.000 [0.92, 1.00] | #1 · 1.000 [0.92, 1.00] | #1 · 1.000 [0.88, 1.00] |
| 日出 | #1 · 1.000 [0.84, 1.00] | #10 · 0.889 [0.75, 0.88] | #10 · 0.889 [0.62, 0.88] |
| 麦田 | #1 · 1.000 [0.63, 1.00] | #1 · 1.000 [0.84, 1.00] | #1 · 1.000 [0.84, 1.00] |
| 渡口 | #18 · 0.778 [0.34, 0.88] | #18 · 0.778 [0.25, 0.75] | #10 · 0.889 [0.25, 0.88] |
| 田园 | #10 · 0.889 [0.46, 0.88] | #10 · 0.889 [0.42, 0.88] | #10 · 0.889 [0.29, 0.88] |
| 特洛伊妇女 | #23 · 0.111 [0.17, 0.25] | #22 · 0.222 [0.17, 0.25] | #23 · 0.111 [0.12, 0.12] |
《特洛伊妇女》的所有变体得分最低,尽管这幅画本身就在画板中。评分看的是八幅参考画形成的整体共识;一幅画仅仅因为属于画板,并不会自动得到高契合度。
只改一处,其余原样保留
只把选中的苹果树换成一棵成熟的柠檬树。确认矩形之外的场景、相机几何和光照都要保持不变。原始指令:Replace only the selected apple tree with a mature lemon tree. Preserve the scene outside the confirmed rectangle, camera geometry, and lighting.
生成器最初输出的图片改动了明确要求不能动的区域。掩膜外的相似度只有 0.175,低于 0.950 的阈值,因此这次生成被拒绝。随后,流水线裁出指定区域,只重新生成这一块,再把它合成回原图。掩膜外共有 432,192 个像素,没有一个发生变化。
生成器的原始输出来自 Adobe Firefly 网页版。“框外保持不变”由合成器提供确定性保证。运行记录也如实注明,这是合成器的特性,并不是说生成器本身就能做到。
偏好只在重训练时移动
画板使用一个小型的成对比较排序模型,模型基于冻结嵌入。快照 A 使用已记录的 64 条判断训练而成,并在事件 112 时发布为不可变版本。随后,系统又加入 96 条按另一套标注规则生成的判断,重新训练出快照 B,并在事件 208 时单独发布。A 的预测始终没有任何变化。
这里展示了八对已记录分歧样本中的三对。每一对中,两套规则选出的赢家正好相反。数字表示模型认为规则集 B 所选一方获胜的概率,重训练前后各列一个。
规则集 B 的选择
规则集 A 的选择
规则集 A 的选择
规则集 B 的选择
规则集 A 的选择
规则集 B 的选择
在两套规则意见相反的 8 对留出样本上,模型认为规则集 B 所选一方会胜出的概率从 0.02% 升到 50.1%。判断标签由模拟的规则集生成,运行记录对此有明确说明。这里要说明的只有一点:系统所衡量的品味确实变了。这种变化来自一次明确执行的重训练,不是悄悄发生的更新。
意图决定编辑参考什么
每次编辑都从检索开始。系统先解析已经说明的意图,据此确定检索命名空间,并用硬性集合条件筛选。候选图只在这个集合内排序,依据是视觉嵌入的精确余弦相似度;排在第一位的参考图,就是生成器接下来要看的上下文图。下面两种编辑意图针对的是同一张原始照片,检索时用的也是同一个图库;但各自找出的前三名参考图没有一张重叠。
只把选中的苹果树换成一棵成熟的柠檬树。确认矩形之外的场景、相机几何和光照都要保持不变。原始指令:Replace only the selected apple tree with a mature lemon tree. Preserve the scene outside the confirmed rectangle, camera geometry, and lighting.
score 0.8433 · rank 4
score 0.7921 · rank 5
score 0.7569 · rank 6
score 0.7482 · rank 7
把整个场景重绘为一幅光感通透的克劳德·洛兰田园油画,同时保留原图的构图与主体关系。原始指令:Restyle the complete scene as a luminous Claude Lorrain pastoral painting while preserving the source composition and subject relationships.
score 0.7711 · rank 3
score 0.7630 · rank 4
score 0.7551 · rank 5
score 0.6123 · rank 8
随后,系统按照同一个重绘意图生成了两次。下方原样列出两次使用的提示词(保留英文,以忠实呈现运行记录)。没有参考图时,只能在提示词里手工写上一长串风格词来弥补;把检索出的前三名参考图作为上下文图附上后,提示词就只剩一句话,风格则由参考图来体现。像素余弦只衡量生成结果与原始照片在像素上的接近程度,用来检查构图,并不是风格分数。两次生成的结果及其溯源信息都已记录在案。
带参考图的输出与原图差得更远,恰恰是因为它认真采用了检索到的风格:金色的空气感来自参考图,而不是提示词。这些数据只用于描述和诊断,不是验收门槛。这里检查的是路由结构是否正确,并不据此评价检索本身的质量。