Midjourney 的「一致性」究竟指什么?
图像一致性,是指同一个主体与同一种视觉处理,能够在多次独立生成之间保持不变。在 Midjourney 里,这件事并不由你的文字提示控制,而是由参考参数控制,它们把一张脸、一组色调或一整套美学钉死在你之后生成的每一张图上。
如果你的输出品质参差不齐,你很可能正在用越写越长的提示,去解决提示本身无法解决的问题。提示负责描述意图,参考参数负责承载身份。
真正发挥作用的是三个参数。Omni Reference(--oref)承载主体;Style Reference(--sref)承载风格;Personalization(--p)承载你长期累积的偏好。本文其余部分,都是在讲如何把它们组合起来而不浪费额度。
为什么提示完全相同,图像还是会飘?
相同的提示不会产生相同的图像,因为每一次生成都从不同的噪声起点开始。Midjourney 每跑一次,都会重新发明那张脸、那块布料、那个光线角度与那组调色。纯文字里没有任何东西,具体到足以描述一张模型必须重现的脸。
这就是「同一个角色、换个姿势」在实务上失败的原因。你可以写「32 岁香港女性,及肩黑发,圆框眼镜,深蓝西装外套」,然后得到十二个在技术上都符合描述的不同女人。
文字描述的是类别,参考描述的是个体。这个分别,就是整件事的关键。
不断加形容词只会令飘移更严重,因为提示越长,每一个词的权重就被摊得越薄。正确做法是把提示缩短,改为附上一张参考图。
Omni Reference 如何锁定跨图片的同一个角色?
Omni Reference 的作用,是把一张参考图的内容钉进新的生成里,最实用的情况是人物、物件或产品。你用 --oref 传入一条可公开存取的图片网址,再用 --ow 控制它被执行的强度。
根据 Midjourney 的 Omni Reference 官方文件,--ow 接受 1 至 1,000 之间的任何数值,预设为 100。文件同时指出,除非你使用非常高的 stylize 数值,否则权重超过 400 的结果会趋向不可预测。
实际可用的区间相当窄。大约在 --ow 100 时,你会得到一个可辨认的人物,同时仍然能适应新的姿势与光线。推高到 --ow 300,相似度会明显提升,但弹性大幅下降,因为模型会连同原图的姿势与构图一起复制。
有两个操作细节必须注意。参考网址必须可公开连结,因此一条私人的 Google Drive 连结会失败。另外,把 Omni Reference 图片拖进 Imagine 栏,会自动以 V7 而非更旧版本执行该提示。
Style Reference 如何只锁风格而不锁主体?
Style Reference 做的事跟 Omni Reference 相反。--sref 不负责画面里是谁或是什么,而是承载视觉处理:色调、明暗层次、颗粒感、光线氛围与构图习惯,主体则完全交还给你的文字提示。
一致性真正的来源,是两者的组合。Midjourney 自己的建议,就是把 Omni Reference 与 Style Reference 并用,以建立连贯的系列;而当你想同时锁定主体与风格时,可以把同一张图同时作为 --oref 与 --sref 传入。
Personalization 则加上第三层、也是最慢的一层。以 --p 套用的 Personalization 个人化设定档,是由你长期的排序选择累积而成,会令之后的生成偏向你已经偏好过的图像。Midjourney 表示,V7 的全域 Personalization 设定档可与 V8.2 相容。
把 --p 当成你的品牌基调,把 --sref 当成单一项目的风格。前者是长期偏向,后者是可以一行换掉的专案指令。
可重复的图像工作流程,具体有哪几步?
可重复的工作流程,意思是参考图只生成一次然后重复使用,而不是每次需要新图就重新赌一次运气。整套只有四步,第一次跑约需二十分钟,之后每张图不用两分钟。
第一步:生成锚点图。为你的主体写一段简短提示,生成一批,然后只挑出最强的一张。放大它,复制它的公开图片网址。这张图从此就是你的标准参考,不应再重新生成。
第二步:生成风格板。另外制作或挑选一张承载你想要的观感的图:色调、光线、质感。它就是整个专案的 --sref 网址。
第三步:建立模板句。文字提示保持简短,只更换场景。双破折号之后的所有内容,在整个专案期间都冻结不动。
第四步:每次只改一个变数。你可以改场景用词,也可以改 --ow,但同一次不要同时改两者,否则你无法判断差异由哪个改动造成。
以下是可直接复制的模板。把两条网址换成你自己的,之后只更改场景描述。
立即试用这段提示:
[场景描述,8 至 15 字,例如「坐在咖啡店桌前阅读印本报告,晨光」] --oref [你的锚点图网址] --ow 120 --sref [你的风格图网址] --ar 16:9 --hd
参数速查表:
--- --oref [网址]:Omni Reference,钉住主体,网址必须可公开存取。
--- --ow [1 至 1000]:Omni 权重,预设 100,据官方文件超过 400 会变得不可预测。
--- --sref [网址]:Style Reference,钉住色调、光线与质感,不钉主体。
--- --p:Personalization 设定档,来自你自身排序历史的长期偏向,V7 全域设定档可用于 V8.2。
--- --ar:画面比例。--no:排除某个元素。--c:chaos,增加变化。--hd 与 --sd:解析度控制。
这套技巧在哪些情况下会失效?
参考锁定在脸孔、产品与色调上相当可靠,在文字、标志与精确几何上则不可靠。在把一整个项目押上这套流程之前先了解失效模式,最能节省时间。
它更贵。Midjourney 文件指出,使用 Omni Reference 的 GPU 时间是一般 V7 图像的两倍。在 fast hours 有限的 Basic 方案上,一个 40 张图的专案若全部使用 --oref,额度消耗速度大约是你原本预算的两倍。
它并非所有工具都支援。Omni Reference 与仍然运行于 V6.1 的功能不相容,包括 inpainting 与 outpainting。因此「先用参考生成,再用 inpainting 修补」这条路走不通,你必须二选一。
高权重会压死变化。大约超过 --ow 400 之后,你不再是在生成该角色的新图像,而是在生成参考照片的近似复制品,只是颜色略有不同。
脸孔只是近似,不是相同。对虚构的品牌代言人来说这完全足够;但若是有名有姓的真人,或客户会与照片并排比对的素材,就要预期可见的差异,并预留修图时间。
还有一个实务提醒:版本行为会变。Omni Reference 的说明是以 V7 为基准记录的,而目前预设版本为 V8.2,输出原生 2K。在大批量生产之前,先在你实际使用的版本上验证参数行为。
接下来二十分钟可以怎样实测?
请跑一个受控的三图测试,而不是直接开始整个专案。目标是找出属于你的 --ow 可用数值,因为正确的数字取决于你的参考图,以及你的专案需要多少姿势弹性。
先生成一张主体的锚点图并复制网址。然后用同一段简短场景提示跑三次,只改权重:一次 --ow 60,一次 --ow 120,一次 --ow 300。
把三张结果并排放好,只问一个问题:在哪个权重下,主体仍然可辨认,而场景仍然有变化?那个数字就是你的专案预设值,整组图都沿用它。
把它写在你日后找得回的地方。大多数人始终无法得到稳定输出,并不是因为缺少技巧,而是因为每个新专案都要从零开始重新摸索一次可用设定。
如果你更大的问题是 AI 输出品质每次都在波动,同一原则也适用于文字。关于提示可靠性,我们写过 2026 年逐步思考提示法有什么改变;关于工具订阅成本,则写过 每月 20 美元究竟买到什么。
核心结论
一致性不是一种提示技巧,而是一种参考纪律:锚点只生成一次,把它冻结,然后每次只改一个变数。
这就是「使用 AI 图像工具」与「运行 AI 图像流程」之间的分别。前者产出好看的单张图,后者产出你真正交得出去的一整组图。
懂AI,更懂你 UD相伴,AI不冷。
本文由 UD AI 团队审阅。
把技巧变成流程
认识参数只是第一步,建立整个团队都跑得动的生产线才是第二步。
UD 同行 28 年,手把手带你完成每一步,从工具选型、流程设计,到实际部署。