大多數用 AI 生成圖片的人,其實已經默默放棄了一件事:讓同一個人出現兩次。你生成了一個很滿意的角色,下一次生成卻換來一個髮型相似的陌生人。於是你妥協,只用一張圖,或者裁得很緊,或者索性改用圖庫。
這個限制在過去一年已經被解決,而解決方法不是更好的提示詞,而是一套參考圖工作流程。以下是 2026 年角色一致性的實際運作方式、值得你投入時間的兩種方法,以及把一張臉鎖定在整個系列中的具體步驟。
AI 圖像生成中的「角色一致性」究竟指什麼
角色一致性,是指把同一個可辨識的主體,包括面容、體態與服裝,放進新的場景、姿勢與光線之中,而身份不會走樣。這是一個參考圖問題,而非提示詞問題。純文字無法足夠精確地描述一張臉,因此一致性來自於每次生成時都向模型提供該主體的圖像。
這件事之所以重要,是因為它改變了 AI 圖像的用途。單一張主視覺只是裝飾;一個一致的角色卻是資產。你可以圍繞同一個可辨識的人物,建立六頁輪播、產品說明、培訓簡報,或者一個月的社交貼文。這就是「用 AI 做圖」與「用 AI 做企劃」之間的分別。
為什麼你的角色會在生成之間走樣
走樣的原因在於,圖像模型每次執行都會重新取樣隨機雜訊。你的提示詞縮窄了可能的面容範圍,但「三十多歲女性,及肩深色頭髮」這樣的文字描述,依然容許數以百萬計的不同面容。缺乏視覺錨點時,每次生成都會獨立挑選其中一個。
實務上有三件事會令走樣更嚴重。
只靠文字描述身份。不斷增加形容詞感覺應該有幫助,範圍確實會稍微收窄,但邊際效益消失得極快。用二十個字描述一張臉,鎖定身份的效果遠不及一張參考圖。
中途更換模型。每個圖像模型都有自己的「風格底色」。同一張參考圖配同一條提示詞,在 Midjourney、Nano Banana 與 Flux 上的呈現都會不同。一個角色只用一個模型,並且堅持下去。
讓場景壓過主體。冗長密集的場景描述,會與身份爭奪模型的注意力。如果你的提示詞用四十個字描寫黃昏時中環的雨後街道,只用六個字描述角色,那麼街道必然勝出。
方法一:Nano Banana Pro 多重參考,最快而可靠的路徑
Google 的 Nano Banana Pro 能在單次請求中接受多張參考圖,並據此重建主體身份。實際做法是上載同一個人不同角度的三至五張圖像,然後只描述新場景。它在單一畫面中最多可處理五個不同的參考主體,並可透過 Google AI Studio 免費使用。
如果你從未做過基於參考圖的生成,這是應該優先嘗試的方法,原因有三。它不需要學習任何參數;它能容忍不完美的參考圖,手機拍攝的照片同樣可用;而且因為它可同時接受多個主體,你能把兩個一致的角色放進同一個鏡頭,而這正是大多數單一參考工具崩潰的地方。
角度的分佈是最多人忽略的環節。三張同樣正面拍攝的圖像,只提供了一個面容視角,卻沒有交代其結構。正面、四分之三側面與全側面,才會提供幾何資訊,而幾何資訊才是姿勢改變後仍能保留下來的東西。
方法二:Midjourney Omni Reference 與權重旋鈕
Midjourney 透過 Omni Reference 處理身份,以 --oref 參數指向參考圖網址,再以 --ow 設定模型對該參考圖的依附強度。權重就是這門技藝的全部:數值偏低會讓場景與風格主導,數值偏高則保留面容,但同時壓縮你對風格的控制。
實務上,中等權重是合理的預設值。當面容本身就是重點時把它調高,例如人像、講者縮圖、換裝後的正面照。當你希望角色以強烈插畫風格呈現時把它調低,因為過高的權重會把輸出拉回參考圖的攝影質感,並與你要求的風格互相對抗。
當美學比面容的像素級準確度更重要時,Midjourney 依然是較好的選擇。而在需要可控編輯、多圖工作流程,以及同一個人必須在二十份素材中都清楚可辨的量產工作上,Nano Banana 更為適合。這是誠實的分工,也意味著「該用哪一個」的答案通常是「兩個都用,各司其職」。
把兩種方法串起來的「基準圖」工作流程
無論你用哪個工具,紀律都是相同的:指定一張基準圖,並在每一次生成時都把它餵回去。切勿用生成結果去生成下一張。如果你用第四張輸出作為第五張的參考,微小誤差會不斷累積,到第十二張時你面對的已是另一個人。
以下是能在真實企劃中站得住腳的流程。
第一步。生成或拍攝一份角色設定表:單一主體、中性光線、素色背景、三個角度、中性表情。中性是刻意的,強烈的表情會被烘進其後每一張圖像。
第二步。挑出最佳的一張正面畫格,命名為基準圖。其餘角度存為輔助參考。
第三步。撰寫場景提示詞時,身份從簡,場景從詳。參考圖負責面容,文字負責世界。
第四步。小批量生成,每次四張,一發現走樣立即棄用,而不是嘗試在後續編輯中修補。
第五步。用一個純文字檔記錄確切的提示詞、模型、參數與參考圖檔名。六星期後客戶要求多做一份素材時,這個檔案是唯一能讓你對得上整個系列的東西。
角色一致性目前仍會失效的地方
基於參考圖的生成如今已相當可靠,但並非萬能。在你向客戶承諾一整個系列之前,有四種失效情況值得先知道:手部與細緻飾物仍會走樣、極端鏡位會流失身份、衣物上的文字會變成亂碼,而兒童面容的穩定度明顯低於成人。
服裝不等於身份。參考圖對面容的鎖定遠強於對服裝的鎖定。如果某件外套或制服很關鍵,就要在每次生成時以文字明確描述,並預期需要棄用一部分輸出。
極端角度。正上方俯拍或下巴以下的仰拍,幾乎沒有提供可供比對的面部幾何,一致性會急劇下降。設計拍攝清單時,應圍繞平視至四分之三側面的角度。
群像。透過多重參考,把兩個一致的角色放進同一畫面是可行的;四個則無法穩定達成。可行的話應把群像拆成多次生成,否則就要接受背景人物不會保持身份。
風格轉換疊加身份。一邊要求高度風格化的呈現,例如水彩、動畫、七十年代菲林顆粒,一邊又要求精確的面容,是這個領域中最困難的要求。總有一方要退讓。請事先決定哪一方更重要,並據此設定參考權重。
如何測試你的參考圖是否真的管用
在你以某個角色為基礎建立整個企劃之前,先花五分鐘驗證參考圖。測試很簡單:在四種刻意差異化的條件下生成同一主體,然後檢查陌生人是否會認出他們是同一個人。四項之中有三項通過,你的參考圖就達到可量產水準。
請按次序執行以下四項檢查。第一,光線不變而改變姿勢,這能分辨模型掌握的是面部幾何,還是只記住了一張照片。第二,姿勢不變而改變光線,由室內暖光轉為陰天室外,這能揭露那些依賴特定色調的參考圖。第三,改變距離,由特寫人像轉為中景,因為部分參考圖只在原本的取景範圍內有效。第四,改變服裝,這一項最容易失敗,也最值得及早知道。
誠實評分,並把結果寫在參考圖檔名旁邊。四項中通過三項的參考圖值得保留;只通過兩項的,在棄用生成上耗掉的時間會多於它省下的時間。重新生成一份角色設定表成本很低,但在第十七份素材時才發現問題,代價並不低。
立即試用:角色設定表提示詞
把以下內容複製到你慣用的圖像工具,用來生成一份可重複使用的角色設定表。方括號內的描述只需替換一次,此後就不要再為這個角色改動它。
提示詞:
Character reference sheet, three views of the same person side by side on a plain light grey seamless background: front view, three-quarter view, and full profile view. Subject: [a Hong Kong Chinese woman in her early thirties, shoulder-length straight black hair parted slightly off-centre, minimal makeup, wearing a plain charcoal crew-neck top]. Neutral relaxed expression, mouth closed, eyes open and looking at camera in the front view. Even soft studio lighting, no harsh shadows, no colour cast. Sharp focus on facial features. Consistent identical facial structure across all three views. Photographic, natural skin texture, no retouching. 16:9 wide composition.
此後每一張場景圖像,都使用以下範本,並附上基準畫格作為參考:
場景提示詞範本:
[Reference: canon.jpg] The same woman from the reference image, now [seated at a cafe table in Sheung Wan reviewing a printed report, mid-morning daylight through a window to her left, shallow depth of field, warm neutral colour grade, candid documentary photography style]. Keep facial identity exactly matching the reference. Natural pose, no eye contact with camera.
把這一組執行一次,你在四次生成之內就會看到分別。若你想了解為何簡短的身份描述反而勝過冗長描述,我們關於取代「扮演專家」提示法的做法一文,在文字工作上闡述了相同原理。
核心結論
角色一致性已經不再是提示詞技巧,而是檔案管理技巧。2026 年能產出連貫 AI 圖像系列的人,並不是寫出了更聰明的描述。他們保有一張基準圖、一個模型、一組參數,以及一個記錄了三者的文字檔。這聽起來毫不吸引,卻正是全部訣竅所在。
今天下午就從一份角色設定表開始。三個角度、中性光線、單一主體。本文其餘一切都建立在這一個檔案存在的前提上,而製作它只需二十分鐘。這個領域的工具更迭極快,但參考圖紀律已經比三代圖像模型活得更久,也會比下一代活得更久。
懂AI,更懂你 UD相伴,AI不冷
本文由 UD AI 團隊審閱。
把一項技術變成可運作的產線
參考圖工作流程只是最容易的部分。要讓它在整個市場團隊中穩定運作,包括共用素材、已審批角色與可重複的簡報格式,才是大多數團隊卡住的地方。UD 團隊手把手帶你完成每一步,由工具選型、參考圖庫建立,到流程設計與實際部署。