為什麼同一段提示詞,在不同 AI 影片模型上效果差這麼遠?
因為 AI 影片模型並非可以互換的通用工具。每一個模型在訓練與調校時都針對不同任務:有些擅長穩定的鏡頭運動,有些的口型同步是原生生成,有些純粹便宜到讓你可以反覆嘗試。把所有鏡頭都丟給同一個你最順手的模型,正是 AI 影片輸出品質參差的最大原因。
過去兩星期,我用三份相同的簡報分別在五個模型上跑過:產品環繞鏡頭、一句對白的人物鏡頭、城市空鏡。模型之間的品質差距,其實小於「派工」的差距。
模型派工(model routing)是指把影片中每個鏡頭分派給最適合該鏡頭類型的模型,而不是全部在同一個平台生成。這是工作流程的決定,不是訂閱方案的決定,而且通常能同時降低成本與重拍次數。
哪一個 AI 影片模型適合哪一種鏡頭?
把鏡頭配對到模型的強項。對白用原生口型同步的模型,鏡頭運動用可控性高的模型,背景空鏡用最便宜的一檔,單一主視覺鏡頭則交給榜首模型。截至 2026 年 7 月,沒有任何一個模型在這四類同時勝出。
以下是我現在使用的派工表:
--- 對白與人物鏡頭:選原生口型同步的模型。Seedance 2.5 是目前首選,聲音與嘴型一同生成,而非事後配上。事後配音的口型,在手機螢幕上兩秒內就被看穿。
--- 指定運鏡:Runway Gen-4.5。它對結構化提示詞(推軌、環繞、變焦對焦)的反應比榜首模型更可預測,而且嵌進剪接流程而非聊天視窗。
--- 背景空鏡與過場:用你能接受的最低價位。Veo 3.1 Lite 與 Runway Gen-4 Turbo 均約為每秒輸出 0.05 美元。沒有人會為你的第三個過場鏡頭按暫停。
--- 主視覺鏡頭:Gemini Omni Flash。截至 2026 年 7 月下旬,它以 1527 Elo 位居 LMArena 文字轉影片榜首,領先第二名約 45 分,並支援對話式修改。
--- 4K 或較長序列:同樣是 Seedance 2.5,新增原生 4K 與 30 秒輸出,以及最終算圖前規劃運鏡的 3D 預覽步驟。
模型每隔幾星期就會改朝換代,但派工的分類不會。把習慣建立在分類上。
AI 影片每一分鐘成片,實際成本是多少?
遠高於每秒標價,因為你不可能用第一次生成的結果。以實際上約 8:1 的生成與採用比例計算,一分鐘成片代表約 480 秒輸出。以每秒 0.10 美元計算約為 48 美元,折合約 375 港元;以每秒 0.05 美元計算則降至約 187 港元。
截至 2026 年 7 月下旬的公開牌價,按輸出秒數計算:
--- Veo 3.1 Lite:約每秒 0.05 美元。Runway Gen-4 Turbo:約每秒 0.05 美元(每秒 5 點數)。
--- Kling:約每秒 0.07 美元,Kling 3.0 接近 0.10 美元。
--- Sora 2 基礎版:720p 約每秒 0.10 美元。Sora 2 Pro:約 0.30 至 0.50 美元,1080p Pro 可達 0.70 美元。
--- Gemini Omni Flash:約每秒 0.10 美元(每百萬影片輸出 token 17.50 美元),透過 Batch API 可減半至約 0.05 美元。
--- Runway Gen-4.5:每秒 12 點數,約 0.12 美元。Veo 3.1 標準版:1080p 約每秒 0.40 美元。
在決定訂閱方案之前先算一次。同樣以 8:1 比例計算,一段 60 秒產品影片若全部使用 Veo 3.1 標準版,單是生成成本便約為 1,498 港元。若妥善派工,只保留一個主視覺鏡頭、其餘交給低價檔,同樣一分鐘的成本會落在約 250 港元。
以上每一個數字都只是快速變動市場中的牌價。真正動用預算的當天,請回到供應商自己的定價頁面確認。
一段好的 AI 影片提示詞應該長什麼樣?
好的提示詞會按固定次序寫明五件事:主體、動作、鏡頭、光線、格式。模糊的提示詞只會產生模糊的動態。模型並非憑感覺猜測你的意圖,而是把你的文字對應到訓練字幕,而字幕語言本身就是技術性的。
以下是我每個鏡頭都在用的範本。原樣複製,填入方括號內容即可。
試試這段提示詞:
SUBJECT:[一個具體主體,寫明材質與顏色,例如「一隻霧面黑陶瓷咖啡杯,冒著熱氣」]
ACTION:[只寫一個物理動作,例如「熱氣緩緩上升,液面靜止」]
CAMERA:[只寫一個運鏡,例如「由左至右緩慢 90 度環繞,視平線高度,50mm 鏡頭」]
LIGHTING:[光源、方向、色溫,例如「單一柔光主燈自鏡頭左側打入,暖色 3200K,向黑色深度衰減」]
FORMAT:[時長、比例、解析度,例如「6 秒,16:9,1080p,無文字疊加,無標誌」]
NEGATIVE:[不可出現的元素,例如「無手部、無攝影棚反光、無鏡頭晃動」]
有兩條規則讓範本生效。每段片只給一個動作、一個運鏡:同時要求橫搖、變焦與主體轉身,結果只會一團糊,分成兩段再剪接。永遠不要省略光線描述:光線正是決定多段片段是否像同一場拍攝的關鍵變數。
如果你已經在為文字模型撰寫結構化提示詞,這是同一套紀律換到另一種輸出形式。我們關於情境工程的文章,說明了為何在各類模型上,明確結構都勝過巧妙措辭。
怎樣讓多段 AI 片段看起來像同一支影片?
在每次生成之間鎖定三個變數:光線描述、鏡頭焦段與高度、色彩基調。把這三行原文照抄到每段提示詞,只更換主體與動作。大部分「AI 影片看起來很割裂」的抱怨,源頭都是每次重寫光線那一行。
提示詞之外,善用平台的一致性功能。風格參考、角色鎖定、種子碼重用本質上都在做同一件事:把模型約束在先前輸出上。Runway 與 Kling 都有這類設定,聊天式工具則往往藏得很深。
然後在剪接軟件裡收尾。所有片段套用同一組 LUT 調色,整條時間線加一層顆粒,統一音場。十五分鐘調色掩蓋的模型不一致,比多生成五十次還要多。
靜態圖像那一端同樣有進展,這對分鏡很重要。Meta 於 2026 年 7 月 7 日推出 Muse Image,目前在文字轉圖像約排第三、圖像編輯排第二,Google 亦推出了 Nano Banana 2 Lite。先把關鍵幀以靜態圖生成,確認後再動畫化,成本遠低於直接在影片階段反覆試。
2026 年,AI 影片在哪些地方仍然做不好?
穩定地失手於四處:具名產品、畫面文字、需要精細操作的手部、以及超過約十秒的連貫性。這些不是靠更好措辭就能解決的提示詞問題,而是當前的模型極限,假裝不存在只會浪費預算。
--- 你自己的產品。沒有模型見過你的貨號。生成的近似品不如手機實拍。產品實拍,環境交給生成。
--- 畫面文字。小字級的清晰文字至今不穩定。字幕與標題請在剪接軟件加上,而不是寫進提示詞。
--- 精細手部動作。手指操作小物件仍然是最常見的失敗點。用切鏡或裁切避開。
--- 長度。多數模型在短片段上表現最好。即使有 30 秒輸出,也應以多鏡頭組成序列,而非押注一次完美長生成。
誠實比吹捧有用。AI 影片如今在氛圍、動態與環境上確實出色,在具體指涉上仍然薄弱。依這個分界規劃剪接,輸出就不再像賭博。
立即試做:20 分鐘派工測試
挑一個你這星期真正需要的鏡頭。用上面的範本生成三次:一次用低價檔,一次用 Runway Gen-4.5,一次用當前榜首模型。五行內容相同、光線文字相同,只更換平台。
然後看「每段可用片段的成本」,而非每秒成本。我的測試中,低價檔在空鏡上大幅勝出,在需要指定運鏡的鏡頭上則慘敗。這一次測試抵得上幾個月的訂閱猜測。
把結果記在一張兩欄筆記上:左邊寫鏡頭類型,右邊寫勝出模型。那張筆記就是你的派工表,價值高於任何排行榜,因為它反映的是你真正會拍的鏡頭。若你想了解模型在不同負載下的行為差異,我們的AI 努力程度設定指南在文字端說明了同一個原則。
結語
不要再尋找「最好的 AI 影片模型」,改為把鏡頭派給最能處理它的模型。建立派工表只需要一個下午,能撐過每一次模型改版,並把一分鐘成片的成本,從四位數港元壓到低三位數。
科技應該減少你在壓力下要做的決定,而不是增加。懂AI,更懂你 UD相伴,AI不冷。
由 UD AI 團隊審閱。
🎬 把技術變成可重複的流程
派工表你已經有了,下一步是把它建成每週都能穩定運行、不用每次從零重建的製作流程。UD 團隊手把手帶你完成每一步,由工具選型、提示詞庫,到審核關卡與交付。