大多数使用 Google Nano Banana Pro 的人,只是输入三个关键词、按下生成,然后祈祷结果理想。接着他们纳闷,为什么成品看起来和网上其他 AI 图像没有两样。问题不在模型,而在你与它沟通的方式。Nano Banana Pro 的设计,是让你像摄影师指挥拍摄一样去引导它,而不是像搜索框那样查询。一旦你完成这个转变,第一次就成功的概率会大幅提升。
Nano Banana Pro 是什么?为何与众不同?
Nano Banana Pro 是 Google 的高阶图像模型,技术名称为 Gemini 3 Pro Image。根据 Google DeepMind 的模型页面,它可生成 1K、2K 及 4K 图像,支持由 1:1 至 21:9 共十种长宽比,并能在单一场景中维持最多五个一致的角色与十四件物件。
真正的差别在于「控制力」。旧模型只能猜测你的意图,Nano Banana Pro 则会回应你对光线、镜头与构图的明确指示。因此,随便的提示词与经过引导的提示词之间,质量差距如今极为巨大。
别再堆砌关键词,改为引导整个场景
最重要的升级,是描述一个「场景」,而非一个「主体」。像「办公室、专业、笔记本电脑」这类关键词,根本无法让模型发挥。经过引导的描述,会告诉它画面中有谁、他们在做什么、光线从哪里来,以及你想要的氛围。
比较以下两个提示词。第一个只是关键词堆砌,第二个则引导了整个场景,成品会实用得多。
弱:专业女性、办公室、笔记本电脑、工作中 引导:一位三十出头的市场经理,在明亮的香港共享办公空间内,用笔记本电脑检视一个营销企划。午后阳光从左边落地窗透进来。温暖而专注的氛围。以 Fujifilm 相机拍摄,浅景深。
你并非为了复杂而复杂,而是给了模型它真正需要的四样东西:主体、动作、光源与氛围。
如何在提示词中控制光线与镜头?
指定具体的相机与光源,会改变图像的「视觉基因」。Google 的官方提示指南指出,要求 GoPro 会带来身临其境、略带变形的动感;Fujifilm 相机给出真实的色彩科学;即弃相机则呈现粗犷而怀旧的闪灯质感。
把光线当作一个你要设定的变数。「左方柔和的窗光」、「正午强烈的阳光」或「昏暗房间中一盏温暖的台灯」,即使主体相同,也会产生截然不同的照片。如果你的图像看起来平淡无味,几乎肯定是你忘了描述光线。
如何让同一个角色在多张图像中保持一致?
一致性正是 Nano Banana Pro 名副其实的地方。当你提供参考图时,要为每一张分派任务,而不是把它们一股脑丢进去。这正是让你打造品牌角色,或可重复的产品照的关键技巧。
明确说明每张参考图的角色,例如:「用图 A 的脸、图 B 的姿势、图 C 的背景。」并让各参考图的光线与视角尽量相近,否则模型会难以自然地融合它们。
立即试用:一个可复制粘贴的提示词范本
以下是一个可重用的结构,你可以直接贴进 Nano Banana Pro,两分钟内完成调整。它强迫你填满模型需要的每个变数,这正是它有效的原因。
生成一张 [长宽比] 的图像。 主体:[是谁或什么,附年龄与关键细节] 动作:[他们此刻正在做什么] 场景:[具体地点,加入在地细节] 光线:[方向、软硬、色调、时间] 镜头:[相机类型或镜头、景深] 氛围:[两至三个形容词] 图中文字:无 保持照片写实,不要任何标志。
当你需要在图中加入文字时要注意一点。Google 建议你先在对话中请模型草拟确切文字,确认字句后,再要求它以该文字生成图像。这能避免 AI 图像常见的错字问题。
Nano Banana Pro 目前仍有哪些短板?
诚实很重要,因为这批读者早已被 AI 的过度吹捧伤过。Nano Banana Pro 在处理大段小字、精确计算大量相同物件,以及非常具体的手指姿势时,仍然吃力。它很出色,但并非万无一失。
解决方法是顺着它的强项走。图中文字尽量简短,要人群就别去数精确数量,涉及手部时就重生成两三次。面对高难度的画面,预留几次尝试,而不是奢望一次完美。
重点总结
Nano Banana Pro 奖励「引导」而非「关键词」。描述主体、动作、光线与镜头,为每张参考图分派清晰任务,并在生成前先草拟图中文字。做到这些,你第一次的成品质量就不再是碰运气。
出色的 AI 图像来自一套可重复的工作流程,而非一次幸运的提示。懂AI,更懂你 UD相伴,AI不冷。
掌握了这个技巧,下一步是把它整合进一套每次都能产出品牌风格图像的工作流程。UD 团队手把手带你完成每一步,由挑选合适的 AI 工具,到建立全团队都能重用的提示词库。