2026年10月6日前后,谷歌完成了一次罕见的自我换血:图像生成与编辑的招牌产品 Nano Banana 2.1 正式上线,底层架构换成 Gemini 3.6 Flash,模型 ID 定为 gemini-nano-banana-2.1。按照 ai-bot 的收录记录,这次更新在10月8日前后进入各大聚合站的视野。发布最耐人寻味的不是分数涨了多少,而是定价的走位——单张图的输出价格几乎直接砍半,公开对标上一代 Nano Banana 2 时代的价格体系;可与此同时,输入 token 的单价却从每百万 0.5 美元涨到 1.5 美元,涨到原来的三倍。一边降价一边涨价,谷歌这笔账到底怎么算的?这篇文章把官方口径的 Elo 分数、第三方转述的榜单数据和真实成本账摊开讲清楚,帮你判断这波升级到底是真便宜还是表面功夫。
官方Elo:自家Pro被按在地上摩擦
先看最抓眼球的部分。根据 Google DeepMind 官方 model card(这是本次发布的一手信息源),在 Overall Preference 这项基于人类偏好对比的 Elo 评分里,Nano Banana 2.1 的 Thinking 模式拿到 1050 分(误差±14),No Thinking 模式拿到 1015 分(误差±13);作为参照,上一代 Nano Banana 2 是 990 分(误差±7),而定位更高、价格也更贵的 Nano Banana Pro 只有 935 分(误差±8)。也就是说,新来的 2.1 不但大幅甩开了自己的前代,还把自家的旗舰 Pro 远远甩在身后——1050 对 935,差距超过一百分。这也是标题里「掀翻自家Pro」的直接依据。
这里必须先立一个前提:以上全部是谷歌官方自报的 Elo 分数,属于官方口径;截至目前尚无独立第三方测试可以交叉验证,notebookcheck 也明确指出了这一点。把它们当方向参考可以,当绝对结论就过度了。还要提醒一句,Elo 这类人类偏好评分天然偏向「看起来更好」的输出,而实际生产里你关心的可能是文字准确性、边缘干净度这类细粒度指标,两者并不完全等价。
另一个值得注意的细节是 Thinking 与 No Thinking 两档的分数差:1050 对 1015,三十五分左右的差距说明「先想后画」确实能换来可感知的质量提升,但代价是生成速度,这一点后面讲第三方数据时会再展开。对用户来说,这相当于把「快糙好」和「慢精贵」的选择权下放到了调用参数里,而不是逼你换模型。
细分到编辑能力上,差距同样明显。多角色一致性这一项,2.1 拿到 1106 分(误差±14),而上一代只有 978 分,涨幅超过一百分;多参考编辑 1066、风格化 1062、蒙版编辑 1049、单角色一致性 1028,全线领先。信息图设计从上一代的 961 分跳到 1048 分(误差±17),信息图事实性指标更是从 0.179 提升到 0.521——作为对照,Nano Banana Pro 在这项上只有 0.265。对需要批量做信息图的运营和内容团队来说,事实性指标接近翻三倍,可能比任何审美升级都更有实用价值:图里写错的数字、张冠李戴的标签,往往比构图平庸更致命。
半价是真的,但账要算两遍
价格是这次发布最大的卖点,但也是最容易踩坑的地方。根据 notebookcheck 转述的 Gemini API 定价(二手口径),单张 1K 分辨率图像的生成价格约为 0.034 美元,此前的价格是 0.067 美元,约等于半价;4K 分辨率单张约 0.076 美元,此前是 0.151 美元,同样是腰斩。如果走批量任务通道,还能在这个基础上再省 50%。
单看输出价格,确实是「半价开战」。但账必须算两遍:这次更新同时把输入 token 的价格从每百万 0.5 美元上调到 1.5 美元,涨到原来的三倍。对纯文生图场景,输入侧开销很小,半价红利基本能吃满;可一旦用到多参考图编辑——比如塞进多张参考图来保持角色一致——输入 token 的占比就会显著上升,实际省下的钱可能不到一半。换句话说,半价的对比基准是 Nano Banana 2 时代的价格,而且只对输出侧成立。用量大、参考图塞得多的重度用户,下单前最好按自己的真实用量重算一遍账。
把三类典型用户摊开算就更清楚了:第一类是营销文案配图这种纯文生图,提示词几十个词,输入成本可以忽略,输出半价约等于全线半价,闭眼切换;第二类是电商详情页这类单参考图编辑,一张商品图加一段指令,输入涨价的影响有限,总体还是省的;第三类是前面说的多角色合成,十几张参考图喂进去,输入侧成本翻着倍地涨,能不能真省钱要看具体用量,最好先小批量跑一周再决定要不要全量迁移。批量任务通道那再省 50% 的部分,对有稳定产能需求的团队才是真正的杠杆,值得优先研究。
这种「输出降价、输入涨价」的组合拳,和小模型市场的价格战打法一脉相承,我们在 小模型价格战横评 里专门拆过各家厂商的定价策略,可以对照着看。定价从来不只是成本问题,更是圈地问题:把单图价格打到足够低,先让高频用户把工作流迁过来,输入侧的涨价才有了回收的空间。
十四张参考图:编辑能力的野心所在
能力侧的变化同样值得关注。Nano Banana 2.1 单次最多支持 14 张参考图输入,其中人物最多 4 位、物体最多 10 件——这个规格基本是冲着「多人场景一致性合成」去的:广告商可以把代言人、产品、吉祥物全塞进同一次生成里,不必再来回拼接。想象一个典型的工作流:品牌方拍好代言人定妆照、产品白底图、场景素材,过去要靠设计师一层层抠图合成,现在理论上可以一次性交给模型出初稿,人工只做终审。配合多角色一致性那 1106 分的官方成绩,这组能力就是本次更新的主攻方向。
输出分辨率支持到 4K,宽高比最高做到 8:1,横幅、海报、电商长图这些非常规尺寸终于不用靠裁切凑合。对做信息流广告和Banner投放的团队来说,一个创意母版直接输出多种长宽比,比过去「先出方图再裁」的流程少了很多返工。
另一个容易被忽略的能力是 Google Search grounding:当生成内容涉及真实主体时,模型会先通过搜索核实再动笔,降低「画错真人」的概率。这对新闻配图、品牌营销这类对事实敏感的场景是实打实的安全垫,也和信息图事实性指标的大幅提升相互印证。当然,「先查再画」只能降低出错概率,不能承诺零错误,涉及真实人物的内容发布前依然要过一遍人工审核。
渠道方面,除了 Gemini 应用、AI Mode in Search、Google Ads、AI Studio、Vertex AI、Flow 和 Stitch 这些谷歌自家入口,Krea、OpenRouter、fal 等第三方平台也已接入,基本不存在想用却找不到入口的问题。自家入口覆盖从普通用户到企业开发者的完整光谱,第三方平台的接入则意味着现有工作流不需要推倒重来,这一点对存量用户相当友好。
第三方榜单:升三席,慢一倍
官方分数再漂亮,也得看第三方的独立口径。根据 huggingnews 转述的 Artificial Analysis 数据(第三方转述口径),Nano Banana 2.1 在文生图与图像编辑两个榜单上都排到第 4 名,相比上一代 Nano Banana 2 各升了三席;细分涨分上,文生图 +80 分、多图编辑 +67 分、图像编辑 +38 分。还有一个有意思的细节:在文生图 v2.0 榜单的前七名里,它是价格最低的一个。自报分数与第三方榜单虽然绝对值不可比,但「两个口径都指向大幅进步」这一点是互相印证的,进步本身基本可以坐实。
但代价同样写在数据里:生成一张 1K 图像约需 16 秒,而上一代只要 8.3 秒,直接慢了一倍。官方没有解释变慢的原因,推测与 Thinking 模式的引入有关——用时间换质量。对交互式创作来说,16 秒的等待还能接受;对批量生产管线来说,吞吐量腰斩意味着机器成本和时间成本都要重新核算。好在这组取舍是明码标价的:追求速度可以调 No Thinking 档,分数低一些但比上一代还是强;追求质量就开 Thinking,用等待时间换那三十五分的偏好差距。怎么选,取决于你的管线对时延到底多敏感。
谷歌自己承认的五个坑
难得的是,这次的官方 model card 没有报喜不报忧,明确列出了几项局限,逐条过一遍:其一,1K 分辨率下小字容易模糊,做信息图、长图文案这类需要密排小字的场景要注意,要么直接上 4K,要么后期人工补字;其二,角色一致性仍不完美,连续多轮生成可能出现偏差,漫画连载、IP 形象运营这类要求越翻越严格的场景要留出返工余量;其三,蒙版编辑场景下部分指令不会被遵守,局部重绘的指令写得越具体越要验证;其四,偶发左右方向混淆,「画面左边的人举起右手」这种带方位的指令别太信任;其五,结构对位会有残留痕迹,改图时原图的构图鬼影可能透出来。
这五条加在一起,基本画出了当前版本的能力边界——小字密排的信息图、需要逐帧严格一致的角色动画,目前都还轮不到它完全托管,人工复核环节省不得。值得肯定的是官方直接把局限写在明面上,至少说明这些坑是已知且可预期的,比发布时只报喜、踩坑靠用户自己试错的玩法体面得多。
谁该现在上车
简单收个尾。如果你是重度图像编辑用户——尤其是多角色一致性、多参考合成、信息图这几个场景——官方分数和第三方榜单都指向同一个结论:这确实是当前编辑能力的第一梯队,而且输出单价砍半,值得立刻上手试。如果你的场景以文生图为主、对速度敏感,那慢一倍的生成时间和涨到三倍的输入 token 就需要掂量,等独立评测再多一些也不迟。
行动建议可以压缩成三步:先在 AI Studio 里用真实业务提示词做小样本对比,再按自己的参考图用量把输入涨价算进总账,最后决定是全量切换还是新旧并行。图像编辑这条赛道,工具半衰期越来越短,任何迁移决策都别忘记留退路。
再往大一点的格局看,这次发布也是图像编辑战场进入白热化的一个信号:闭源阵营在拼命压单价、堆参考图上限,开源阵营则在用免费权重抢开发者。对普通使用者来说,这种竞争几乎是纯粹的利好——你什么都不用做,过一两个月再回头看,能力上限和价格下限大概率又都动过了。真正值得做的是把自己的评估流程标准化,让每一次模型换代都能用同一把尺子量一遍,而不是每次都从头试错一遍。
最后再强调一遍大前提:官方数字全部是谷歌自报的 Elo,独立测试尚未跟上。至于开源阵营这边,图像生成同样打得火热,阿里不久前开源的 Qwen Image 2.1 就是一个值得对标的选项,详见 Qwen Image 2.1 开源实测。价格战的小模型战线则更早开打,可以回顾 Claude Haiku 5.5 发布解读。