谷歌放出香蕉 2.1:轻量版反超自家旗舰,出图价砍了一半

谷歌在深夜放出了新版图像模型。

它叫香蕉 2.1,出自 Gemini 3 系列。

底子只是一个轻量版模型。

价格却压到了上代的一半。

上线不到一小时,网友的测试就刷满了时间线。

谷歌官方账号的推文截图,宣布新版图像生成与编辑模型上线。

改图更有讲究。

圈出一块,就只改这一块。

人物和产品连改几轮,脸也不走样。

最多能同时塞进十四张参考图。

出图最高支持 4K 直出。

价格只有上代的一半。

在公开的多图编辑榜上排到第四。

前面只剩对家那三款图像模型。

只写着模型名的标题卡。

小模型反超旗舰,靠的是性价比

香蕉 2.1 的底子是轻量版模型。

按老规矩,它也能叫轻量版图像模型。

在一批基准测试里,它在视觉设计上压过了旗舰款。

编辑和一致性两项同样是领先。

官方基准测试表。

小字渲染和三维推理还有改进空间。

事实性也不算完美。

但对天天要做图的人来说,这次升级够用了。

专业级的精度和控制力。

反复快速迭代。

海报和复杂图表里的文字能写清楚。

长上下文里的现实世界知识。

多种语言的本地化文字渲染。

网友的盲投也证明了这一点。

对做 AI工具 的人来说,这是一次直接的比价。

盲测平台公布名次的推文截图。

在盲测榜上,它拿到多图编辑第四。

文生图第五,单图编辑第六。

多图编辑这一项,前面只剩对家那三款图像模型。

上一代在这三个榜上,最好也只是第七。

多图编辑榜排名截图。
文生图榜排名截图。
单图编辑榜排名截图。

左右滑动查看

价格只有上代一半,谷歌这回是要打价格战。

圈哪改哪,脸还不带变的

蒙版编辑,用过修图软件的人都熟。

圈出一块,只改这一块。

这在 AI编程 的工作流里一直很难。

你对模型说,把左下角那个杯子换成红的。

它得先猜你说的是哪个杯子。

再把整张图重新生成一遍。

别的地方保不保得住,全凭运气。

现在圈一下就行。

宁可多圈一遍,也别整张重画。

换衣服或换招牌,都只动圈住的那块。

清掉背景里的路人,也是一个圈的事。

就这么回事。

在 AI对话 里贴张图让它改,同样不用重画整张。

网友给它连出了三道题。

生成一道,改图一道。

换风格再一道。

网友三步测试的推文截图。

第一题,画一张纸币。

画面上是一位托腮沉思的老哲人。

头发往后化成了一整座迷宫。

第二题就在这张图上改。

编号从一串老数字换成了新的编号。

两侧的小字也换了。

老哲人手里多了根香蕉当电话。

底下还加了一条飘带。

两张摆在一起看,迷宫和长袍原样没动。

胡子也没动。

生成的纸币图。

第三题换风格,整张纸币变成了一幅油画。

局部修改后的纸币图。

蒙版编辑这一项,新版拿了一千零四十九分。

比上代高八十四分。

比旗舰款高一百二十二分。

就算不开思考模式,它在每一项上也都压着旗舰款。

官方能力评分表。

另一项升级是主体一致性。

说白了就是别变脸。

拍电商图和做品牌海报的人最有体会。

画连载漫画的也一样。

同一个模特换十套衣服,换到第三套,脸就开始不对劲。

这次涨分最猛的就是这一项。

多人物一致性拿到一千一百零六分。

比上代高出一百二十八分。

开发者最多能塞十张物体参考图。

再加四张人物参考图。

让模型照着画。

网友给了一张模特照,又加了上衣和半裙,还有包跟鞋,让它出六个不同场景的照片,六张都是一次生成。

网友做模特一致性测试的推文截图。
电商场景图之一。

走着,坐着,靠在台边。

换了六个姿势,脸和衣服都没走样。

包和耳环也都还在。

拿去当一组电商图都够了。

画面本身也更像拍出来的。

谷歌放出的样图里,有挂满水珠的甲虫。

还有粉房子外楼梯上的绿裙姑娘。

乍一看真分不出是模型画的。

同一组电商场景图。

做信息图时,它能先上网页搜索和图片搜索查资料。

查完再动笔。

在谷歌的自动评测里,新版做信息图的准确分是零点五二一。

上代只有零点一七九。

旗舰款也才零点二六五。

让它画一张科普图,内容画错的情况会少很多。

官方评分表里的信息图一节。

画图便宜了,动脑更贵了

出图按每百万词元三十美元收。

正好是上代的一半。

一张一K图从六分七厘降到三分四厘。

四K图从十五分一厘降到七分六厘。

这个价,跟七月那款主打便宜的轻量版一模一样。

不过别的项目反倒涨了。

输入从每百万词元半美元涨到一点五美元。

是原来的三倍。

文字和思考的输出,也从三美元涨到七点五美元。

相当于谷歌把钱从画挪到了想上。

图省事的钱,它反而降了。

价签就是这么写的。

汇总定价的推文截图。
模型选择界面截图。

开发者现在就能在在线工具里选到它。

模型名里带着香蕉 2.1 的编号。

上代的接口会在十月二十九日关停。

普通用户也不用等。

手机应用今天起陆续上线。

视频工具和设计工具同样跟上。

在谷歌应用里,点搜索框下面那个香蕉图标就能玩。

风格模板界面截图。

网友连夜上强度,对线打到了改图

模型上线不到一小时,就有人开测。

一位开发者出了一道酷刑测试。

提示词要求一张图里同时塞进人群和杂物,还要有能看清的文字,再加上雨天的反光,再看这些东西凑在一起,还像不像一张真照片。

开发者发布酷刑测试的推文截图。
酷刑测试生成的结果图。

另一位网友让它画一块茶馆的菜单板。

同一款茉莉绿茶,要用四种文字写出来。

英语和日语都在里面。

阿拉伯语和印地语也在。

一次出图。

多语言文字测试的推文截图。
生成的茶馆菜单板。

还有人选了一段专挑软肋的提示词。

画面里要有细线纹身。

还要有三条项链,一排耳饰。

手上再来一条手链。

最后是一副能透出眼睛的有色墨镜。

然后交给新版和对家那款,各画一张来比。

同题对线的推文截图。
两张同题结果并排。

新版把纹身全画在了指定的位置。项链和耳饰也都在。就是墨镜忘了上色。脸还被晒红了一片。

手表场景测试的推文截图。
手表场景的两张结果。

有人挑的对手是上一代对家图像模型。

他让两个模型画同一个场景。

书桌上放着的一块手表,各出一张。

对比速度与价格的推文截图。
章鱼主题场景的对比图。

左边是自然光,像随手拍的。右边开了台灯,表盘还换成了镂空机芯。一股精修广告图的味道。

速度上差得更多。

五个提示词,每个都让两边各画一张。

新版出一张图要十一秒,花四分四厘美元。

对家那款要五十秒,花六分九厘美元。

四道太空题对比的推文截图。
黑洞场景的对比图。

有人出了四道太空题。

一个旋涡星系。

一个超大质量黑洞。

一个类星体。

外加把整个太阳系装进一张图。

同样两边各画一遍。

四张画下来,新版一共花十七分八厘美元。

对家那款要二十八分四厘美元。

同一道黑洞题,左边画得克制。

右边把星云和火焰全拉满了。

中文测试的推文截图。

中文这块,一位知名博主测了一圈。

他的结论是字更清楚,错字少了很多。

排版也干净,没有对家那种破碎感。

他更看重的是能直接出 4K。

中文电商海报测试结果。
中文标语海报测试结果。
中国茶题材长图海报。
荷花题材海报。

当然也不是没有破绽。

一张海报旁边那行竖排小英文,放大一看已经糊成了乱码。

长图海报的局部截图。

四月,对家的图像模型上线。

在同一个盲测榜的文生图项上,领先上代两百四十分。

九月,对家又发了新版。

主打的就是只改指定区域,多轮修改不跑偏。

不到一个月,谷歌的新版也押在了这两件事上。

两家前后脚卷改图,原因不难猜。

电商和广告这些行当,一张图动辄改上十几版。改到第十版还不崩,比第一版惊艳重要得多。

所以谷歌这次直接把新版塞进了广告平台和企业平台。

冲的就是这群天天改图的客户。

话说回来,轻量版都把旗舰超了。

旗舰款的下一代,谷歌打算什么时候端上来。

Gemini会员中转站 微信:douhanq