谷歌Gemini 2.5 Flash Image:图像处理AI的七大创意玩法解析

谷歌AI图像模型Gemini 2.5 Flash上线,解锁等距建模、电影分镜等七大玩法,强大功能引爆热潮。

原文标题:谷歌又赢了,nano banana「被迫」改名后,网友搞出7种神仙玩法

原文作者:机器之心

冷月清谈:

谷歌推出的Gemini 2.5 Flash Image模型(原代号“nano banana”)凭借其出色的图像生成与编辑能力,再次引领AI视觉技术前沿。该模型在速度、成本和效果上超越传统竞品,被誉为“世界上最好的AI照片编辑器”,目前已在Gemini应用和Google AI Studio免费上线。网友们在短短几天内探索出多种创新玩法:包括将建筑转化为等距模型并生成多角度视图;将地图截图转化为实景,甚至能精确还原手绘DEM地形;完成对现实物体的信息标注;生成人物或动漫角色的OOTD清单,并实现精确换衣;能够从简单提示或手绘草图生成电影分镜及复杂战斗场景;将照片转绘成黑白漫画并续写故事;以及进行图片风格化转换、老照片修复与上色等。这些多样化的应用展示了该模型在创意和实用层面的巨大潜力。

怜星夜思:

1、这款AI图像模型能实现这么多“神仙操作”,你觉得它最快会颠覆哪个行业?或者,你最希望能用它帮你的工作做什么?
2、模型这么强大,能把地图变实景、给人换衣服,有没有让你担心的地方?比如版权、真实性,或者别的啥?
3、文章里提到了一些小bug,比如人物数量对不上号,你觉得它还有哪些地方可以变得更厉害?未来最期待它增加什么功能,或者改进哪些不足?

原文内容

机器之心报道

编辑:杨文

世界上最好的AI图像编辑模型又易主了。


谷歌这次又赢麻了!


神秘图像编辑模型后,热度仍居高不下,火爆程度丝毫不亚于 GPT-4o 掀起的「吉卜力热潮」。



小声蛐蛐一句:nano banana 这名多好听、多好记,干嘛改成一个那么老长的名?😂



与其他竞品相比,该模型生成速度更快、成本更低、图像生成与编辑能力更强,网友们不吝赞美之词,直呼这是世界上最好的 AI 照片编辑器


目前,该模型已在 Gemini 应用和 Google AI Studio 上线,用户只要在模型列表中选择 Gemini 2.5 Flash Image,上传图像或者输入文字提示词,即可免费体验。开发者也可以直接通过 Gemini API 调用。


  • Gemini 网页版链接:https://gemini.google.com

  • Google AI Studio 链接:https://aistudio.google.com


短短几天,网友们已经玩疯了,开发出各种新奇玩法。


制作等距模型


nano banana 可以轻松将单个建筑或物体分离出来,转化为等距模型。


谷歌亲自下场,在 X 官方账号中大力推荐这种用法。


比如上传一张咖啡店夜景照,输入提示词「Make Image Daytime and Isometric」,nano banana 不仅能把夜晚变成白天,还会自动补全原图没展示出来的建筑细节:剥落的墙皮、杂乱的电线…… 全都原汁原味复刻。唯一的小 bug 是坐着聊天的男男女女人数对不上号。


左右滑动查看更多


它还能做出类似产品建模或工业设计里常见的六视图,主体在各个角度都保持一致,同时还保留等距视角效果。


提示词:Front, Rear, Left, Right, Top, Bottom views on white. Evenly spaced. Consistent subject. Isometric Perspective Equivalence. (在白色背景上展示正面、背面、左侧、右侧、顶部和底部视图,间距均匀,主体一致,保持等距视角。)



标注现实世界


前谷歌产品经理 Bilawal Sidhu 直接上传了现实中的建筑截图,让 nano banana 标注相关信息,提示词:you are a location-based AR experience generator. highlight [point of interest] in this image and annotate relevant information about it.



有网友反手就将上述生成的标注图丢给 ChatGPT,来验证它是否胡说八道。


据 ChatGPT 核查,标注信息基本正确,只是在 Ferry Building 的开放时间和 Palace of Fine Arts 的重建时间两个细节上不够准确和完整。



地图可视化


nano banana 还能把地图变成实景。


上传东京塔、金门大桥的谷歌地图截图,在上面标个红色箭头,输入提示词 「what does the red arrow see」,模型就像人站在某个地点朝某个方向看一样,生成箭头标记位置和方向的景色。



甚至是一张虚构的旧金山 - 纽约混合城市地图的红箭头视角,它都能生成接近真实景观的图像。


提示词:draw the ground level view of the red arrow in SanFranciscoNewYork.


左右滑动查看更多


更高阶的玩法是先让它绘制一张带有等高线的 DEM,提示词:draw a DEM with contour line.


然后让它从红色圆圈处沿箭头方向绘制现实世界的视图,提示词:draw the real world view from the red circle in the direction of the arrow.


nano banana 生成的自然景观图中高度还原了 DEM 中描述的地形特征,包括湖泊、山脉和草原。



OOTD、换衣


OOTD 这个玩法简直是各大时尚博主的最爱。现在只要上传一张穿搭照片,nano banana 就能秒出穿搭清单。


提示词:give me this character ootd.



不仅是真人,动漫角色的穿搭也能瞬间转换为 OOTD。当然也有 bug,比如漏掉手提包、鞋子颜色和帽子纹络不对等,但整体效果还是挺惊艳的。


提示词:give me this character ootd.



给人物换衣更是小菜一碟。即使 T 恤图案花纹繁复,nano banana 生成的换衣图片中也能 1:1 复刻,连褶皱都异常逼真。




生成电影分镜


估计不少人都见识过姜文导演的火柴人分镜手稿,画风那叫一个抽象。



现在只要上传男女主肖像图,输入简单的提示词,nano banana 就能生成多帧电影镜头,啥风格都能 hold 住。


此处 @导演姜文。



更绝的是,nano banana 还能识别手绘内容,并根据手绘姿势生成复杂的战斗场景。


只需提供两个动漫角色图像,再加上一张手绘简笔画指定战斗姿势,输入提示词「Have these two characters fight using the pose from Figure 3. Add appropriate visual」,AI 就能将这些元素整合,还能添加丰富的背景和特效。



生成漫画


a16z 合伙人 Justine Moore 用 nano banana 测试了漫画创作。


第一步,给一张真实的自动驾驶汽车照片,提示词「turn this into black-and-white manga」,AI 将照片转换为黑白漫画风格,不仅保留了车辆和背景的细节,还添加了动态效果。


第二步,加一句提示 「make the next panel a funny cat-related twist」,模型就生成了下一帧:车里出现了一只猫,还配了幽默的对话框「Mission Complete!」


总之,nano banana 不仅能改风格,还能顺着提示自动编故事,生成连贯的漫画。



风格化、修复或上色老照片


此前,GPT-4o 在全球刮起了一场吉卜力浪潮,而对于 Nano Banana 来说,转绘风格效果也相当有看点。


比如将穆罕默德・阿里的拳击胜利照片改编成《辛普森一家》风格的卡通图像,这效果太以假乱真了,我一度以为这是动画片中的一幕。



对于修复老照片、给黑白照片上色等常规操作,Nano Banana 更是手拿把掐。


提示词:Restore this photograph.



提示词:Add color to this photo. 



你还探索出哪些 nano banana 的稀奇古怪的玩法?欢迎在评论区聊聊~


参考链接:

https://x.com/6xyzzxy1/status/1960736252661260294

https://x.com/Error_HTTP_404/status/1960405116701303294

https://x.com/bilawalsidhu/status/1960529167742853378

https://x.com/tokumin/status/1960583251460022626

https://x.com/op7418/status/1960362278357987649

https://x.com/skirano/status/1960343968320737397

https://x.com/yachimat_manga/status/1960555945131696329

https://x.com/alex_prompter/status/1960773176264118429


© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

个人觉得对电商和时尚行业来说简直是福音!像文章里提到的OOTD(每日穿搭)和换衣功能,不光能帮时尚博主快速出搭配清单,还能让电商平台轻松实现虚拟试衣、展示产品在不同场景和风格下的效果。这直接省了多少P图和实拍成本啊,消费者也能更直观地购物,双赢!

担心是肯定有的,但没必要过度焦虑吧。就像Photoshop刚出来的时候,也一堆人担心造假和滥用。我相信随着技术发展,会有配套的识别、追溯和监管机制跟上,比如给AI生成图片添加不可篡改的水印,或者开发专门的AI内容检测工具。这些工具会让我们更好地辨别信息真伪。作为用户,保持理性判断最重要了。

我觉得它要是能与其他应用场景深度集成,那就更牛了!比如直接集成到视频剪辑软件里,让电影分镜和视觉特效的生成更流畅,甚至能实现初步的动画制作。或者进一步发展成能理解更复杂的指令,比如能根据我几句话,然后自动填充更多细节和情感,甚至帮我写个故事大纲,然后直接把剧本变成电影,那才叫真正的“神仙”!

肯定是有啊!模型能把地图变成超逼真的实景,万一被用来生成虚假的灾难现场或者误导性的新闻图片传播开来,社会影响就大了。还有那个给人物换衣服的功能,虽然很方便,但总让人联想到深伪(deepfake),隐私和肖像权问题怎么保障?感觉监管和伦理规范必须得跟上技术发展才行。

要是说颠覆嘛,我觉得对概念设计师和电影分镜师的影响会立竿见影。以前画分镜要耗费大量时间和精力,现在输入几个关键词,或者画个草图,AI就能快速生成多角度、多风格的场景,大大提高效率。设计初期就能通过视觉化快速迭代,简直是效率提升神器!

我首先想到的就是版权问题。AI训练了那么多图片,它生成的东西,如果与现有作品高度相似,或者直接复刻了某个品牌的独家设计,那算不算侵权?特别是OOTD这种有商业价值的场景。另外,如果大家都能轻轻松松“创作”出高质量内容,会不会对原创作者群体造成冲击,甚至压榨他们的生存空间?