惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

月光博客
月光博客
罗磊的独立博客
The GitHub Blog
The GitHub Blog
V
V2EX
Last Week in AI
Last Week in AI
博客园 - 聂微东
MyScale Blog
MyScale Blog
美团技术团队
L
LangChain Blog
博客园 - Franky
腾讯CDC
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园_首页
S
SegmentFault 最新的问题
爱范儿
爱范儿
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Stack Overflow Blog
Stack Overflow Blog
量子位
小众软件
小众软件
宝玉的分享
宝玉的分享
J
Java Code Geeks
Google DeepMind News
Google DeepMind News
D
Docker
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报

LINUX DO - 最新话题

谷歌云盘下载700g数据集,求方法 OpenAI推出了100美元的Pro订阅后,plus的Codex 5小时限额大幅缩水 之前买的super grok居然还没掉 关于CPA认证文件周限 佬们,默认CDK的要求是什么等级啊? 最新版本的微信群聊机器人方案 有没有人知道如何free号没有封,那么是否可以循环使用,因为我看主要是周限 L站改版了?吓我一跳,我以为我浏览器崩了 淘宝这种宽带可信吗,500兆移动宽带月费8元到2099年 docker内部应用访问宿主机mysql和redis时被拒绝connection refuse Erp全栈想转行做Ai有什么推荐的吗 boost有bug 佬们,有没有靠谱点的 Plus 购买渠道 大妈,狗妈用的 lg 服务有源头开源项目吗? 有人有能过验证码打码的嘛 上次帖里好像发过通过大模型来打码的 gpt plus 封号似乎也太快了点,一天就给封号了 按流量/token收费的国产官方AI推荐 我算是知道了为什么Oracle总是ABC了 佬友们帮我分析一下 ChatGPT Team账号只有一个人使用和4个席位邀请满了使用的总额度是一样的吗? gpt-free 10个带rt CPA反代claude是默认1m吗? 我终于敢说我做出来windows上tmux的替代了,目标windows/全平台最强的终端Ai编程工具 claude pro升级max,除了原来的$20,好像还能再领一次$100 关于AI agent的知识框架 独乐乐不如众乐乐,分享一下我的的AI对话程序 佬们自建网站支付问题是怎么解决的 怎么能让gpt模仿claude风格输出 codex free已经死了,下一个会是plus或者team吗 请问chatgpt pro里的fast模式,速度快了,降智吗
初次尝试 Nano Banana 2——生成近乎真实的生活场景
yoursunny · 2026-06-14 · via LINUX DO - 最新话题

先上效果

模型:Nano Banana 2
费用:Gemini 免费版 5 小时限额消耗 100%

成品一:

image

成品二:

image

生成过程

这是我第一次尝试 Gemini 软件的图片生成功能。
我一边操作 Gemini,一边用隐私浏览器将我看到的效果与疑问描述给另一个 Google AI 搜索窗口,由其向我解释 Gemini 的逻辑。
下文“电脑”指代 Gemini / Nano Banana 2,“教官”指代 Google AI 搜索。

输入一:公园里,自行车倒在垃圾桶旁的草地上

image

我说:请将自行车扶起来。
电脑回复:自行车已经扶起,可是图片还是倒在地上的自行车。
我又说:自行车还是倒在地上?
电脑这才将自行车扶起,并撑好脚撑。
而且,电脑查阅了自行车的品牌型号,展示的自行车与真的完全一样。

输入二:提着行李的男孩

image

上传这张自拍的同时,我说:请让男孩上自行车。
这一步电脑产生的结果让我叹为观止:

  • 电脑找到了我穿着的上衣、裤子的确切款式。虽然输入二中裤腿口袋并不可见,但是结果里绘制了准确的口袋位置。
  • 输入二提在手里的行李袋,被挪进了自行车车篮。
  • 自行车从草地挪到了水泥地,而且脚撑也抬了起来。
成功的中间结果:男孩坐上自行车
image

据教官解释,电脑可以理解男孩想要骑自行车。
因为骑自行车需要双手握把,所以行李袋就被装入了车篮。

输入三:航站楼里的行李式样

image

输入二里背包的主体并不可见,所以电脑脑补了棕色背包。
我上传输入三时说到:行李式样请参看此图。
结果,电脑完全忽略了前面的场景,直接把我的两只包包从椅子上丢到了地上,然后画了一把空空的椅子。

跟随教官指引,我告诉电脑,请忽略航站楼背景、将背包画进自行车场景。
电脑这才听话,不过它在行李袋上画满了极具特色的商标。
据教官解释,电脑识别到世界知名商标后,独特文字的权重相当大,所以导致输出的每一面都出现商标。
我尝试多次,才让商标位置恢复正常。

我还发现,电脑对于“左”、“右”等方位词存在误解,难以理解我说的“左”是指自行车的左侧、还是图片的左侧。
教官建议,我要么说清“自行车的左侧”,要么使用“把手”、“前轮”等更加特定的词语来描述位置。

失败的中间结果:蓝色的背包
image

电脑对于背包的颜色、式样也存在巨大的困难。
虽然我给出了背包的确切型号,但是电脑画出的背包颜色始终不对劲。
如果我要求“蓝色 MOLLE loops”(背包正面用于悬挂小物件的尼龙缎带),拉链也会变成蓝色;如果我要求拉链变回黑色,缎带也会随之变色。
更有甚者,当我表示“拉链不是蓝色的”,整个背包都变成了蓝色,只剩一条黑色的拉链。
这个问题我没有找到解决方案,所以最终只能选择整体黑色的背包。

输入四:脸部与眼镜的侧面角度

image

我注意到中间结果里,男孩的眼眶特别深,眼镜的镜片偏小,而且黄色的镜架装饰片不见了。
所以我特意选择了一张脸部微侧的自拍,并写道:脸部与眼镜参看此图,但是注意镜片不应该变色。
之后的输出,眼眶全部恢复自然,而且镜架的装饰片也出现了。

教官赞扬了我的操作。
电脑起初选择了对着左侧的自行车,需要男孩的侧面像。
可是,输入二的脸部只有正面,所以电脑难以知道眼眶深度。
虽然镜架的黄色装饰片在输入二中可以看见,但是电脑为了节省计算成本,不得不忽略了这个细节。
因为我决定上传电脑缺少的信息,所以生成质量大大提升。

我再向电脑描述了运动鞋的型号:Pegasus 41 Arizona Wildcats。
虽然网上有大量 Pegasus 41 产品图片,但是亚利桑那大学专属版本并不多见,所以电脑在鞋子上画出了大量白色色块。
在教官的建议下,我又描述了鞋子的颜色,这才出现满意的结果。

这一步的结果就是成品一。
但是,不知是何原因,电脑将 4:3 的长方形图片改成了 1:1 的正方形图片。

输入五:男孩戴着头盔骑车

image

在教官的建议下,我让电脑生成了日落的场景。
然后我又突发奇想,写道:下大雨了,男孩的衣服都湿透了。
电脑相当理智,自动删除了太阳,而且天空布满了乌云。
但是,电脑并没有把上衣的帽子竖起来,而是任由我的头发在风中凌乱。
而且,眼镜直接换了一副,而且之前生成的背景中的公园长凳也挪动了位置。

据教官解释,虽然正常人都会在下雨时拉起帽子,但是电脑并没有这种生活常识。
对于电脑而言,一套服装就是一张粘纸。
而且,因为我从未在文字里提到镜架上的黄色装饰片,所以电脑已经遗忘了这个细节。

我又幽幽的说,处于安全考虑,骑车应该戴头盔呢。
电脑直接给加上了灰色的头盔。
我上传了输入五,并说:头盔式样参照此图。
这就是产生了成品二。
电脑画出的头盔与实际相符,湿透的服装也相当贴切。

至此,5 小时 token 额度用完,实验结束。

我学到了什么

  • 一边操作 AI,一边用另一个 AI 会话当“教官”,可以理解 AI 的内部逻辑
  • 所有的描述都要尽量准确且唯一,减少“左侧”等模糊用词
  • 对于电脑不知道的物体式样、特定的视角,可以补充那个视角的照片,让电脑直接“复制粘贴”