惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

量子位
aimingoo的专栏
aimingoo的专栏
C
CXSECURITY Database RSS Feed - CXSecurity.com
Stack Overflow Blog
Stack Overflow Blog
C
CERT Recently Published Vulnerability Notes
T
Tailwind CSS Blog
腾讯CDC
罗磊的独立博客
Security Latest
Security Latest
K
Kaspersky official blog
A
Arctic Wolf
博客园 - Franky
D
Docker
博客园 - 司徒正美
GbyAI
GbyAI
T
Tenable Blog
Engineering at Meta
Engineering at Meta
A
About on SuperTechFans
H
Help Net Security
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
L
Lohrmann on Cybersecurity
小众软件
小众软件
V
V2EX
T
Threatpost
T
Threat Research - Cisco Blogs
T
The Exploit Database - CXSecurity.com
P
Palo Alto Networks Blog
P
Privacy & Cybersecurity Law Blog
S
Securelist
Google DeepMind News
Google DeepMind News
I
Intezer
The Register - Security
The Register - Security
NISL@THU
NISL@THU
L
LINUX DO - 热门话题
C
Cisco Blogs
AWS News Blog
AWS News Blog
MyScale Blog
MyScale Blog
S
Schneier on Security
Scott Helme
Scott Helme
T
The Blog of Author Tim Ferriss
G
Google Developers Blog
Project Zero
Project Zero
Cyberwarzone
Cyberwarzone
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
I
InfoQ
Cisco Talos Blog
Cisco Talos Blog
Know Your Adversary
Know Your Adversary
L
LangChain Blog
P
Proofpoint News Feed

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派 万字剖析:千问App深度体验报告(2026) - 少数派 在2026年,如何真正防止别人抄袭你的作品 - 少数派 怎么用 50 块搭个 AI 语音助手?我踩了 3 天坑 - 少数派 YeeroAI:让 AI 对话真正成为知识管理的一部分 - 少数派 爬泰山 - 少数派 「旅图显影」 App 更新:这次,我们补上了一点「手感」 - 少数派 假期出门太折磨?我的 23 条经验帮你规划惬意旅行 - 少数派 工作流会变吗 - 少数派 Claude Opus 4.6 怎么用最省钱?我测了 5 种方案 - 少数派 GPT Image 2 让图文并茂不再稀罕 - 少数派 用户侧出发——什么是AI,我要不要学习? - 少数派 找片、转存、整理、播放一条龙!让你的付费网盘值回票价 - 少数派 欢迎试用!日课一问2.0插件 - 少数派 自己做的MDeditor,原本想购买 Typora 试了两次支付不成功,干脆自己做一个 - 少数派 vibe coding了一个 3MB 的小工具,让 ~/Downloads 彻底告别混乱 - 少数派 因为受不了 Mac 的风扇策略,我做了一个风扇控制工具 - 少数派 别只怪模型 - 少数派 Warp 终端的 AI 功能怎么用?我测了一周的体验 - 少数派 AI 写代码老是出 bug?这 5 个配置我后悔没早知道 - 少数派 「新玩意」苹果出相机可能就这样:Sigma BF + 45mm F2.8 DG Contemporary - 少数派 一个面向2030年的AI操作系统是什么样子的:浅谈cola这款有灵魂的Agent - 少数派 别只看写代码 - 少数派 每天解决10个问题,还是一口气攻坚解决400个? - 少数派 AI 交易机器人怎么搭?我用 Claude 跑了一周实盘 - 少数派 Maptoposter Online:把你爱的城市画成艺术海报 - 少数派 Function Calling 怎么用?我测了 3 个模型发现差距真大 - 少数派 Legend Talk:我做了个 AI 圆桌,让 160 位思想家围着你的问题转 - 少数派 如何找到自己的蓝方?在小县城寻找压力测试 - 少数派 语音输入与软件接口|2026年聊AI时,我们都聊些什么(上) - 少数派 混动已经卖爆,纯电又来补刀——钛7闪充版简直“不讲武德” - 少数派 本月玩什么|朋友收藏、识质存在、沙罗周期 - 少数派 为什么要每天坚持输出? - 少数派 Claude API 挂了好几个小时,你的项目有备用方案吗? - 少数派 Function Calling 没你想的复杂——我用它做了个有点用的工具 - 少数派 登录系统立即播放视频或者图片音乐的软件 - 少数派 我为什么创建 FlipHTML5 下载工具 - 少数派 残局没电?多品牌外设电量统一管理软件EasyBluetooth已支持RTSS游戏内显示以及AIDA64 - 少数派 前往通义路的路 - 少数派 太好看了,媲美Sun的个人导航页,NAS部署星云门户 - 少数派 乌黑嘴唇“一键检测”上线了 - 少数派 派早报:Claude AI 接入多个创意软件生态、FILCO 生产方接手品牌等 - 少数派 【更新】BearCLI、Claude 连接器与 MCP 服务器 - 少数派 记了上千条流水,还是看不懂财务?我做了一个让 AI 读懂账本的工作台 - 少数派 MINI R56 升级原厂 Sport 模式 - 少数派 新玩意 | 一棵柠檬树(仿真版) - 少数派 Momenta的“物理AI”野望,需迈过“含摩量”这道关 - 少数派 网页直接投屏控制手机!NAS一键部署PandaScrcpy,流畅丝滑可远程。 - 少数派 众测|邀你一同探索随身 AI 硬件入口 YoooClaw C·ONE - 少数派 2050大会:分享时间是真诚 参会记 - 少数派 iPad 赋能电影创作:国内首部宣纸手绘长片《燃比娃》的幕后故事 - 少数派 AI的审美:我用 8 个大模型给 100 张旅行照片打分 - 少数派 普通人如何破圈?去参加一个本地协会 - 少数派 把极空间的图标全换了,主题DIY全攻略打造你的专属NAS桌面 - 少数派 电子便签墙,帮你实现便签自由 - 少数派 我如何用三个 CLI 工具取代文档创建需求 - 少数派 原来真的有人可以玩一辈子 - 少数派 社区速递 139 | 派友热议三月买了啥、复古单反尼康 Df 体验 - 少数派 06 作品的赏析与评价 - 少数派 TDS REVIEW|索尼 WF-1000XM6 降噪真无线耳机体验 - 少数派 35.98万起售的第二代腾势D9,我看重的不是堆料,而是不凑合 - 少数派 鼠须管 Squirrel 皮肤配置指北 - 少数派 从watch ultra2换到redmi watch6 - 少数派 派早报:阿里巴巴发布视频生成模型 HappyHorse 1.0 等 - 少数派 别迷信1M - 少数派 家人们天塌了!网盘“大封杀”,多个渠道多条路,NAS部署PanHub - 少数派 AI与人勾心斗角!NAS一键部署AI狼人杀,假日休闲必备。 - 少数派 电商必备!Comfyui工作流批量生图插件,一次生成12张!支持Nano banana pro模型 - 少数派 Comfyui工作流配置Gpt-image-2模型教程,0.03/张 - 少数派 OpenClaw第三方APi怎么配置?可使用Gpt-image-2模型 - 少数派 会员社区话题精选 Ep. 103 - 少数派
把照片回忆放在桌面:文字是最美的标签 - 少数派
2023-11-17 · via 少数派

入选 App Store 的本周编辑推荐

在上周,「识图 App」入选了 App Store 的本周编辑推荐,真好啊!感谢 App Store 官方给这款小工具的认可。

App Store 的本周编辑推荐

新版更新:把温馨回忆放在桌面

在上一篇介绍「识图 App」的文章里,尝试解决我们日常在使用 iOS 系统相簿和照片里面的最高频的场景,如何快速地找到照片,通过文字、时间、地点的不同组合可以精确地定位到我们想找的那张照片,或分享给朋友、或收藏起来:
 

但是,除了用文字去搜索之外,我们还怎么能发掘我们照片里的宝藏呢?相信我们大家都拍了许多的照片,有那些美美的自拍照,有和恋人当时牵手的摸样,有和家人在一起的温馨瞬间,有曾到过另一座城市的随手抓拍,有猫猫狗狗的呆呆萌萌,甚至还有那些回不去的时光。如果,我们能把相框放在手机桌面,每次点亮屏幕,都能看到那些差点被遗忘的老照片,或许能给我们带来一点点温暖,让回忆的阳光洒到今天。

如果只是桌面相框,iOS 系统自带的 ”回忆 Widget“ 就能满足需求,但是只是照片,我们常常会忘了是在哪里拍的,在什么时候拍的,甚至忘记了照片里的内容。而文字,是照片最美的标签,如果在展示照片的同时,也能自动配上文字,会不会更有温度呢,更感人呢。所以「识图 」尝试给图片配上最优美的文字,并支持在桌面添加小组件,就像这样:

如果您的手机升级到了 iOS 17,也可以添加「识图 」锁屏小组件。大箭同学有个闲置的 iPhone 手机,他用「识图 Widget 」把它改造成了一个电子相框:

配文:照片的最美标签

我们想给照片配上最优美的文字,希望「识图 」能看懂照片的内容,能用文字把照片的内容进行总结、提炼和修饰,希望那些文字能打动人心,能给你的照片打上最美的标签。

给宠物配文

这只可爱的狗狗是宋老师家的,名字叫 Hard,别看他照片里很是乖巧,拆家的时候能把宋老师气的双手发抖。这两张照片是上周六宋老师带他踏秋时候拍的,第一张照片配文 “笑逐颜开” 用来形容狗狗的表情确实令人惊艳,因为通常这个词用来形容人的开心。而第二张照片的配文更是绝妙,一个 “傲” 字把狗狗的状态准确刻画了出来,而 “秋叶黄” 也抓到了季节。

给事件配文

今年五月,妹妹结婚,照片分别拍摄于婚礼现场和新娘子的婚房。「识图 」从上千张的照片中推荐了这两张,我们看第一张的配文 “花香萦绕的婚礼现场”,AI 大模型确实正确地识别出来了场所是 “婚礼现场”,而且能营造出欢喜氛围用 "花香萦绕"。再看第二个配文"闺阁佳人共庆瑞祥",依然准确描述了是女孩子的房间是 “闺阁”,新娘子和伴娘们是 “佳人”,而“瑞祥”也恰当好处的表达了婚礼的祝福。

风景与人物

对于风景和人物照片,「识图 」同样体现出来了强大的图片内容识别和文字生成能力。它即能够识别出来第一张照片拍摄的地点是海边由 "赏海景",也能分辨出来花朵的颜色由 "橙黄橘绿"。如果你喜欢识图的配文,可以点击 "分享" 按钮,方便分享给朋友或者自己收藏。如果想找这张照片的原图,可点击 "个人收藏" 按钮,之后便可到手机的 “个人收藏” 相簿方便地找到原图。

我们如何实现配文功能

隐私问题

要实现根据照片的内容来生成优美的文字,目前的技术在手机端纯离线去做,还几乎不可能完成。因为要让图生文的 AI 大模型跑在手机上无论对手机硬件还是模型本身都是不小的挑战。纯离线方案行不通的话,我们就想尝试半离线的方案,一部分在手机上做,一部分在云端做。

值得明确说明的是,「识图 」十分尊重用户的隐私,在任何情况下都不会把用户的照片上传到云端,这也是我们实现照片配文(图生文)要遵循的基本原则:

不上传照片到云端

把大象放进冰箱

要把大象放进冰箱,拢共分为三步:

1、通过「识图 App」本地的推荐算法找到最值得回味的照片回忆;

2、在本地通过大模型计算照片的图片特征(image embeddings),并上传到云端;

3、云端的大模型根据图片的特征,生成照片的配文(文字);

提取图片特征

「识图 App」在手机端使用 image encoder 离线计算图片特征。从 OpenAI 开源的 CLIP 项目中,我们把视觉侧的基于 Transformer 架构的 ViT-B/16 的 imager encoder 单独拆分了出来,嵌入到了「识图 App」的安装包里面,size 大概是 150M 左右。对于想进行图生文操作的照片,在手机侧本地「识图」经过 ViT-B/16 image encoder 的计算,计算这张图片的特征向量(image features)。

图片的特征向量(image features)是一个 (1, 196, 768) 三维数组,如示例:

# Image Features(1*196*768)
[
  [
    [-0.7495, 0.2676, ..., -0.5010],
    [-0.3372, 0.2209, ..., -0.4490],
    [-0.7695, 0.1975, ..., -0.8037],
    ...,
    [-0.2617, -0.1320, ..., -0.5288],
    [-0.6738, 0.0533, ..., -0.7158],
    [-0.6689, 0.0749, ..., -1.1162]
  ]
]

识图只会把计算过的图片的特征向量上传到云端的服务器,借由大模型的能力来生成和图片内容想符合的文字。图片特征向量的计算过程如下(x1, x2 表示图片的尺寸,y 表示图片的颜色模式):

# 图片预处理
img = Image.open(f"{image_path}/{image_name}").resize((x1, x2)).convert(y)
# 调用 image encoder 生成特征向量
img_features = image_ml.predict({'image': img})

通过上传图片的特征向量,而不是上传原图,充分保护了用户的隐私。因为通过图片的特征向量是无法还原出原图的。

生成文字

当「识图 App」把待生成文字的照片的图片特征向量上传到云端之后,面临的下一个任务是如何把矩阵表示的图片特征转换成文字。最终影响我们的技术方案的选择包含以下原则:

  • 此架构的输入不需要图片原图,可以通过图片的特征向量即可生成文字;
  • 此架构的输出文字能够尽量全面、尽量从多维度客观描述图片的内容;
  • 在图生文效果可接受的范围内,对 CPU/GPU 计算资源尽可能少;

在一众的图生文技术架构中, 比如  Flamingo、BLIP、 BLIP-2、MiniGPT-4和LENS等等。经过数次技术调研、实验和验证,我们最终采用了目前在大型多模态模型(LMM)的 11 个基准上达到 SOTA 的 LLaVA 架构(Large Language and Vision Assistant),一个能够进行视觉和语言多模态转换的模型。有兴趣的童鞋,这里是论文链接:

LLaVA 架构在自然指令遵循和视觉推理能力方面表现出了令人印象深刻的结果。同时也适用于不同的下游任务和领域,包括区域级和像素级理解、生物医学助理、图像生成、对抗性研究。如下图,在 LLaVA 的架构中,Z_v 是我们通过识图客户端的 vision encoder 计算出的图片特征向量,经过一个可训练的投影矩阵 W 将 Z_v 转换为语言嵌入标记 H_v,这些标记具有与语言模型中的单词嵌入空间相同的维度。

LLaVA network architecture

自训练大模型

在 Language Model 这一层我们没有找到合适的大模型,受限于为了满足「识图 App」特殊的运行时需求和可生成更简洁、优美的配文,我们不得不自己训练了「识图 」专属 LLM 大模型:XSmart-bear7b,用来把图片的特征向量最终生成生动的文字。这只可爱的白熊是我们自训练大模型的图标(也是由大模型生成)。

XSmart-bear7b

告一段落

随着「识图  App」发布了第二个版本,基于照片的搜索和推荐可能稍微会稍微告一段落。让工具回归工具,让「识图 」更懂你的照片!