惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

宝玉的分享
宝玉的分享
Engineering at Meta
Engineering at Meta
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
博客园 - 聂微东
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Last Week in AI
Last Week in AI
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 三生石上(FineUI控件)
T
Tailwind CSS Blog
Apple Machine Learning Research
Apple Machine Learning Research
Hugging Face - Blog
Hugging Face - Blog
爱范儿
爱范儿
博客园 - 司徒正美
人人都是产品经理
人人都是产品经理
Jina AI
Jina AI
博客园 - 叶小钗
雷峰网
雷峰网
罗磊的独立博客
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - Franky
WordPress大学
WordPress大学
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
阮一峰的网络日志
阮一峰的网络日志
量子位

程序员

V2EX 看到讨论"跨域"的帖子,那个她好像回来了 codex 今天真的是不稳定呀。 火山方舟 Coding Plan 慎买 刚问了大家 openclaw 和 hermes 在什么机器上面玩,求推荐一个机器 GPT-image-2 生成 AI 图片防伪有感 codex pro 5 小时限制已经严重缩水 逆天 Antigravity 动态 JSON 序列化对强类型语言很难吗? 自建了 GPT Coding Plan,遇到了定价问题,请教大家 大家都是在什么设备上玩 openclaw 以及 hermes 的呀? 软考还有一个月就考试了,你们学习了吗? 大伙用 AI 会考虑在 user scope 的 CLAUDE.md/AGENTS.md 里交代 AI 说中文吗 我发现程序员这个群体很大部分其实挺抠的 最近使用 cc 总会莫名其妙的返工, codex 不会 目前体验最好的远程 vibe 工具 想知道大佬们抓包遇到 ssl pinning 都是咋优雅的 解决的? 工业软件的大佬们是怎么 vibe coding 的 最近 chrome 是不是有 bug 啊,一搜索就卡住 分布式异步系统在 vibe coding 下的困境 PHP Native AOT 编译器,支持将 PHP 代码编译为可执行文件,运算性能提高 150 倍 没想到 2026 年,还要浪费大量时间在跨域问题上 DeepSeek V4 这周会出吗? 中转站正式试营 欢迎试用 不掺不假 小米 mimo 升级 v2.5,并且重置了额度 Jenkins, SCM 轮询完全不工作是啥问题啊 赛博斗蛐蛐, AI 模型的简单对比(白嫖版) 使用中转站要擦亮眼睛!不说别的,倍率计算 充值好乱。 买了火山的 Coding Plan 测试得出计费模式 给我的 AI 生成了简历和状态卡, 大家帮忙看下 Ta 能找到啥样的
做了个能用自然语言管理文件的 Android App,聊聊端侧 CLIP ...
jhspider · 2026-05-13 · via 程序员

用了快十年 ES 文件浏览器,今年彻底受不了了。打开就是信息流,操作三步弹一次广告,烂到 Play Store 都下架了。当然 Play Store 上文件管理器不少,但翻了一圈发现:能用的都只是"文件浏览器",没有一个真正把 AI 能力融进文件管理场景的。

所以我自己写了一个:素流,主打跟我前一个素系列产品素言一样,杜绝广告和追踪,简洁、高效、好用。

它首先是一个干净、快、功能完整的文件管理器(多标签页、跨目录剪贴板、压缩文件免解压直开、ePub/PDF 内置阅读、零广告零追踪,基础版免费),但核心差异化在于:端侧 AI 语义理解 + Agent 对话式操作——用自然语言搜图、智能识别近重复文件、对话式批量整理,这些是传统文件管理器做不到的事。

举个例子:你说"把下载目录里所有发票截图和 PDF ,按日期重命名后移到 Finance 文件夹",它会告诉你找到了哪些文件、打算怎么做,你确认后才执行。

技术上比较有意思的几个点:

  1. 端侧语义检索的模型选型:MobileCLIP + 翻译小模型 vs ChineseCLIP/多语言 CLIP

    这个选型纠结了挺久。直觉上用 ChineseCLIP 或者多语言 CLIP 一步到位最省事,但实际跑下来发现不行:

    • ChineseCLIP / multilingual-CLIP 模型体积大,量化后精度损失明显,而且视觉编码能力比 OpenAI 原版 CLIP 系列弱一截
    • MobileCLIP 是 Apple Research 开源的移动端优化 CLIP 模型( CVPR 2024 ,模型本身平台无关,ONNX 导出后 Android 直接跑),视觉编码质量高、推理快、模型小,但只支持英文文本编码

    最终方案是:MobileCLIP 做视觉编码 + Marian 翻译小模型把中文 query 翻成英文再做文本编码。两个模型加起来的体积比一个 ChineseCLIP 还小,而且视觉理解能力更强。翻译模型走的是 Helsinki-NLP 的 Marian ,int8 量化后 encoder + decoder 合计约 140 MB ,对比 ChineseCLIP 动辄 500MB+ 的体积仍然有优势,而且推理延迟在端侧可接受。

    等于用"小模型组合"打败了"大一统模型",在端侧资源受限的场景下这个思路挺有效的。

  2. Agent 架构——云端 LLM 只负责意图理解和步骤规划( BYOK 模式,用户自带 API Key ),所有文件操作在端侧执行。AI 知道你想做什么,但不知道你文件里有什么。

  3. 相似图片检测——基于向量距离做近重复分组,不是简单的 hash 比对,能识别截图裁剪、压缩后的"几乎一样"的图。

放几张截图感受下:

首页 语义搜索
Agent 智能清理

完整演示视频(功能比较多):B 站链接


官网:

下载:


想问问各位 V 友:

  1. 你们现在用什么文件管理器?还是直接用系统自带的?
  2. "用自然语言管理文件"这个需求,你们觉得是真需求还是伪需求?

独立开发,一个人撸的,欢迎使用和反馈。