惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

IT之家
IT之家
Y
Y Combinator Blog
月光博客
月光博客
Blog — PlanetScale
Blog — PlanetScale
GbyAI
GbyAI
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
博客园 - 三生石上(FineUI控件)
S
SegmentFault 最新的问题
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
美团技术团队
雷峰网
雷峰网
酷 壳 – CoolShell
酷 壳 – CoolShell
Last Week in AI
Last Week in AI
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
有赞技术团队
有赞技术团队
博客园 - 司徒正美
V
Visual Studio Blog
小众软件
小众软件
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
T
Tailwind CSS Blog
Apple Machine Learning Research
Apple Machine Learning Research
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
A
About on SuperTechFans
The Cloudflare Blog

V2EX - 技术

Local-first 软件收录站 从 X 上搬运来的白嫖 GPT Plus 教程 阿里云百炼 Coding Plan Pro 套餐 新增当日 token 限制 大家的 Claude 弹了 kyc 嘛 现在 Google 的 Gemini 和 AI 模式降智的厉害啊 用的 TAG 家的 T, ip 跳变是否影响使用 claude 同一 apple 账户能给不同 claude 账号充值么 做了个 Go 的 MCP Server 框架,一行代码把 Gin API 接入 AI 请教各位,想回归技术,如何系统学习 Agent? OpenAI GPT-IMAGE-2 提示词合集 你是说, claude opus4.6 写代码的能力不如 gpt5.4? 关于智谱 Max 套餐要不要升级续费呢? App → CLI → App ? Github 账号被 404 了,现在没法恢复,求各位大佬指点 cursor 的次数套餐以后应该都用不了新模型了 openrouter 使用国外模型 买了咸鱼低价 Gemini pro,账号差点被盗。突然发现国内诈骗成本为零 Gemini 手机版客户端登陆总是在此国家/地区无法使用 gemini 感觉 gpt 这些低价渠道要爆了 claude code 和 codex 在 vibe coding 还有质的区别吗? 阿里 Coding Plan 一天三变, Lite 版本到期不能续费了 RAG 难以让人满意啊 2026 年了,这个世界还存在互联网精神🥹 两个账号阵亡,尼区 Claude Pro 订阅 分享下最近低价 GPT Codex 的来源(源头) OpenAI 发布 Codex 重大更新:支持自动操作电脑与长期任务自动化 使用 claude 从 0 开始开发一个校友会系统可行吗 同一个 appleid 可以给不同 chatGPT 账号订阅 plus 吗? 自动驾驶项目开发建议 终于, 降智几天之后, opus4.7 出来了
做了个能用自然语言管理文件的 Android App,聊聊端侧 CLIP ...
jhspider · 2026-05-13 · via V2EX - 技术

用了快十年 ES 文件浏览器,今年彻底受不了了。打开就是信息流,操作三步弹一次广告,烂到 Play Store 都下架了。当然 Play Store 上文件管理器不少,但翻了一圈发现:能用的都只是"文件浏览器",没有一个真正把 AI 能力融进文件管理场景的。

所以我自己写了一个:素流,主打跟我前一个素系列产品素言一样,杜绝广告和追踪,简洁、高效、好用。

它首先是一个干净、快、功能完整的文件管理器(多标签页、跨目录剪贴板、压缩文件免解压直开、ePub/PDF 内置阅读、零广告零追踪,基础版免费),但核心差异化在于:端侧 AI 语义理解 + Agent 对话式操作——用自然语言搜图、智能识别近重复文件、对话式批量整理,这些是传统文件管理器做不到的事。

举个例子:你说"把下载目录里所有发票截图和 PDF ,按日期重命名后移到 Finance 文件夹",它会告诉你找到了哪些文件、打算怎么做,你确认后才执行。

技术上比较有意思的几个点:

  1. 端侧语义检索的模型选型:MobileCLIP + 翻译小模型 vs ChineseCLIP/多语言 CLIP

    这个选型纠结了挺久。直觉上用 ChineseCLIP 或者多语言 CLIP 一步到位最省事,但实际跑下来发现不行:

    • ChineseCLIP / multilingual-CLIP 模型体积大,量化后精度损失明显,而且视觉编码能力比 OpenAI 原版 CLIP 系列弱一截
    • MobileCLIP 是 Apple Research 开源的移动端优化 CLIP 模型( CVPR 2024 ,模型本身平台无关,ONNX 导出后 Android 直接跑),视觉编码质量高、推理快、模型小,但只支持英文文本编码

    最终方案是:MobileCLIP 做视觉编码 + Marian 翻译小模型把中文 query 翻成英文再做文本编码。两个模型加起来的体积比一个 ChineseCLIP 还小,而且视觉理解能力更强。翻译模型走的是 Helsinki-NLP 的 Marian ,int8 量化后 encoder + decoder 合计约 140 MB ,对比 ChineseCLIP 动辄 500MB+ 的体积仍然有优势,而且推理延迟在端侧可接受。

    等于用"小模型组合"打败了"大一统模型",在端侧资源受限的场景下这个思路挺有效的。

  2. Agent 架构——云端 LLM 只负责意图理解和步骤规划( BYOK 模式,用户自带 API Key ),所有文件操作在端侧执行。AI 知道你想做什么,但不知道你文件里有什么。

  3. 相似图片检测——基于向量距离做近重复分组,不是简单的 hash 比对,能识别截图裁剪、压缩后的"几乎一样"的图。

放几张截图感受下:

首页 语义搜索
Agent 智能清理

完整演示视频(功能比较多):B 站链接


官网:

下载:


想问问各位 V 友:

  1. 你们现在用什么文件管理器?还是直接用系统自带的?
  2. "用自然语言管理文件"这个需求,你们觉得是真需求还是伪需求?

独立开发,一个人撸的,欢迎使用和反馈。