惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
DataBreaches.Net
有赞技术团队
有赞技术团队
Jina AI
Jina AI
H
Help Net Security
D
Docker
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Blog — PlanetScale
Blog — PlanetScale
Hugging Face - Blog
Hugging Face - Blog
罗磊的独立博客
MyScale Blog
MyScale Blog
N
Netflix TechBlog - Medium
B
Blog RSS Feed
Martin Fowler
Martin Fowler
WordPress大学
WordPress大学
T
The Blog of Author Tim Ferriss
U
Unit 42
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
MongoDB | Blog
MongoDB | Blog
美团技术团队
M
MIT News - Artificial intelligence
阮一峰的网络日志
阮一峰的网络日志
博客园 - 司徒正美
Microsoft Security Blog
Microsoft Security Blog
IT之家
IT之家

博客园 - 狂师

AI越来越强了,为什么测试人反而越来越累!(为打工人发声) AI 都会写代码了,还要不要学传统编程了? (强烈建议阅读) BrowserAct,给AI Agent配一个真实浏览器,从安装到实战 2026 性能测试工具大盘点:13 款主流压测工具,测试工程师必备! 最近火爆出圈的,FDE 到底是个什么岗位? 2026年AI编程工具大全,33个主流工具一次看懂 为什么都说要做自动化测试,落地却这么难!(附自动化测试的四种死法) AI 测试工具收藏了几十篇,一篇没看?我建了个学习圈子,专治这种... 别只会用 Postman 了,这 15 款接口测试工具你可能还不知道 2026年9月大模型最新排行榜,30款主流AI大模型,第一名有点意外... 公司从零开始推自动化测试,如何落地? AI 测试提效 | 别搞万能 Skill,推荐5 个 Agent Skill 串起 UI 自动化执行到报告生成全流程 为什么团队用了 AI 之后,测试质量反而下降了! 阿里开源:skill-up,一款Agent Skill 评测工具! 整理了一份 DeepSeek Harness 必备插件清单! 我的免费 AI 测试开发学习路线,开源了! UI自动化测试提效必备Skill!一套CI流水线编排 Skill 可以直接抄了... AI 测试丨一句指令生成测试报告,带失败截图、操作录屏、Trace、日志,这套 Skill 思路可以直接抄... AI 测试提效丨从失败排查到自动修复,分享我的Playwright+Skill UI自动化测试失败诊断提效方案! AI 测试 | 把 UI 自动化测试执行固化成五步流程,这套 AI Skill 思路可以直接抄 智谱GLM-5.3+ZCode Agent,真实项目第一手实测! 从 0 到 1,DeepSeek Harness 保姆级安装与使用教程! 一个测试负责人的崩溃:该做的都做了,线上还是炸了 Agent质量怎么评? 想做测试工具却不会写代码?怎么办? 用AI做自动化测试,哪些是真不行,哪些是你不会用? 天天用 Claude Code/Codex,你知道它实际发给模型什么吗?被这开源工具扒光了... 推荐一款开源 Skill:让 AI Agent 给你做一份"能改"的 PPT,支持 上千套模板! AI 测试提效 | UI 自动化测不出样式 bug?分享 ui-visual-assert + Skill 视觉断言与多浏览器适配方案 公司不给你配 AI,你会自己掏钱吗?
用自然语言控制手机,一条命令让 AI 帮你操作 Android 和 iOS...
狂师 · 2026-07-28 · via 博客园 - 狂师

你有没有想过——对着手机说一句话,它就自己操作了?

"打开设置,把深色模式关掉。"

"打开微信,给张三发一条消息说周五会议改到下午三点。"

"打开美团,帮我找附近评分最高的火锅店。"

然后手机真的自己动了。自己点、自己滑、自己输入。

这不是科幻。这是 mobilerun 正在做的事情。

它是什么?

一句话介绍:它是一款用自然语言控制 Android 和 iOS 设备的开源 Agent 框架。

MIT 开源,Python 写的,目前在 GitHub 上接近 9000 star,900+ fork。

你只需要几步:

uv tool install mobilerun  # 安装Mobilerun
# 或
uv pip install mobilerun  

mobilerun setup      # 安装 Portal 到手机
mobilerun configure  # 配置你的 LLM
mobilerun run "打开设置,关闭深色模式"  # 执行

然后你的手机就开始自己操作了。

不需要写一行脚本,不需要 XPath,不需要定位元素。

你只需要说人话。

为什么它能冲到 9000 star?

我分析下来,三个原因。

第一,它是 Agent,不是工具。

这是我跟同类项目最大的区别判断。

之前我介绍过 Callstack 的 agent-device——它的定位是"给 Codex / Claude Code 当手脚",你得有一个 AI Agent 来驱动它。

mobilerun 不一样。它自己就是 Agent。

你不用装 Codex,不用开 Claude Code。给它一个 prompt,它自己看屏幕、理解界面、规划步骤、执行操作。

换句话说——agent-device 需要你来当大脑,mobilerun 自带大脑。

门槛直接砍掉一半。

第二,LLM agnostic——什么模型都能接。

OpenAI、Anthropic、Gemini、DeepSeek、Ollama、OpenRouter——主流模型全支持。

这意味着什么?

你可以用 DeepSeek 白嫖,也可以用 Ollama 跑本地模型保护隐私。

不想折腾 API 的,DeepSeek 充几块钱就能跑。国内用户非常友好。

第三,Portal 机制——这才是真正的巧妙设计。

传统手机自动化依赖 USB 调试 + ADB 命令,你得插着线,开着调试模式。

mobilerun 不一样。它在你手机上装一个 Portal App,通过无障碍服务来控制。

这意味着什么?

手机不需要插线,不需要在你手边——只要 Portal 在跑,就能远程控制。

这就直接打开了 Cloud 模式的想象力。

两个最值得关注的功能

第一个,reasoning 模式。

简单的任务,mobilerun 直接执行。

但复杂任务呢?比如"帮我订下周去上海的机票"——搜索、比价、填信息、支付,十几步操作。

mobilerun 有个 --reasoning 模式,启动后用"管理者-执行者"架构:管理者负责规划,执行者逐步完成,管理者实时纠偏。

mobilerun run "帮我找联系人张三,给他发邮件" --reasoning

这才是解决复杂多步任务的设计。

第二个,vision 模式。

有些 App 没做无障碍适配,界面元素全是"button"、"view",Agent 根本分不清谁是谁。

mobilerun 的 --vision 模式会把截图直接发给 LLM,让它像人一样"看"屏幕。

还有 --vision-only 模式——完全不依赖无障碍树,纯靠视觉理解。

对那些没做 accessibility 的 App 来说,这是救命稻草。

但别急着吹,三个现实问题

第一,效果取决于模型。

LLM agnostic 的另一面是——模型选不好,体验就是灾难。

同样一句"帮我订机票",顶尖模型和免费模型的执行效果可能天差地别。

第二,稳定性还得打磨。

自然语言操控手机,本质上是概率性的。同一个任务,跑十次可能八次成功两次失败。

对于个人效率、探索性场景——没问题。对于生产环境的关键路径——你还不敢完全信任它。

第三,安全风险。

让 AI 直接操作你的手机——读你的消息、翻你的相册、操作你的支付——这件事本身就有风险。

Portal 的权限怎么管控?Agent 的操作边界在哪?这些目前还没有标准答案。

我的观点

mobilerun 它代表了一个方向——手机的交互方式正在被重新定义。

过去 15 年,我们操作手机的方式没变过:用手指点屏幕。

mobilerun 让我看到另一种可能:你说话,手机自己动。

但现在还处在早期。稳定性、安全性、准确性都有提升空间。但趋势已经出来了。

从"人适应机器"到"机器适应人"——这个方向不会变。

如果你对 AI + 移动端感兴趣,强烈建议去 GitHub 跑一遍 Demo。

不用写代码,三行命令,你的手机就开始自己动了。

那种感觉,真的很赛博朋克。

GitHub 项目地址:github.com/droidrun/mobilerun


以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~ 谢谢你看我的文章,我们,下次再见。