惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Martin Fowler
Martin Fowler
博客园 - 三生石上(FineUI控件)
WordPress大学
WordPress大学
博客园_首页
宝玉的分享
宝玉的分享
S
SegmentFault 最新的问题
Jina AI
Jina AI
Hugging Face - Blog
Hugging Face - Blog
V
Visual Studio Blog
美团技术团队
IT之家
IT之家
罗磊的独立博客
Blog — PlanetScale
Blog — PlanetScale
Google DeepMind News
Google DeepMind News
月光博客
月光博客
Microsoft Azure Blog
Microsoft Azure Blog
H
Help Net Security
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Last Week in AI
Last Week in AI
博客园 - 叶小钗
M
MIT News - Artificial intelligence
B
Blog RSS Feed
有赞技术团队
有赞技术团队
Y
Y Combinator Blog

博客园_首页

Plist 二进制格式 Milvus 和 PGVector,哪个更好? OpenClaw 已过时?在 VS Code 中运行 Hermes Agent! 第30篇文章:一个大三计科生的自白 Manim如何在数学公式中完美显示中文? Docker 部署 RocketMQ 5 并发编程核心概念辨析 C#事务处理最佳实践:别再让“主表存了、明细丢了”的破事发生 CLI 是什么?为什么大厂突然集体卷命令行? 【从0到1构建一个ClaudeAgent】协作-自主Agent UIImageView 设置图片不生效的原因排查 最小二乘问题详解20:无先验约束下的增量式SFM自由网平差 痞子衡嵌入式:大话双核i.MXRT1180之XIP应用里借助MU实现可靠Flash IAP的方法 AI Chat 封装, SemanticKerne.AiProvider.Unified 已发布 Windows下右键编辑js文件无法打开记事本——在注册表中使用环境变量 在后台服务中使用 Scoped 服务,为什么总是报错? H200 安装驱动并使用sglang启动模型 wireshark 抓包Trap上报告警内容 我用 AI 辅助开发了一系列小工具(2):图片压缩工具 [A Primer On MC and CC] 2.1 Memory Consistency 1 - 指令重排序和 SC 模型 Oracle数据库SCN推进技术详解与实践指南 玩转控件:封装个带图片的Label控件 Claude Code 4.7 真正该升级的不是模型,而是你的工作流 前端小白一句话,AI 帮我做了个颜值拉满的桌面媒体播放器。当代码不再是门槛,一句话编程就是现实。 5. WorkBuddy: 小龙虾的灵魂三件套,让你的小龙虾不只是工具 SQLite 分片方案实战:三种分片策略的深度对比 告别简陋 UI!一款基于 Fluent Design 和基于 WinUI 的开源免费、现代化的 Avalonia UI 控件库 关于二进制排列组合枚举的总结 AI开发-python-LangGraph框架(3-27-LangGraph从零实现大模型智能决策工作流) ElasticSearch主分片和副本分片概念详解
我把市面上 UI 自动化 Skill 全踩坑一遍后,自己写了个真正能...
测神 · 2026-04-23 · via 博客园_首页

用过市面上几乎所有 UI 自动化 Skill,我只说一句大实话:一个能打的都没有。

有的顶着超高热度,吹得天花乱坠,实际用起来各种报错、乱触发、逻辑跑偏;有的流程繁琐到崩溃,要配 JSON、打快照、填一堆参数,还没开始干活心态先崩了。折腾一圈下来,我只有一个感觉:就没有一个简单、干净、稳定的。

既然没有满意的,那就自己造。

熟悉我的朋友都知道,我迭代了很多年的seliky(没看过的朋友可以翻我前面博客),这次我直接在 seliky 的基础上,做了一个极简 UI 自动化 Skill,已经上传到 workbuddy,名字就叫:ui 自动化

它的逻辑简单到极致:你用自然语言说要做什么,它就直接帮你在浏览器里执行。

打开、点击、输入,一句话搞定,不用配置、不用写复杂规则、不用生成乱七八糟的中间文件。

在我心里,这才是 UI 自动化该有的样子:人说人话,工具做事。

请在workbuddy或主流skillhub平台自行体验,不谢不谢。

image

看一下跑完的案例,简直 言出法随。

它真的在浏览器上进行对应操作,我上传不了mp4,大家自行脑补。

请看图:

image

这是另外一个长流程的,只要自己写清楚,操作也是没问题。

image


当然,它也不是完美形态,我也不藏着:

  • 在结构特别复杂的页面上,纯自然语言描述会力不从心,描述再详细也不如定位精准。这种场景下,直接给 xpath,一步到位
  • 其实终极方案也有:接入视觉大模型,靠看图理解界面。但我试过,太烧 token、又慢又耗时,性价比极低,所以暂时没加,保持轻量稳定最重要。

一定会往视觉方向发展的,AI手机不也是这样么,其它形态做ui自动化的,多是小可爱。


给大家两个小 tips:

  1. 只有第一次安装会慢一点,装好之后秒启动,不会重复安装。
  2. 目前这个 skill 没有版权限制,趁我心情好,随便拿去二开、魔改、自用都行

如果你也受够了那些繁琐难用、花里胡哨的 UI 自动化工具,真心建议你试试这个。

简单、稳定、不折腾,才是效率工具该有的样子嘛。