惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Help Net Security
Help Net Security
U
Unit 42
T
Tailwind CSS Blog
Y
Y Combinator Blog
阮一峰的网络日志
阮一峰的网络日志
博客园_首页
云风的 BLOG
云风的 BLOG
博客园 - Franky
D
DataBreaches.Net
Last Week in AI
Last Week in AI
人人都是产品经理
人人都是产品经理
Cisco Talos Blog
Cisco Talos Blog
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
Blog — PlanetScale
Blog — PlanetScale
Know Your Adversary
Know Your Adversary
宝玉的分享
宝玉的分享
V
Visual Studio Blog
AWS News Blog
AWS News Blog
NISL@THU
NISL@THU
I
Intezer
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
P
Privacy International News Feed
T
Tor Project blog
S
Securelist
Microsoft Security Blog
Microsoft Security Blog
C
Cybersecurity and Infrastructure Security Agency CISA
Recorded Future
Recorded Future
C
Cisco Blogs
P
Palo Alto Networks Blog
Hacker News: Ask HN
Hacker News: Ask HN
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Recent Commits to openclaw:main
Recent Commits to openclaw:main
月光博客
月光博客
T
Threat Research - Cisco Blogs
N
News and Events Feed by Topic
AI
AI
Cyberwarzone
Cyberwarzone
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
MongoDB | Blog
MongoDB | Blog
Microsoft Azure Blog
Microsoft Azure Blog
Scott Helme
Scott Helme
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
Martin Fowler
Martin Fowler
量子位
L
LINUX DO - 热门话题
H
Heimdal Security Blog
GbyAI
GbyAI
P
Privacy & Cybersecurity Law Blog
博客园 - 【当耐特】

暗无天日

读:AI Agent 安全日志——从可见性与隐私的两难说起 - 暗无天日 读:AI Agent 生产化——一份从原型到上线的速查清单 - 暗无天日 AI写作的语言指纹——如何让文字不那么像机器 - 暗无天日 读:50 条 Claude Code 技巧——一个工程经理的六个月使用心得 读:AI 辅助开发为什么让 E2E 测试更有价值 - 暗无天日 读:在Emacs中使用Claude Code(Spacemacs适配版) - 暗无天日 Claude Code 背后的工程哲学——读 Agent Harness Engineering 读:Agent Harness Engineering——AI 智能体不只是模型,还有套件 - 暗无天日 读:Security-First CI/CD —— DevSecOps 自动化实践指南 TIL: 数字小键盘的小数点陷阱与行内算术求值 - 暗无天日 读:Immutability 不是万能药,它是一种权衡 - 暗无天日 Conducty:给 Claude Code 加上项目记忆和并行执行能力 - 暗无天日 读 — GitHub Trending 里的 Claude Code 技能包 读 — Prompt Caching 省钱指南 TIL: Emacs 中那些跟鼠标配合的冷门快捷键 - 暗无天日 读:Anvil——把 Emacs 变成 AI 的工具服务器 读:Emacs 代码折叠终极指南 - 暗无天日 读:Clojure 搭车客指南 - 暗无天日 git推送失败后恢复仓库损坏的完整记录 - 暗无天日 多智能体系统的两个有效模式——以及对 Claude Code 用户的启示 - 暗无天日 用 Org Babel 写 Literate 博文:扩展执行 + 定制导出 proced:Emacs 内置的进程查看器 - 暗无天日 从 proced 定制中学到的 Elisp 模式 读:让 Emacs proced 在 macOS 上显示 CPU 和内存 异步编程的函数着色税 - 暗无天日 链式调用的代价:JavaScript 和 Clojure 的共同教训 - 暗无天日 hyperfine:命令行基准测试工具 - 暗无天日 管道中的变量去哪了?——子 shell 作用域陷阱 - 暗无天日 开源包装器的信任陷阱:四个危险信号 - 暗无天日 程序员愿意为 AI 写文档,却不愿为同事写 - 暗无天日 mktemp: Shell 脚本中临时文件的安全陷阱与最佳实践 - 暗无天日 WSL9x —— 在 Windows 9x 里跑 Linux 内核 6.19 用 ox.el 做你想做的事 —— org-export 高级编程指南 读:Hot-wiring the Lisp Machine —— 用纯 Elisp 构建零依赖的 Org 静态站点生成器 Elisp 性能优化的六个实战教训 - 暗无天日 fcitx5 下 Emacs 无法切换输入法的排查 - 暗无天日 ERT 测试交互命令的三种方式 - 暗无天日 SEM Assistant: 当 Elisp 守护进程遇上 LLM 用 dmsg 给 Elisp 加上结构化调试日志 用 org-habit 追踪非每日习惯 - 暗无天日 Clojure X-Men:当编程语言特性变成超能力 - 暗无天日 TIL: 用 diff-hl 在 fringe 中显示 git 变更 读:llm-test —— 用 LLM agent 驱动 Emacs 测试 TIL: AI 时代的橡皮鸭调试 - 暗无天日 fcitx 启动后键盘输入卡顿的排查 - 暗无天日 TIL: 早期网页的图片热区导航 - 暗无天日 读 Seeing the Whole System 用 Emacs 自动生成每周链接推荐 - 暗无天日 读:ASCII control characters in my terminal 读 What to learn - 暗无天日 Lisp 的括号之痛——一个愚人节玩笑揭开的老伤疤 - 暗无天日 一本书该"线性读"还是"并行读" - 暗无天日 读 How to Monetize a Blog:一篇伪装成变现指南的讽刺文 Python Mock 第三方依赖的四种策略 - 暗无天日 Emacs Lisp 热重载实用指南 - 暗无天日 Prot 的 Emacs 配置哲学 - 暗无天日 TIL: 从直播对谈中学到的三个 Emacs 技巧 - 暗无天日 TIL: 自动使用项目虚拟环境的 Python - 暗无天日 TIL: 让 Help buffer 自动获得焦点 一条命令让本地开发用上 HTTPS —— slim 工具介绍 用 fsck 检查和修复 Linux 文件系统 排查Linux进程"卡死"实战:从strace到gdb全流程 - 暗无天日 PostgreSQL 索引:从基础到你可能不知道的高级用法 - 暗无天日 用 .pdbrc 自定义 Python 调试器 ANSI 转义码的标准化现状 - 暗无天日 终端程序的潜规则 - 暗无天日 PARA Org-mode 测试配置 - 暗无天日 AI越强越辣鸡?控制论说这是必然的 - 暗无天日 AI 越强越需要你盯着——反馈循环实操指南 - 暗无天日 你的AI代理正在偷你的密钥——四种你没想到的泄露通道 - 暗无天日 LLM 在 DevOps 中的三种角色 - 暗无天日 写作风格的反建议 - 暗无天日 反驳本质复杂性——Dan Luu 论为什么《没有银弹》错了 - 暗无天日 文件充满了危险——Dan Luu 谈文件系统的可靠性陷阱 - 暗无天日 AI 时代的 PARA 方法:用 Org-mode 和 AI 打造个人知识管理系统 Linux 数据去重学习笔记 - 暗无天日 创建跨平台 ZIP 文件的隐藏陷阱:Extra Field - 暗无天日 X11 Forwarding 排障指南 - 暗无天日 IP欺骗端口扫描:当别人冒充你去扫描别人 - 暗无天日 Linux 输入栈全景解析:从硬件按键到屏幕响应 - 暗无天日 Unix 系统中那些被埋没的配置开关——以 FontConfig 为例 - 暗无天日 在Linux上限制儿童使用电脑 - 暗无天日 GIF不仅仅是一种图片格式——用GIF流做些奇怪的事 - 暗无天日 Leiningen 学习笔记:Clojure 项目构建与管理从入门到实战配置 - 暗无天日 Google SRE Book 读书笔记 - 暗无天日 yes 管道 head 发生了什么 - 暗无天日 为什么 nohup 在 crontab 中不起作用 Bash中的Indirection与Nameref - 暗无天日 Linux PAM 简介 - 暗无天日 从Linux ISO文件启动计算机 - 暗无天日 用 Bash 打造一个Screen Locker 用GitHub Actions自动构建EGO博客 - 暗无天日 blocking I/O 的作用 - 暗无天日 mobileog 手机端同步提示Error:2 No such file 的解决方法 回收 WSL2 VHDX 文件占用空间 使用 org-mode columnview 生成任务列表 - 暗无天日 Emacs 作为 MPD 客户端 - 暗无天日 移动文件路径却不破坏org file link的方法 - 暗无天日 如何合理的导出help link 成HTML - 暗无天日 笑话理解之Biology - 暗无天日
browser-harness:让 AI 直接接管你的浏览器 - 暗无天日
2026-04-30 · via 暗无天日

browser-harness1 是一个约 1200 行 Python 代码的开源项目,让 AI 通过 Chrome DevTools Protocol 直接控制你的 Chrome 浏览器。它跟 Selenium、Playwright 的根本区别在于:AI 不只是调用预定义的函数,还能自己写新函数、自己修 bug。

架构:一条 WebSocket 通道

Chrome 浏览器 → CDP WebSocket → daemon.py → Unix Socket → run.py(执行 Python 代码)

整个系统由三部分组成:

  1. daemon.py (约 260 行):通过 WebSocket 连接 Chrome 的 CDP 接口,在本地开一个 Unix socket( /tmp/bu-default.sock )作为中继。所有请求都是一行 JSON,响应也是一行 JSON
  2. helpers.py (约 250 行):提供给 AI 调用的工具函数——导航、截图、点击、输入、标签页管理等。AI 可以直接编辑这个文件
  3. run.py (约 70 行):入口,启动 daemon,然后执行你传入的 Python 代码。helpers.py 里的函数已自动导入

没有框架,没有中间层,没有 retry 逻辑。AI 拿到的是原始的 CDP 能力。

安装

前提条件 :Python 3.10+,uv2,Chrome 或 Chromium 浏览器。

git clone https://github.com/browser-use/browser-harness
cd browser-harness
uv sync
uv tool install -e .
command -v browser-harness

uv tool install -e . 把 browser-harness 安装为全局命令,同时指向仓库源码。这样 AI 编辑了 helpers.py 后,下次调用立刻生效,不需要重新安装。

如果你用的是 Claude Code,可以把 SKILL.md 注册到全局配置中:

浏览器配置:启用远程调试

browser-harness 需要连接你已经打开的 Chrome,而不是自己启动一个新浏览器。这要求 Chrome 开启远程调试端口。

一次性设置 :在 Chrome 地址栏输入 chrome://inspect/#remote-debugging ,勾选 Discover network targets 复选框,点击 Allow 确认。这个设置对当前 Chrome 配置文件永久生效——以后每次打开 Chrome 都会自动启用调试端口,不需要重复操作。

Linux 用户如果找不到 DevToolsActivePort 文件,可以手动启动 Chrome 并指定调试端口:

google-chrome --remote-debugging-port=9222 &

验证连接

browser-harness -c "print(page_info())"
{'url': 'chrome://newtab/', 'title': '新标签页', 'w': 1920, 'h': 1080, 'sx': 0, 'sy': 0, 'pw': 1920, 'ph': 1080}

看到类似输出说明连接成功。 page_info() 返回当前标签页的 URL、标题、视口尺寸和滚动位置。

基本操作

browser-harness 的使用方式是传入一段 Python 代码,helpers.py 里的函数已自动导入。

打开新标签页并导航

new_tab("https://github.com/browser-use/browser-harness")
wait_for_load()
print(page_info())

注意第一个操作用 new_tab() 而不是 goto_url()goto_url() 会在当前活跃标签页中导航,会覆盖你正在看的页面。 new_tab() 创建新标签页并自动切换过去。

截图查看页面

capture_screenshot("/tmp/shot.png")

截图是 browser-harness 最核心的操作方式。AI 通过截图理解页面状态、找到点击目标、验证操作结果。整个工作流是:截图 → 看图 → 操作 → 再截图确认。

点击和输入

click_at_xy(500, 300)

type_text("browser automation")

press_key("Enter")

坐标点击走的是 Chrome 合成器层面的 Input.dispatchMouseEvent ,不受 DOM 结构限制。即使有 iframe 嵌套、shadow DOM 遮挡、跨域限制,点击都能正常到达目标。

执行 JavaScript

print(js("document.title"))

links = js("JSON.stringify([...document.querySelectorAll('a')].map(a => ({text: a.textContent, href: a.href})))")
print(links)

js() 函数直接在页面上下文中执行 JavaScript,适合提取数据、操作 DOM、读取页面状态。表达式中包含 return 时会自动包装成立即执行函数。

标签页管理

tabs = list_tabs(include_chrome=False)
for t in tabs:
    print(f"{t['title']}: {t['url']}")

switch_tab(tabs[0]["targetId"])


自我修复:AI 自己写工具

browser-harness 最独特的设计是 AI 可以编辑 helpers.py。当 AI 发现缺少某个功能时,它不会报错退出,而是自己把函数写进去。

项目 README 记录了一个真实案例:AI 需要上传文件,但发现 helpers.py 里没有 upload_file 函数。AI 的反应流程:

  1. 用 grep 确认 helpers.py 确实没有上传相关函数
  2. 阅读整个 helpers.py,理解代码风格
  3. 调用 CDP 的 DOM.setFileInputFiles 接口,在 helpers.py 末尾写了一个完整的 upload_file 函数
  4. 调用新写的函数成功上传文件

整个过程无人干预。开发团队后来在 git diff 里看到 helpers.py 从 192 行变成 199 行,才知道 AI 自己加了代码。

这个设计背后的思路是:现代大语言模型对 CDP 协议非常熟悉,训练数据中有大量相关代码和文档。与其花几万行代码封装各种接口,不如直接让 AI 用自己的知识来处理。

domain-skills 和 interaction-skills

项目内置了两类技能文件,帮助 AI 更高效地操作网站。

domain-skills (网站专用知识):收录了 70+ 个网站的专用操作指南,包括 GitHub、Amazon、LinkedIn、YouTube、Reddit 等。每个网站一个目录,记录了稳定的 CSS 选择器、私有 API 端点、页面结构特点、常见陷阱等。

rg --files domain-skills | grep amazon

AI 在导航到某个网站时会自动查找对应的 domain-skills。你也可以贡献新网站的技能——按项目的设计,技能应该由 AI 在操作过程中自动生成,而不是人工编写。

interaction-skills (通用交互技巧):覆盖 17 种常见交互模式——对话框处理、跨域 iframe、文件上传、拖拽、下拉菜单、shadow DOM 等。当 AI 遇到具体的交互困难时,会参考这些指南。

维护命令

browser-harness --doctor

browser-harness --setup

browser-harness --update -y

browser-harness --reload

与 Playwright MCP、Browser Use CLI 的区别

特性 browser-harness Playwright MCP Browser Use CLI
AI 调用方式 直接调用 CDP,无封装 调用预定义函数 启发式规则驱动
遇到未知情况 AI 自己写代码处理 报错 规则不覆盖就失败
代码量 ~1200 行 较大 数万行
对 AI 模型要求 必须用顶级模型 较低 较低
连接方式 连接用户已打开的浏览器 启动新浏览器实例 启动新浏览器实例

核心差异在于设计哲学:Playwright 和 Browser Use 试图把浏览器的复杂性封装起来,提供简单接口;browser-harness 反其道而行,把所有复杂性暴露给 AI,让 AI 自己处理。前者在页面稳定、流程固定的场景下效率高;后者在页面频繁变化、流程不可预测的场景下更有优势。

注意事项

  • 速度慢 :每一步 AI 都要看页面、分析情况、做决策,简单任务可能要几分钟
  • 成本高 :每步操作都要调用大模型 API,传递截图或 DOM 树,token 消耗大
  • 稳定性一般 :复杂任务中 AI 可能迷路、做错决定、陷入死循环,不适合关键生产系统
  • 安全风险 :给 AI 控制浏览器的权限相当于给了操作系统级别的操作能力,需要注意恶意网站可能诱导 AI 做危险操作

适合的场景:AI Agent 开发研究、企业内部系统自动化(没有 API 的老旧系统)、浏览器任务探索和原型验证。不适合的场景:生产环境稳定运行、高频率低延迟的自动化、低成本批量操作。

脚注:

2

uv 是一个快速的 Python 包管理器,安装方法: curl -LsSf https://astral.sh/uv/install.sh | sh