惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
人人都是产品经理
人人都是产品经理
IT之家
IT之家
T
The Blog of Author Tim Ferriss
V
V2EX
博客园 - 聂微东
The Cloudflare Blog
Blog — PlanetScale
Blog — PlanetScale
A
About on SuperTechFans
U
Unit 42
Vercel News
Vercel News
L
LangChain Blog
博客园 - 司徒正美
H
Help Net Security
Recent Announcements
Recent Announcements
Recorded Future
Recorded Future
V
Visual Studio Blog
Jina AI
Jina AI
Microsoft Azure Blog
Microsoft Azure Blog
GbyAI
GbyAI
Y
Y Combinator Blog
C
Check Point Blog
博客园 - 三生石上(FineUI控件)
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
J
Java Code Geeks
The Register - Security
The Register - Security
The GitHub Blog
The GitHub Blog
B
Blog RSS Feed
F
Fortinet All Blogs
B
Blog
G
Google Developers Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
云风的 BLOG
云风的 BLOG
爱范儿
爱范儿
MongoDB | Blog
MongoDB | Blog
F
Full Disclosure
有赞技术团队
有赞技术团队
罗磊的独立博客
博客园_首页
MyScale Blog
MyScale Blog
aimingoo的专栏
aimingoo的专栏
Google DeepMind News
Google DeepMind News
M
MIT News - Artificial intelligence
N
Netflix TechBlog - Medium
Engineering at Meta
Engineering at Meta
量子位
I
InfoQ
小众软件
小众软件
P
Proofpoint News Feed

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
为什么 AI Agent 需要专属浏览器?
海外独角兽 · 2025-04-10 · via 人人都是产品经理

传统的浏览器设计主要是为了满足人类用户的交互需求,其功能和性能在很大程度上无法适应AI Agent自动化抓取、交互和实时数据处理的复杂需求。本文深入探讨了为什么现有的浏览器无法满足AI Agent的需求,以及如何构建一个全新的、专为AI设计的浏览器来解决这些问题。

浏览器的使用者正在逐渐从人类用户转移到 AI Agent,Agent 与互联网环境互动的底层设施也因此正在变得越来越重要。传统浏览器无法满足 AI Agent 自动化抓取、交互和实时数据处理的需求。Browserbase 的创始人 Paul Klein 早在 23 年底就敏锐地洞察到 AI Agent 亟需一个全新的交互载体——一个“为 AI 而生”的云端浏览器。这个浏览器不仅要解决现有工具的性能和部署问题,更核心的是要利用 LLM 和 VLM 赋予浏览器理解和适应网页变化的能力,让 AI Agent 能用更接近自然语言的方式与之交互,稳定地完成任务。

Browserbase 是一家成立一年多的 headless browser 服务提供商,以云服务的形式为 AI Agent 公司提供 scalable、高可用性的浏览器服务。近期,Browserbase 又推出了 StageHand,一种利用 LLM 使得开发者可以用自然语言与网页进行交互的框架,进一步拓展了其在 headless browser 领域的影响。

本文基于创始人早期备忘录进行了编译,详细阐述了这一技术革新的必要性与可行性。它分析了现有浏览器为什么不够 AI-native,描绘了利用 LLM 构建新一代 Headless Browser 的蓝图,并探讨了如何设计配套的 SDK 和 API 以提供极致的开发者体验,最终实现大幅降低 AI 与网页交互的门槛和维护成本的目标。我们编译的过程中能感受到 Browserbase 这一年多以来的产品实践和 Stagehand 框架的推出都能和文中的 roadmap 对应上。

💡 目录 💡

 01 目前的浏览器无法满足 AI Agent 需求

 02 Browser for AI 市场正在快速增长

 03 打造一个更好的 headless browser

 04 如何走向市场

 05 风险与竞争

 06 总结

01.目前的浏览器无法满足 AI Agent 需求

过去三十年里,浏览器一直是人类与网页交互的默认方式。人类是视觉主导的生物,更容易通过图形化界面来使用线上工具。为了满足用户日益增长的需求,人们也一直在努力创新,不断改进网页开发的流程,来更快地构建新的网站。现在,一个有意思的问题出现了:如果网站的主要用户并非人类,而是 AI Agent 呢?

根据 Cloudflare 的数据,互联网上已经有超过 40% 的流量来自其他计算机,也就是我们常说的 bots。由于互联网拥有海量信息,这些勤奋的 bots 会不断抓取(Scraping)其中最有价值的部分。之所以需要抓取数据,是因为很多网站并未提供结构化数据的公开 API 接口,导致机器人不得不像人类一样,直接在网站上浏览和获取信息。

一些基于大型语言模型的 AI Agent 展示了模型自主完成任务的能力,它们也会像人类用户一样,通过浏览网站来执行具体任务。试想一下,你的个人 AI 助手能够自己打开航空公司网站,通过聊天窗口帮你重新预订航班。在缺少 API 的世界里,网站就成了获取信息和交互的主要入口。

正是由于 bots 日益普遍、数据抓取的需求不断增加,以及需要通过访问浏览器执行任务的 AI Agent 的兴起,我们不禁想问:开发者目前是如何构建网络数据自动化解析工具的呢?

问题1:Scraping 并不简单

Scraping 真正有趣的地方在于:可以采取一种简单直接的方法,也可以深入构建一个强大的解决方案。当开发者从网站抓取数据时,他们通常会模仿浏览器,直接对目标网址发起一个简单的 HTTP 请求,例如:

这条简单的命令确实能从 Airbnb 的网站获取数据,但现实中有不少额外的问题。

现代网站通常不会在首次请求中就加载全部内容,必须等待页面上的脚本运行,以动态加载所需的数据。为了执行这些脚本,需要模拟一个完整的浏览器环境,以便脚本能够顺利调用所需的浏览器 API。

Airbnb.com 在初始页面加载后逐步加载数据

有时候想要的数据并不直接通过公开的 URL 获取,而是需要与页面进行交互,例如点击链接、输入信息并导航到相应位置。这种情况下需要实现页面交互的自动化。

电子邮件框挡住了文章内容从而无法直接抓取内容

此外,一些网站能够识别 Scraping 行为,并通过验证码(CAPTCHA)来阻止访问。要绕过这些检测机制,通常需要发送特定的 HTTP 头信息,模仿正常浏览器的行为,伪装自己的请求。

网站监测到了爬虫并要求输入验证码

即便顺利访问到了网页,下一步还得解析数据。然而,由于现代网页的结构往往十分复杂,开发过程中生成的页面标签也难以预测,且可能在每次开发者重新编译页面时发生变化,因此想要准确提取数据并非易事。

网页中复杂结构的示例

这些困难几乎让开发者很难仅凭内置工具就构建出有效的 Scraping 流程。而令人意外的是,最好的工具其实正是他们每天都会用到的——浏览器。

问题2:现有的 headless browser 不 AI-native

headless browser 是一种完全通过代码控制运行的浏览器,是做 scraping 最好的基础设施之一。这类浏览器并不会打开图形化界面(GUI)并渲染窗口,而是直接在内存中完成所有操作。这是因为计算机只能读取,而不需要“看到”,因此在抓取数据时无需实际渲染页面。

有头浏览器和无头浏览器的对比

目前,已有一些流行的 headless browser 库,其中最主流的是谷歌的 Puppeteer 和微软的 Playwright。两者都提供了对浏览器 API 的全面访问,广泛应用于各种场景。

一个创建 Airbnb 账户的 Puppeteer 函数

程序员通过 headless browser 与网站交互的主要方式是使用 CSS 选择器。正如上述示例所展示的,选择器用来确定页面上哪些元素可见,在哪输入信息,以及需要点击的位置。然而,CSS 选择器是无类型的纯文本,因此开发者无法享受现代强类型语言在编译阶段就捕捉错误的好处,使得开发过程更加脆弱和容易出错。此外,定义这些交互流程十分繁琐,因为选择器极其脆弱。一旦页面结构稍有变化,之前建立的流程就会崩溃。如果任一步骤顺序出现偏差,整个过程都会中断。此外,要判断页面是否加载完成,通常需要等待网络请求结束,这种模式意味着大量的等待时间。

除了语言本身的复杂性之外,可编程浏览器库本身也存在冗余臃肿的问题。以 Puppeteer 为例,在 Linux 上安装时需要高达 282MB 的依赖,这个体积是非常巨大的。作为参考,AWS Lambda 服务的最大部署大小仅为 250MB,意味着用户不得不采取其他解决方案。类似的问题也同样出现在 Playwright 身上。

造成如此庞大依赖体积的直接原因是 Puppeteer 运行时需要整个浏览器环境,导致它携带了大量实际代码中用不到的功能。

需要强调的是,这些已经是当前最流行的 headless browser 库了。尽管它们位于诸多重要工作流程的核心,但仍然存在各种不便和痛点,导致开发体验并不理想。

02.Browser for AI 市场正在快速增长

大型语言模型的知识范围受到训练数据的限制,因此往往依靠浏览器来获取最新的知识。当前主要有两种技术途径实现这一目标:

第一种方法是 RAG。LLMs 会先通过浏览器获取信息,然后将这些信息作为额外的上下文,补充到 prompt中。这种额外的上下文能够帮助 LLMs 给出更精准的回答。

另一种方法则是基于 Plugins/Web Agents 的范式。一些应用向 LLMs 提供一个浏览器接口,当 LLMs 接收到需要联网执行的任务时,会自主调用该浏览器接口,自动地完成页面导航、数据解析等操作,直至完成用户交代的任务。

除了 ChatGPT 以外,目前其他主流的 LLMs 编排框架也已集成了浏览器自动化功能。Langchain 作为当前广泛使用的框架,提供了一个基础的 Web Browser 插件,使用的正是前面提到的 Scraping 方法。同时,Langchain 也与Browserless 有专门的集成,用于更高效、更稳定的 Scraping。

近期,OpenAI 知名研究员 Andrej Karpathy 描述了一种不久之后可能出现的“LLM操作系统”。在他给出的系统图中,可以清晰地看到:浏览器与文件系统、向量数据库(embeddings/vector databases)并列,成为LLM的核心基础组件之一。这一点明确显示出浏览器对于 LLMs 的重要性,尤其是随着 LLMs 使用外部工具能力的不断增强,这种趋势只会越来越明显。

Andrej Karpathy 在 Youtube 视频中给出的 LLM OS 的结构

当前的 Scraping 和浏览器自动化市场已经非常可观。从 NPM 下载数据来看,Puppeteer 这个库的增长规模已经与 Next.js 相当,后者是 Vercel 旗下非常流行的网页框架。

通过 NPM 的每周下载量

可作为参考的上市公司是 UIPath,这家公司专注于 RPA 软件开发,帮助企业自动执行各种常规业务任务。UiPath 今年的营收预计将超过 10 亿美元,充分体现了 AI 驱动的任务自动化所蕴含的巨大市场潜力。然而,其浏览器自动化工具本身的吸引力则相对逊色。

目前,这一领域的初创公司已经吸引了诸多财富 500 强企业的关注,这显示出企业市场对浏览器自动化工具的强烈需求。

使用 ScrapingBee 的一些客户

此外,还有几个重要的趋势将进一步推动浏览器自动化工具的快速普及:

• 训练新的基础模型,需要大规模的数据抓取。

• 数据所有方(例如Wikipedia、Reddit、StackOverflow)希望更好地维护数据的商业价值,这将使数据抓取变得更复杂,从而要求更强大的浏览器自动化工具。

• 一批公司将通过 Web Agents 实现自动化地与网站交互,这种功能可能成为这些公司产品的特色甚至其主要的业务方向。

• 现有的 SaaS 公司可能会增加一些基于AI的功能,而这些功能将依赖浏览器自动化来实现。

• 许多传统网站无法提供足够的 API 来获取数据,因此长期来看,浏览器自动化将成为唯一的解决方案。

03.打造一个更好的 headless browser

回顾一下此前提到的目前 headless browser 存在的问题:

• 现有的浏览器自动化库臃肿,性能未得到优化。

• 在现代云环境中的部署流程过于复杂。

• 现有的脚本语言构建的集成方案非常脆弱,经常出现故障。

• 脚本通常依赖设置任意的等待时间,容易出错且效率低下。

• 从页面解析数据的过程繁琐,往往需要大量试错。

简单来说,开发者们真正想要的是一个性能更强、可靠性更高、且使用更简便的浏览器自动化方案。我在阅读了许多开发者的反馈意见后,可以清晰地看到开发者们同样迫切地希望拥有一个更出色的浏览器自动化平台。

有三个关键的创新点可以实现一个性能更佳、云原生、以 AI 为核心的下一代浏览器自动化平台:

1. 打造一个开源的、高度优化的 headless browser

我们不应再容忍缓慢的冷启动和臃肿的依赖包。

2. 用 AI 赋予浏览器“超能力”

不再强迫开发者手动构建复杂的页面解析树,而是通过 LLMs 高效地定位页面中的信息,即使网页结构发生变化,也能快速找到数据。使用 GPT-4V 这类视觉模型,直接基于截图识别页面元素,而不是传统的代码解析。开发者可以直观地询问:“页面加载完成了吗?”或“登录按钮是否可见?”,而无需复杂的技巧或猜测。访问被混淆或隐藏的信息,比如网站为了防止抓取而将价格信息藏在图片里,而非文本中。

3. 提供全新层次的接口,给开发者带来极致的体验

从根本上重新设计 SDK,因为当前的流程化接口对处理复杂的重试和分支操作不够友好。但是,为保证迁移平滑,应同时保持与 Puppeteer 接口的兼容性。让开发者能够充分利用最新的“AI 原生”创新技术。不过,传统方法有时可能更高效,因此开发者可以灵活选择最适合其使用场景的方案。一个出色的平台还需要提供强大的 API,方便开发者轻松管理底层的浏览器基础设施,全面提升用户体验。

*译者注:站在 2025 年回看的 browserbase ,我们会发现其发展历程与创始人提出的策略三大策略是吻合的,browserbase 通过其开源策略迅速打开了市场,并在 2024 年底发布了 StageHand,一种利用 LLM 将自然语言指令转换成 Playwright 代码从而操纵 headless browser 的开源框架,使得开发者可以用自然语言与网页进行交互,而不再需要手动解析复杂的网页结构并进行维护,大幅降低了 AI Agent 联网的成本。

开发者使用自然语言与 Stagehand 交互,Stagehand 则将自然语言转换成 Playwright 代码并通过 Browserbase 调用浏览器

04.如何走向市场

如 a16z 合伙人 Alex Rampell 所说:“每家初创公司与现有巨头之间的竞争,本质上就是看创业公司能否在巨头实现创新之前,抢先获得市场分发。”

如果没有强有力的 GTM 策略就无法获得成功,“首次创业的人痴迷于产品,二次创业的人则专注于分发。”针对开发者工具类产品,最有效的分发策略如下:

• 打造一流的产品

• 通过开源投资于社区

• 建立值得信赖的品牌

• 教育并赋能开发者

其中最重要的一点是,产品必须卓越。无论多精美的包装或漂亮的落地页,都无法弥补产品本质上的不足。只有真正过硬的产品才能抓住当前市场中的巨大机会。

投资于社区,意味着在获取价值的同时也回馈社区。现有浏览器库大多为开源模式,新的产品也应该如此。开源是一个极佳的分发渠道,将出色的软件免费提供出去,开发者自然更愿意体验你的产品,并逐步转化为付费用户。

在开发者工具领域,建立良好品牌的重要性不容忽视,甚至可以与产品质量本身并列。口碑传播是开发者工具公司最有效的渠道,其次才是自然搜索流量。

想要真正吸引开发者,就必须去他们所在的地方与他们互动。如果大量精力投入在吸引用户上,却没有精心撰写优秀的文档,或缺乏适合开发者语言的 SDK,那之前所有的努力都是徒劳。这些投入会直接推动口碑传播——最好的赞赏莫过于“你看过这家初创公司的文档吗?真的太棒了!”

因为现有的浏览器自动化流程经常出错,这为新产品提供了大量机会。开发者在处理原本正常运行的代码突然失效时,正是他们最容易转向其他更稳定工具的时机。这种情景对开发者工具来说相当罕见,因为多数情况下这些工具都是“一次配置好,后续无需再关注”。

拥有一个被社区积极认可的可信品牌本身就是一道壁垒,尤其当开发者开始积极贡献开源核心产品的代码时。避免成为 commodity 的最佳方式,就是成为开发者群体的默认选择,而优秀的开源项目正是实现这一目标的关键。

由于开发者工具领域的绝大部分收入通常来自市场顶端的 20% 用户,因此自下而上的市场拓展策略(Bottoms-up GTM)更多是为增强口碑传播,从而长期打开企业级客户的收入大门。

最后,随着核心业务的成功,公司也拥有大量向外扩展的机会,比如:

• 将抓取的数据存储服务打包提供,并开放统一的查询 API;

• 支持用户数据持久化,加速任务完成;

• 建立社区化的工作流市场(例如从 McMaster-Carr 订购特殊螺丝的自动化流程)。

尽管个人更倾向于横向平台模式,但短期内,将自身定位成一个统一的传统数据源 API 平台,也可能更快地捕获市场价值。这样一来,很多此前无法实现的自动化流程,都可以直接基于该平台构建和运行。

05.风险与竞争

Browser for AI 的 6 个风险

风险1:在已有市场中成为默认选择非常困难

策略:

用全新范式颠覆市场,使初创公司能够对市场进行细分,从而找到适合切入的空间。

参考案例:

Heroku (已有的领军企业) vs Vercel (新晋的创业公司):Heroku 提供全面的 PaaS 解决方案,而 Vercel 通过无服务器和前端优先的范式,专注于现代 JavaScript 开发者的细分需求。

Mailgun (已有的领军企业) vs Resend (新晋的创业公司):Mailgun 是功能强大的邮件基础设施领导者,而 Resend 以开发者体验和设计驱动的服务,瞄准现代技术栈用户的特定市场。

风险2:浏览器自动化可能与客户的核心产品深度绑定,客户可能不愿外包

反驳观点:

如果一个功能足够重要且具备足够的复杂度,客户如果坚持自主开发将面临巨大成本,这种情况下外购是更合理的选择。这实际上是典型的“自建 vs 购买”问题。

风险3:LLMs 推理成本太高,可能导致很多使用场景成本过于昂贵

反驳观点:

LLMs 的推理成本在长期趋势上很可能会持续下降。

策略:

将 LLMs 的相关功能设计为可选模式,让客户能够自主控制成本,从而支持更广泛的应用场景。

风险4:这类基础设施产品容易商品化,利润率面临持续压缩的压力

策略:

如果可能的话,重新设计创新性的定价策略。例如不再按会话数收费,而可能按照吞吐量收费。

成为基础设施意味着需要非常小心控制单位成本。

风险5:滥用与法律合规风险

反驳观点:

截至 2022 年,根据美国第九巡回上诉法院的裁定,Scraping 行为是合法的。

此外,AI 领域的技术创新也使得识别滥用行为变得比过去容易百倍。

风险6:如果大公司(如 OpenAI、Google 等)自己开发此类产品怎么办?

反驳观点:

本质上,LLMs 本身无法直接内置浏览器功能,因为浏览器属于单独的技术领域。OpenAI 等公司不太可能将浏览器与 GPT API 直接捆绑,因为这将引入额外的复杂性(例如计费或技术对接)。

即便 OpenAI 等公司开始整合类似功能,开发者仍然需要大量定制化的配置,以满足具体应用需求。

个人助理的使用场景可能最终由苹果或谷歌等巨头主导,他们会为最常用的服务提供原生集成接口。

但日常生活中频繁接触的大量中小型商家(比如街角的面包店或理发店)不可能提供原生 API 接口,因此这些场景仍然需要依靠浏览器自动化实现。

Browser for AI 的 3 类竞争对手

与向量数据库领域相比,浏览器自动化这一基础组件在风险投资市场中的资金投入明显不足。现有的公司大多是自筹资金(bootstrap)起步,或融资金额低于500 万美元。而获得大额融资的公司多数并未真正服务于构建相关应用的开发者群体。

本文将现有的初创公司划分为三大类别:浏览器自动化、Scraping API 和 信息检索 API。

浏览器自动化

Browserless

• Browserless是该领域最接近龙头位置的公司,在市场渗透率和开发者中的品牌认可度都很不错。

• 它的本质是远程托管的 Puppeteer,核心创新主要集中在基础设施层,而非SDK层。

• 团队规模较小,最近被一家新 buyout fund 收购。

Browse.ai

• 一家获得风投支持的公司,但主要偏向消费者市场或低代码用户群。

• 它提供的“Website to API”功能非常有吸引力。

Induced.ai

• 已融资 230 万美元种子轮,专注于企业 RPA 和专业消费者市场。

Scraping APIs

这些公司提供一个 URL 接口,然后返回通常为非结构化的数据。这些 API 公司通常还提供一些额外的功能,例如绕过 CAPTCHA 验证或使用代理服务(proxy)。

• ScrapingBee

• WebScrapingAPI

• ScraperAPI

信息检索APIs

这类初创公司更专注于特定信息的搜索和检索服务,而非通用的浏览器自动化。

• Metaphor Systems

• SerpAPI

未来行业内顶尖公司的产品应该同时吸取上述三类公司的特点和优势。目前看来,没有任何一家现有公司处于绝对领先地位,市场中真正最大的竞争对手反而是自己构建方案的开发者。

06.总结

• 可预见的未来,Scraping 依然会是长期存在的需求。

• 互联网本质上是不确定的,但我们目前仍在用确定性的工具来应对它。

• 浏览器自动化这个基础组件长期以来缺乏足够的投资,而 AI 应用在未来很多年都将高度依赖这一能力。

• 市场上存在大量 AI 和非 AI 的使用场景,这为新兴创业公司提供了难得的颠覆机会。

• 能够把握住这个机会的创始人,通常具有深厚的 headless browser 技术背景、开发者工具经验,以及对 AI 领域的热情与洞察力。

编译:Xeriano 编辑:Cage

本文由人人都是产品经理作者【海外独角兽】,微信公众号:【海外独角兽】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。