惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Security Archives - TechRepublic
Security Archives - TechRepublic
S
Secure Thoughts
V2EX - 技术
V2EX - 技术
Schneier on Security
Schneier on Security
Application and Cybersecurity Blog
Application and Cybersecurity Blog
L
LangChain Blog
博客园_首页
Jina AI
Jina AI
IT之家
IT之家
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
T
Tenable Blog
量子位
V
V2EX
酷 壳 – CoolShell
酷 壳 – CoolShell
S
Security Affairs
Last Week in AI
Last Week in AI
Scott Helme
Scott Helme
月光博客
月光博客
D
Darknet – Hacking Tools, Hacker News & Cyber Security
博客园 - 叶小钗
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
T
Tailwind CSS Blog
Simon Willison's Weblog
Simon Willison's Weblog
PCI Perspectives
PCI Perspectives
人人都是产品经理
人人都是产品经理
N
News and Events Feed by Topic
腾讯CDC
P
Proofpoint News Feed
T
The Exploit Database - CXSecurity.com
J
Java Code Geeks
博客园 - 司徒正美
博客园 - Franky
Latest news
Latest news
S
SegmentFault 最新的问题
小众软件
小众软件
博客园 - 三生石上(FineUI控件)
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
I
Intezer
Attack and Defense Labs
Attack and Defense Labs
H
Heimdal Security Blog
H
Hacker News: Front Page
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
博客园 - 【当耐特】
T
Troy Hunt's Blog
N
News | PayPal Newsroom
P
Palo Alto Networks Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Recent Commits to openclaw:main
Recent Commits to openclaw:main
雷峰网
雷峰网

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
刚成17亿美元估值独角兽就被骂“毒瘤”,这个90后华人团队主导开发的“AI选秀”产品什么来头?
扬帆出海 · 2026-01-11 · via 人人都是产品经理

这个由华人团队打造的“AI选秀”平台通过双盲测试让用户投票评选模型,却因52%的错误率被数据标注巨头Surge AI直指为“行业毒瘤”。本文深度拆解LMArena从开源实验到商业垄断的崛起路径,并揭示其背后引发的AI评估体系信任危机。

在当下的AI时代中,AI大模型已经深入我们的生活、工作以及方方面面。但有一个问题是,大模型的数量与迭代速度几乎到了令人眩晕的地步——从OpenAI的GPT系列、Anthropic的Claude、Google的Gemini,到层出不穷的国产旗舰与开源黑马,几乎每隔几周就有新AI和新版本问世,并且每一次都以“屠榜”的姿态登上各色榜单。

表面上,这些排行榜为我们提供了直观的性能坐标,但当我们将这些高分模型真正拉进日常任务里,常会发现它们有的答非所问、有的记忆不连贯导致逻辑断裂、有的甚至还会自己“杜撰”。所谓“榜首”与“好用”之间,似乎隔着一道看不见的鸿沟。

那么,在参数竞赛与分数泡沫之外,究竟有没有一种方式,能让普通用户乃至各行各业的从业者,更加直接且迅速地找到适合自己的、真正“好用”的AI产品?

别说,好像还真有。

比如LMArena。LMArena是一个AI评测平台,用户可以在LMArena上试用各种模型并投票,最关键的一点,LMArena采用的双盲测试形式,即随机给用户提供模型,并且不告知模型名字,真正在AI圈里玩了一把《蒙面歌王》选秀。

从23年5月到25年5月,LMArena仅用了3年,就从一个实验性的开源网站成长为一家具备商业化运营能力的公司,期间(5月)完成了1亿美元种子轮融资,估值6亿美元。而在今年1月7日,仅8个月时间,LMArena又完成了1.5亿美元的A轮融资,由Felicis和加州大学投资公司(UC Investments)领投,a16z、The House Fund、LDVP、Kleiner Perkins、Lightspeed Venture Partners等跟投。这轮投资过后,LMArena累计融资2.5亿美元,估值从6亿美元飙升至17亿美元,成为AI界又一独角兽。

01 华人团队主导研发,能测评AI模型的产品什么样?

LMArena并非一个新AI平台,其第一次面世是在2023年5月,彼时LMArena名为Chatbot Arena(为了统一,下文统称LMArena),由LMSYS这一开源组织创建。

LMSYS的“含中量”非常高。其核心成员基本都是来自斯坦福、伯克利、UCSD、CMU等全球顶尖名校的学霸,LMArena这个开源项目也是由华人团队主导开发的。

据调查,LMArena的成功有些“误打误撞”——该项目早期只是LMSYS为了测试自家开源模型水平而做的一个测试平台:把模型放到网站上,让用户以盲测的方式来选出更优秀的那个,由此得到的结果显然更加公平和权威。最终结果是,LMArena从一个用户“测着玩”的开源网站,发展成了AI界的金牌裁判。

从2023年5月到24年期间,不仅Claude、GPT-4、Gemini、DeepSeek等知名大模型都陆续接入LMArena,随着模型能力的扩展,LMArena也切入了更多AI细分赛道,支持对搜索、图像、代码、实时网页开发等AI生成能力的评估。而在这个过程中,LMArena逐渐成为了“模型能力试金石”,成为大模型背后公司们争抢的“宣发阵地”。

(图源:LMArena官网)

也正是基于此,LMArena找到了商业化的切入口。此前,LMArena面向的主要是C端普通用户,而普通用户在使用LMArena时是完全免费的,他们能为LMArena提供的是流量和数据。据悉,截至目前LMArena的每月活跃用户数量超过500万,覆盖了150多个国家,月对话量达6000万次,上线至今累计真实人机对话已经超过2.5亿次,此外累计用户投票次数也超过5000万次。

而在大模型公司将LMArena视作重要阵地并纷纷入驻之后,LMArena在25年9月推出了一项名为“AI Evaluations”的B2B付费服务,形式是提供定制化评测。简单来说,就是AI企业或者实验室付费给LMArena,通过其众包社区对模型进行评估,基于LMArena在C端用户群体之间的声量,这些经过验证的AI很容易获得普通用户的好感。根据LMArena数据,其付费服务上线不到4个月(截至25年12月底),ARR就从0冲到了3000万美元,包括OpenAI、Google、xAI等在内的头部AI企业都是LMArena的合作用户。

其次值得注意的是,LMArena目前还有一项新兴的收入来源——Private Arenas,该功能允许模型开发者使用内部或敏感数据来评估专有系统,而无需将结果公开。

此外,LMArena下一步商业化的方向还包括“评估工具与分析服务商业化”和“API与SDK访问权限”,前者能提供针对不同领域模型的定制化工具和AI能力相关的诊断报告;后者则能让AI企业将LMArena的评估流程和编程方式集成到自身训练、发布或者监控等工作流中使用。

这样一来,LMArena就同时打通了B端和C端,一方面,保证了C端用户体验,维持住了高活跃;另一方面,给AI企业提供了大量真实用户数据,一定程度上解决了模型开发调优过程中的一些盲点;其次,其提供的私人定制服务和领域,解决了AI企业无法在公域测试评估模型的痛点;最后,也为他们提供了一个理想的宣发阵地。

更值得关注的是,作为首个AI评测类产品,LMArena几乎已经“垄断”了这个市场,也因此成为资方们的“首选”。Felicis从种子轮的跟投方变成A轮的领投方,就很好地证明了这一点。

02 有潜力,也有风险

LMArena的火爆,展示了AI评测市场的潜力。但也是LMArena,让我们注意到了AI评测类产品目前存在的隐忧。

2025年底,美国数据标注公司Surge AI发布了一篇文章,称LMArena是AI界的毒瘤。

(图源:Surge AI官网blog)

先提一下,Surge AI由美籍华裔Edwin Chen创立,是AI数据标注领域的绝对头部企业。这家企业和其背后的创始人有着相当传奇的色彩:团队不足100人、没有经历过融资、不过分营销,但却在成立第一天就开始盈利,并且成立不到4年营收就突破了10亿美元,创始人Edwin Chen则是在38岁达成身家180亿美元成就,进入2025年福布斯亿万富豪榜。

也正是基于Surge AI在“数据”领域的影响力,此文章发布后一度在全球引发了非常激烈的讨论。过程是这样的:Surge AI对LMArena的500组投票数据进行了分析,发现错误率有52%,且39%的投票结果和现实情况完全相悖。

(图源:Surge AI官网blog-《LMArena is a cancer on AI》)

他们还给出了几组示例,比如询问两个AI模型关于蛋糕烤盘的问题,A表示“9英寸圆形蛋糕盘和9×13英寸长方形烤盘尺寸相同”,B则通过严谨计算给出了正确答案。但用户投票却给了A,原因是A的回答更自信。

(图源:Surge AI官网blog-《LMArena is a cancer on AI》)

借由这个示例,Sruge AI表示,这些AI的评估者并非专业人士,并且由于当代人几乎都受到TikTok等短视频的影响,他们更偏好表情符号和回答长度而非数据质量,因此他们评估得到的结果可以想见也并不严谨,但他们的决定,却能一定程度上决定AI模型的发展方向,并且影响AI开发者的决策。

比如Meta发布的Maverick模型,在接入LMArena的版本中就完全靠拢用户倾好,增加了不少emoji,并且凭借用户投票冲入LMArena榜单TOP2,而实际公开版本却完全不同,在三方榜单上的排名和LMArena排名一度相差30名。

(图源:Surge AI官网blog-《LMArena is a cancer on AI》)

如果AI模型们都朝着排版更好看、符号表情更丰富的方向,追求排名和用户点击,而不是打造更真实可靠、安全的数据和内容,坚守立场和原则,就好比明星听从粉丝的要求来决定妆造和事业方向,那么势必会破坏应有秩序。虽然我们也看到有AI产品在坚持自己的立场,但如果能引领行业的AI企业不做出调整和表率作用,那么届时AI领域极有可能会倒退。

而这个经由LMArena为代表的AI评测类产品引发的思考,或许会成为未来整个AI领域都要面对的严肃议题。

03 写在最后

最后,Scale AI和LMArena的“战争”还在持续。为了解决他们自己提出的质疑,Scale AI在25年9月推出了Seal showdown平台,在这一平台上,评估者从普通用户变成了律师、医生、教授等付费专家们,以增加评估结果的专业度和严谨性。虽然目前效果还未可知,但站在第三方视角,扬帆出海认为这可能并非解决此类事件的最佳答案。这条赛道最终会如何发展?或许还需要时间来解答——我们期待下一个AI评测爆品的出现。

参考文章:

1.LMArena is a cancer on AI

https://surgehq.ai/blog/lmarena-is-a-plague-on-ai

2.Report:LMArena Business Breakdown&Founding Story | Contrary Research

https://research.contrary.com/company/lmarena

作者丨汪酱编辑丨火狐狸

本文由人人都是产品经理作者【扬帆出海】,微信公众号:【扬帆出海】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。