惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Scott Helme
Scott Helme
宝玉的分享
宝玉的分享
B
Blog RSS Feed
博客园 - 司徒正美
Stack Overflow Blog
Stack Overflow Blog
博客园_首页
H
Help Net Security
T
The Blog of Author Tim Ferriss
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
月光博客
月光博客
F
Full Disclosure
爱范儿
爱范儿
罗磊的独立博客
G
Google Developers Blog
Last Week in AI
Last Week in AI
Jina AI
Jina AI
量子位
Hacker News: Ask HN
Hacker News: Ask HN
aimingoo的专栏
aimingoo的专栏
PCI Perspectives
PCI Perspectives
酷 壳 – CoolShell
酷 壳 – CoolShell
Application and Cybersecurity Blog
Application and Cybersecurity Blog
S
Secure Thoughts
L
LINUX DO - 最新话题
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
Project Zero
Project Zero
云风的 BLOG
云风的 BLOG
V
V2EX
H
Heimdal Security Blog
Engineering at Meta
Engineering at Meta
I
InfoQ
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Hugging Face - Blog
Hugging Face - Blog
博客园 - 聂微东
S
Security Affairs
Security Archives - TechRepublic
Security Archives - TechRepublic
Cyberwarzone
Cyberwarzone
G
GRAHAM CLULEY
Apple Machine Learning Research
Apple Machine Learning Research
The GitHub Blog
The GitHub Blog
T
Tor Project blog
Recent Commits to openclaw:main
Recent Commits to openclaw:main
Attack and Defense Labs
Attack and Defense Labs
Know Your Adversary
Know Your Adversary
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
D
Docker
Vercel News
Vercel News
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
有赞技术团队
有赞技术团队
J
Java Code Geeks

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
ChatGPT两周年,国产o1大模型们紧追不舍
光锥智能 · 2024-12-03 · via 人人都是产品经理

OpenAI的o1模型以其深度思考能力成为焦点,而国产大模型也在紧追不舍,纷纷推出了具有特色的o1类模型。本文将带你深入了解国产大模型如何通过“慢思考”实现技术突破,以及它们在智能化道路上的探索和挑战。

ChatGPT诞生的第二年,OpenAI和国内的一众企业正在试着“抛弃”它。

在Scaling Law被质疑能力“见顶”的情况下,今年9月,OpenAI带着以全新系列命名的模型o1一经发布,“会思考的大模型”再度成为焦点。

“我认为这次 o1 模型发布最重要的信息是,AI 发展不仅没有放缓,而且我们对未来几年已经胜券在握。”对于o1的发布,奥特曼信心满满。

国内大模型厂商对o1的学习、超越任务也提上了日程。两个多月之后,国内大模型公司纷纷效仿,相继推出了各具特色的o1类深度思考模型。

无论是kimi的k0 math、Deepseek的DeepSeek-R1-Lite,还是昆仑万维推出的“天工大模型4.0”o1版,都在强调着国内大模型对大模型逻辑思考能力的重视。

一、国产大模型集体跟进o1

在OpenAI没有披露o1具体技术的情况下,只用了2个月左右的时间,国内大模型公司就跟上了前沿方向的能力:

11月16日,月之暗面在发布会上公开了新模型k0 math,通过采用强化学习和思维链推理技术,大模型开始试图模拟人类的思考和反思过程,从而增强其数学推理能力。顾名思义,它在研究数学难题方面的能力可谓“遥遥领先”。

4天后,Deepseek的DeepSeek-R1-Lite正式上线。和OpenAI的o1相比,R1毫无保留地放出了大模型思考的完整过程。官方表示,R1的思维链长度可达数万字。从官方测试结果来看,在AIME(美国数学竞赛)、部分编程比赛的测试上,R1的表现超越了o1-Preview。Deepseek还直接在官网放出了测试版,允许用户每天体验50次对话。

就在上周三(11月27日),昆仑万维也放出了具有复杂思考推理能力的天工大模型4.0 o1版(Skywork o1),宣布它是国内首款实现中文逻辑推理的模型。它也一次性给出了三种模型版本:开源的Skywork O1 Open、优化中文支持能力的Skywork O1 Lite,以及完整展现模型思考过程的Skywork O1 Preview。

扎堆涌现的国产“o1”大模型们,不想只做简单的“模型复刻”。

从模型测试跑出的指标分数来看,上述模型在数学、代码等能力上的表现均逼近、甚至超过了o1:

以k0 math为例,在中考、高考、考研以及包含入门竞赛题的MATH等4个数学基准测试中,k0-math的成绩超过了OpenAI的o1-mini和o1-preview模型。

不过,在一些难度更大的竞赛测试题能力表现上,比如难度更大的竞赛级别的数学题库OMNI-MATH和AIME基准测试中,ko math表现还没办法赶上o1-mini。

能够做出难度高的数学题,类o1的大模型们开始学会了“慢思考”。

通过在模型中引入思维链(CoT),大模型将复杂问题拆解为多个小问题,开始模拟人类逐步推理的过程。这是在无人参与的情况下,由大模型独立完成推理。强化学习使大模型能够自行尝试多种不同的解题方法并根据反馈调整策略,学习和反思的任务的任务,都交给了大模型。

和一般模型相比,此类产品在一些往常无法解决的问题上也能够正确回答,比如“草莓strawberry”一共有几个r、“9.11和9.9相比哪个大”等问题,交给o1,它能在一番思考后给出正确的答案。

比如,把“Responsibility中有几个字母i?”的问题抛给Deepseek R1,在深度思考模式中,我们能够看到大模型的思考过程:它先把单次拆解成一个个字母,再逐步比较每个字母是什么,最终给出了正确的结果。在测试中,R1的思考速度也够快,用不到两秒的时间给出了答案。

二、专精还是空中楼阁,o1的硬币两面

批量制造的“慢思考”大模型们,在强化学习和逻辑链的加成下,模型能力的表现突飞猛进。

在Deepseek公布的测试效果中,可以看到,DeepSeek-R1-Lite的推理时间和准确率成正比关系,即推理时长越长,跑出的效果就越好。和过往没有“慢思考”能力的模型相比,R1的表现远优于前者。

在上述能力的加成下,大模型的自我反思、学习能力提升明显。比如,面对陷阱时,模型可以通过思维链模式自行避开问题。

发布自研模型时,昆仑万维给了大模型一个“陷阱”题目。让它回答存在中文读音“陷阱”的问题——“请将qíng rén yǎn lǐ chū xī shī转换为中文”。在第一次思考得出结论时,大模型主动发现了“西诗”是不对的说法,通过推理找到了准确的翻译结果。

一方面,慢思考模型大幅提升了大模型在一些特定学科上的表现,解决难题的能力进一步提升;另一方面,大量耗费tokens的方式却未必能换来用户需要的回报,这也是常被用户诟病的一点。

在某些情况下,增加模型思维链的长度可以提高效率,因为模型能够更深入地理解和解决问题。

然而,这并不意味着它在所有情况下都是最优解。

比如,思考“1+1>2”这类常识性问题,显然从效率和成本上来看,更适合用以往大模型的能力。这就需要大模型学会对问题难度自行进行判别,从而决定是否采用深度思考模式回答对应问题。

而在科学研究或复杂项目规划中,增加思维链的长度可能是有益的。在这些情况下,深入理解各个变量及其相互作用,对于制定有效的策略和预测未来的结果至关重要。

此外,从特定场景下的强化学习应用转向通用模型,在训练算力和成本的平衡上或许还有一定难度。

从国内发布的模型来看,目前“慢思考”类大模型开发的基座模型参数不大。比如Deepseek和昆仑万维给出的模型版本,都建立在规模量更小的模型上:Skywork o1 Open基于Llama 3.1 8B的开源模型,Deepseek也强调目前使用的是一个较小的基座模型,还无法完全释放长思维链的潜力。

“一个大概率会确定的事情是,在训练 RL 的阶段,我们所需要的算力可能并不比预训练要少,这可能是一个非共识。”谈及o1时,阶跃星辰CEO姜大昕曾经提到过这个问题。

未来的大模型不应该花费大量精力在简单的问题上,要想跑出真正能够释放思维链能力的模型,还需要一定时间。

三、突破AGI二阶段,国内加速探索产品落地

大厂们为什么将o1视为了下一个必备项?

在OpenAI和智谱给出的“通往AGI五阶段”的定义中,两家公司均将多模态和大语言模型能力归在L1阶段,也就是最为基础的能力配备。

而o1的出现,则标志着大模型能力突破到了L2阶段。自此,大模型开始真正拥有了逻辑思维能力,在无人力干预的情况下进行规划、验证和反思。

当下,虽然海外以OpenAI为代表,率先实现了“慢思考”大模型能力的实现,但国内厂商在后续追赶的思路上想的更多。在同步跟进o1类产品的同时,大模型公司们已经在思考如何将o1的能力和现有AI应用方向结合。

针对大模型训练进展停滞的疑虑,可以看到,在数据枯竭的情况下,o1能够为Scaling Law提供新的支撑。

此前,大模型训练已经走入了“无数据可用”的困境。当可用的优质数据资源变得越来越有限,给依赖大量数据进行训练的AI大模型带来了挑战。

更多大模型公司的加入,或将联手探索出更大的可能性。“o1 已经 scale 到了一个很大的规模,我认为它带来了一个 Scaling 技术的新范式,不妨称之为 RL Scaling。而且 o1 还不成熟,它还是一个开端。”姜大昕说。

在现有的一些AI应用上,思维链的能力已经帮助提升了AI技术的使用效果。

以智谱的“会反思的AI搜索”为例,结合思维链能力,让AI能够将复杂问题拆解成多个步骤,进行逐步搜索和推理。通过联网搜索 + 深度推理,再将所有答案信息综合整理到一起,AI能够给到一个更加精准的答案,

当大模型开始学会“自我思考”,通往L3(Agent)的大门也正在被大模型公司们推开。

“从L1到L2花了一段时间,但我认为L2最令人兴奋的事情之一是它能够相对快速地实现L3,我们预计这种技术最终将带来的智能体将非常有影响力。”谈及o1,Sam Altman肯定了“慢思考”模型对推动智能体发展的潜力。

在智能体的能力实现上,思维链是智能体功能的重要一步。应用思维链能力,大模型才能对接受到的任务进行规划,将复杂的需求拆解成多个步骤,支撑智能体的任务规划。

最近涌现的一批“自主智能体”产品就是Agent能力的突破:通过将执行任务拆解到极致,AI开始学会像人一样用手机、电脑,帮助用户完成跨应用操作。智谱、荣耀等公司推出的智能体,已经可以通过指令帮用户完成点单购买的任务。

但以目前的情况,开发者还需要具体结合o1类产品的能力,去调整智能体的输出效果,让它更接近人类的使用习惯。

在如何不过度思考的情况下,平衡大模型的推理进化和用户对效率的需求?这是杨植麟几个月前在云栖大会上的提问,这个问题,还需要留给国内大模型厂商们继续解决。

作者:魏琳华 编辑:王一粟

本文由人人都是产品经理作者【光锥智能】,微信公众号:【光锥智能】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。