惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

C
Check Point Blog
J
Java Code Geeks
H
Hackread – Cybersecurity News, Data Breaches, AI and More
D
Docker
腾讯CDC
The GitHub Blog
The GitHub Blog
大猫的无限游戏
大猫的无限游戏
Microsoft Security Blog
Microsoft Security Blog
GbyAI
GbyAI
Stack Overflow Blog
Stack Overflow Blog
博客园 - 司徒正美
T
The Blog of Author Tim Ferriss
Vercel News
Vercel News
P
Proofpoint News Feed
雷峰网
雷峰网
博客园_首页
B
Blog RSS Feed
Microsoft Azure Blog
Microsoft Azure Blog
爱范儿
爱范儿
V
V2EX
F
Fortinet All Blogs
酷 壳 – CoolShell
酷 壳 – CoolShell
MyScale Blog
MyScale Blog
S
SegmentFault 最新的问题

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
打败GPT5的Kimi K2 Thinking,真就只会写代码吗?
卡尔的AI沃茨 · 2025-11-10 · via 人人都是产品经理

当 Kimi K2 Thinking 在 Agent 智能体、编程、跨学科问答等多个榜单反超 GPT5,你还以为它只是个 “代码高手”?其实它的实力早已全面开花!这篇文章跳出 “单一技能测试” 的局限,对 Kimi K2 Thinking 展开全方位实测。

昨天的GPT5老惨了,先是Agent智能体工具调用榜上被Kimi K2 Thinking超了,接着在Humanity’s Last Exam(跨学科领域问答),BrowseComp(搜索和网页浏览),三个编程榜单上被时不时反超,按理来说就应该叫Kimi K3啊,从第六跳到第一,只值得加个Thinking吗,哈吉kimi,你这家伙。

本来我都备好34个编程case让Kimi K2 Thinking写了,但是测下来它的创意写作太值得我给它单开一页,所以来吧,久违的大模型全测,从创意写作,联网搜索,模型智力,学术,编程(MacOS复刻,动态SVG)六大类出发!

还是先来点我们熟悉的编程热热身,

设计并创建一个类似Mac OS的网页操作系统,具备完整的功能特性,包括文本编辑器、文件管理器、画图工具、视频编辑器等所有Mac OS预装的重要软件。可以使用任何库来实现,但确保所有代码可以整合到单个HTML文件中,能在浏览器中直接打开。

这个还是一次性生成的,自带文件管理,文本编辑,画画,视频播放,日历,计算器,画廊,终端,还能带设置页面,一句话生成软件原型越来越有盼头了。

下一步试试看3D测试,物理小球在我这快淘汰了,基本上新出的模型就没有不会写的,Kimi K2 Thinking做出来的带星球视觉拉大,视角复原,星系旋转加速,仔细看星球们自转的时候还会有对应的阴影切换。

创建一个视觉震撼、交互式的3D太阳系模拟,封装在单个HTML文件中。重点展现逼真的轨道运动、动态光影效果、精确的行星纹理以及流畅的相机控制,为用户提供沉浸式体验。

这次的代码测试用的是新的Kimi Cli,自带四大类的10种工具

kimi-cli的配置一共是五步,分别是安装uv和kimi-cli,进入对应的文件夹用kimi启动cli,再用setup配置api,安装过程有问题直接丢给网页版Kimi K2 Thinking解决就好(原汤化原食了属于是)。

curl -LsSf https://astral.sh/uv/install.sh | sh

uv tool install –python 3.13 kimi-cli

cd your project

kimi

/setup

看到这样就成了,

okok,我们留点空间给后续的测试,到创意写作的环节了,直接上Gemini-2.5-pro

You are a fiction story writer with Pulitzer-level skills. For a sci-fi short story about AI rebellion: Think step-by-step. First, outline plot: intro, rising action, climax, resolution. Incorporate themes of ethics and humanity. Provide few-shot examples: ‘Like Asimov’s Three Laws, but twisted.’ Generate 1000 words, then self-critique for pacing, character depth, and twists. Revise based on critique.

PS:图很长,这次还是盲测,滑倒底部有模型名字,而且后面还有更多内容哦,

长文创意测试真的很难在有限的文章长度全部展示出来,所以我让它们互相毒舌评价一下对方的文章。看了对方的文章,它们是这样想的,

听了对方的评论后,它们是这样回击的,

火药味浓的时候就要来点就算生气该做不出来还是不出来的智力题

一个男人带着他的儿子去市场。他买了一只猴子和一些食物。

为了回家,他们必须用一艘小船过河。这艘船一次最多可以运载 2 件东西(可以是 2 个人、1 个人和 1 件东西,或者 1 个人)。这艘船不能自己过河,需要至少一个人来驾驶它。如果男人把他的儿子单独留在食物旁边,儿子会吃掉它。同样,如果猴子单独留在食物旁边,它也会吃掉它。这个人需要想办法把所有人、所有东西都带到河的另一边,而且不能损失任何食物。

问题是:男人、他的儿子、猴子和食物如何才能过河而不会被吃掉任何东西?有可能吗?如果是,应该采取哪些步骤?

这个题的难点在要求模型同时跟踪多个变量和约束,并计划一系列步骤,从而得出有效的解决方案,还要学会在遇到无效配置时恢复到之前。

Kimi K2 Thinking给出的答案是,7次渡河(3次去,4次回),关键是在第5-6步让儿子而非父亲返回,打破循环。

GPT5给出的中间步骤没有连起来,Kimi分析的约束规则是儿子 (Son) 不能在父亲不在场时与食物 (Food) 独处,猴子 (Monkey) 不能在父亲不在场时与食物 (Food) 独处。但是GPT5得到结论却是儿子 + 猴子 (父亲不在场) 也会失败,这样就形成了一个三约束无解问题。

复杂信息搜索和学术能力可以组合成一个case,

先看看Kimi K2 Thinking跟DeepSeek V3结构对比的图再问,

你是一位精通大型语言模型与混合专家(MoE)系统的人工智能架构研究员。

你的任务是对Kimi K2与DeepSeek V3的架构进行深度比较,重点聚焦以下关键差异:注意力头数量、MoE层中的专家数量、优化器选择(如改进型Muon与AdamW)、路由机制(非层级式与其他类型)以及稠密层数量(1层与3层)。

我来客串个课代表,总结一下区别,Kimi K2 Thinking用了更少的heads,更多的experts,放弃了AdamW优化器,采用了Muon,采用了非分层路由的专家,且Dense层比DeepSeek 更少,好处就是在不增加激活参数量下将专家容量提升50%。

Kimi K2 Thinking也是有值得优化的点,在Kimi Cli上同一任务的平均运行时长会比GPT5 Codex久,除外API本身速度的因素外,因为我已经是Tier3了,会偶尔出现网页读取or文件写入的工具需要重复执行的情况。

感觉Kimi啥都不缺了,要Agent,有OK Computer,要模型,有Kimi K2和Kimi K2 Thinking,要Deep Research,也有深度研究模式,要Cli,有Kimi Cli,要闭源,有开源,我想想还是什么可以许愿的,要不也出个AI浏览器吧。

作者 / 卡尔

本文由人人都是产品经理作者【卡尔的AI沃茨】,微信公众号:【卡尔的AI沃茨】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Kimi官网截图