惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

AI
AI
小众软件
小众软件
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
月光博客
月光博客
云风的 BLOG
云风的 BLOG
Recorded Future
Recorded Future
Apple Machine Learning Research
Apple Machine Learning Research
F
Fortinet All Blogs
罗磊的独立博客
爱范儿
爱范儿
GbyAI
GbyAI
Stack Overflow Blog
Stack Overflow Blog
MongoDB | Blog
MongoDB | Blog
D
Docker
C
CXSECURITY Database RSS Feed - CXSecurity.com
Spread Privacy
Spread Privacy
Recent Announcements
Recent Announcements
酷 壳 – CoolShell
酷 壳 – CoolShell
G
GRAHAM CLULEY
A
About on SuperTechFans
C
Cisco Blogs
The Register - Security
The Register - Security
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
B
Blog
Project Zero
Project Zero
V
V2EX
K
Kaspersky official blog
P
Privacy International News Feed
博客园 - 叶小钗
I
Intezer
T
Threatpost
The GitHub Blog
The GitHub Blog
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
V
Vulnerabilities – Threatpost
D
Darknet – Hacking Tools, Hacker News & Cyber Security
C
Cybersecurity and Infrastructure Security Agency CISA
Cyberwarzone
Cyberwarzone
Microsoft Azure Blog
Microsoft Azure Blog
N
Netflix TechBlog - Medium
Application and Cybersecurity Blog
Application and Cybersecurity Blog
博客园 - 【当耐特】
P
Proofpoint News Feed
L
Lohrmann on Cybersecurity
S
Schneier on Security
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
F
Full Disclosure
The Cloudflare Blog
P
Palo Alto Networks Blog
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
T
Tenable Blog

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
Kimi 的新模型,真的好用吗?
一泽Eze · 2025-07-15 · via 人人都是产品经理

别再只盯着 Claude 和 Gemini 了!一泽用 48 小时极限实测告诉你:刚发布的 Kimi K2 在代码生成、Agent 实战和成本三项上同时“杀疯了”。从一次成形的 3D 交互网页,到直接“夺舍”Claude Code 完成产品迭代,K2 不仅把国产模型的短板补齐,还把价格打到 Claude 的 1/5。

Kimi K2 发布了 2 天,我也测了足足 2 天。

如果仔细观察 Kimi 这次的官方发布稿,不难发现 K2 强调的重点:Agent 与 Coding 能力。

这是很有意思的转变:第一次把模型的通用 Agent 能力放到了极其重要的位置。

而在实测过程中,Kimi 也确实打破了很多刻板印象。

在部分任务中,比起 Claude、Gemini 毫不逊色,并大幅降低 Agent 任务的成本。

如果你有段时间没关注 Kimi,或者一直不太相信国产模型的 Agent / Coding 能力。

那么,本文也许能让你的看法有所改变。(甚至还能用 Kimi 代替 Claude Code,文中附教程)

照例先介绍下 Kimi K2

Kimi 这次只发了 1 款模型——Kimi K2。

我把官方发布介绍,总结了为了一图流,方便你快速浏览 K2 的特点:

关键点如下

1. 总参数 1T,激活参数 32B 的 MoE 模型

2. 主打代码能力、通用 Agent 任务

3. 在多项 benchmark 基准测试中,获得开源模型中的 SOTA 成绩

4. 完全开源;兼容 OpenAI、Anthropic API 格式

我确实一向不太看各种 BenchMark 跑分,纸面 SOTA 不如自己动手测几个场景。

所以,我也对于主打 Coding、Agent 的 Kimi K2,进行了详尽测试,也希望能帮你建立初步的模型预期。

实测 Kimi K2 表现

一个大模型,要完成一项 Agent 任务,往往需要强大的自主规划与迭代思考能力,以及调用工具做任务的能力。

而 Coding 能力正是 Agent 执行任务的基础,所以先对代码生成能力进行测试:

💻 代码生成:对比 Claude、Gemini,不落下风

AI Coding 领域,用户对模型的挑剔程度无疑是最高的。

大家只会去用最好、最强的模型。(如果没有特殊原因,放着最好的模型不用,就是给自己的 Coding 过程添堵。)

放眼整个 2025 上半年,开发者在用的 AI Coding 模型只有 1.5 个选择:

1. 绝对主力:Claude 3.7 → 4(Windsurf 被曝要被 OpenAI 收购时,有一批用户担心以后不能用 Claude,直接取消了订阅)

2. 偶尔用用的 Gemini 2.5 Pro(用来做 Coding 的方案规划不错;Gemini Cli 最近风评尚可)

所以,要验证模型的 Coding 能力如何,最直观的方式,还是直接和 Claude、Gemini 比一比。

1)生成 3D Html 山脉:初见 Kimi 新水平

Kimi 官方发布中,有一个测试用例表现很厉害:

好奇又将信将疑,到底是“只有 Kimi 这么强”,还是“其实 Claude、Gemini 都能做到”?

于是第 1 个 Case,就实测了这个 3D 山脉 Html 生成任务:创建一个 3D HTML 山脉场景,包含悬崖、河流和昼夜光照变化。支持拖动和缩放、动画过渡、真实感渐变色,并可切换等高线显示

以下是 Kimi K2、Claude 4 sonnet、Gemini 2.5 Pro 的对比效果,均按第一次生成结果呈现:

(为了确保测试强度拉满,Claude 是默认开启了 Extended-Thinking 模式)

  • Kimi:https://www.kimi.com/share/d1p0hqteik6gtjvsri30
  • Gemini:https://g.co/gemini/share/f7570f1cbfbe
  • Claude:https://claude.ai/share/b154de4a-cc25-4f8d-a963-34b8512560fd

令人惊异,Kimi 在此轮测试中,径直得到了三者中最好的效果:

  • Kimi:山脉走势美观、河流覆盖真实,有昼夜系统、真实光影
  • Claude:抽象的样式,丢失了河流
  • Gemini:有山有水,但效果同样不行

要知道在过往模型测试中,国内模型明显比海外好,是一件非常少见的现象,这点打破了我的刻板印象。

考虑到是官方自己选的 Case,所以还是继续上强度,测一些我自己的真实场景。

2)一图流总结万字长文:依然靠谱

这是一个很高频、实用的任务。也能让你的文章更加好看:

我的每个 AI 产品测试文章都会用 AI 根据文章全文,输出一图流的总结网页。基本只用 Claude、Gemini 生成。

Prompt 如下:

## 以下是我的文章:[粘贴文章内容]

## 任务我是 AI 科技评测博主,中立客观。请阅读我的文章中的要点,帮我用类似苹果发布会PPT的Bento Grid风格的视觉设计生成一个中文动态网页展示,具体要求为:

– 尽量在一页展示全部信息,背景为白色、文字和按钮颜色为纯黑色,高亮色为#4D6BFE

– 强调超大字体或数字突出核心要点,画面中有超大视觉元素强调重点,与小元素的比例形成反差

– 网页需要以响应式兼容更大的显示器宽度比如1920px及以上

– 中英文混用,中文大字体粗体,英文小字作为点缀

– 简洁的勾线图形化作为数据可视化或者配图元素

– 运用高亮色自身透明度渐变制造科技感,但是不同高亮色不要互相渐变

– 数据可以引用在线的图表组件,样式需要跟主题一致

– 使用HTML5、TailwindCSS 3.0+(通过CDN引入)和必要的JavaScript

– 使用专业图标库如Font Awesome或Material Icons(通过CDN引入)

– 避免使用emoji作为主要图标

– 不要省略内容要点

这看上去不复杂的任务,实际上考察了两个维度:

1. 准确识别长文本(我测的文章足足有上万字内容)中的内容逻辑,提炼高优先级信息,并重组为结构化表达

2. 根据内容情况,设计合理、美观的排版布局,并用前端代码实现网页

一开始对于不支持 thinking 推理的 Kimi ,在长内容提炼上,没抱有太大的期待。

而这是 Kimi K2、Claude 4 sonnet-thinking、Gemini 2.5 Pro 的表现:

  • Kimi:https://www.kimi.com/share/d1pgj4umcu0l65fkirag
  • Gemini:https://g.co/gemini/share/a71ade78c832
  • Claude:https://claude.ai/share/8e1c8641-97cd-4123-baab-9d8f3f1b6b2b

在整个过程中,除了 Gemini 一次性取得了较好的结果以外,

Kimi 也是一次性生成成功,初版少了些细节,让它增加一些内容细节,也顺利出了更详细的版本:

内容完全正确、表达更详尽、排版更合理。(我猜是因为没有 thinking 模式,在生成过程中对于内容的取舍,Kimi 会略吃亏)

反而是 Claude 4 sonnet-thinking,频频报错,经过 Debug 3 次才取得了完整网页,在布局、样式选用上也不太合理。

所以我当时还在即刻上发了帖子,表示意外:

Kimi K2 已经连续在我测的两个任务里,表现的都比 Claude 4 sonnet-thinking 好了。

甚至有点不敢下这个反“刻板印象”的结论。

这么整体测下来,其实也能看出:

Kimi K2 有审美了,代码生成任务也挺稳定。

模型本身进步很明显,大幅拉近了与国际 TOP 模型的差距,可能可以在日常 Coding 任务中作为不错的模型选择。

🤖 Agent 能力测试:在实战里,也能真干活了

但 Kimi K2 在单一文件的代码生成上表现惊艳,是否就能意味着它能胜任更复杂的 Agent 任务?

如 Claude Code、Cursor 等 Coding Agent,无不要求 Agentic 模型自主规划方案、理解项目 context、调用各类 tools 完成 Coding。

换句话说,Coding Agent 场景,是当下最适合考验 Agentic 模型能力的基准场景。

我刚好有个自己在做的产品:Chat Memo,拿来给 Kimi 好好上上强度 😈

于是,用 Kimi K2「夺舍」Claude Code(以下代称为 Kimi-cc),来执行一次真实需要开发迭代的任务:

从 0 理解 Chat Memo 项目,分析完整代码架构,并找到记忆列表卡片的功能与交互逻辑,按指定要求迭代。

(刚好我本周用 Trae + Claude 开发过这个任务,也正好用来比较双方差距)

先输入简单的需求提示:

如图,Claude Code 的 API URL 已是 Kimi 的地址

在 Prompt 发送后,可以看到,Kimi 在收到用户要求后,开始规划任务计划。

然后自主使用 Claude Code 内封装的工具,对完整的项目内容进行查找、分析,并对代码进行修改编写:

……Kimi,你为什么用 Claude 的工具这么熟练啊?总感觉有种 Claude 被 Kimi NTR 的感觉

整个过程很顺利,经过几分钟的 Coding 过程,“Kimi-cc”一次性执行完毕:

为了方便对比最终的 Agent 任务效果,我先展示下迭代之前的原版:

还有经过 Kimi-cc 自主一次性迭代后的版本和之前 Trae + Claude 4 sonnet 多轮提示后,开发的版本。

甚至我更喜欢 Kimi 的效果细节(hover 的交互样式更加合理,不知道你是否能看出来区别)。

而这项 Agent 任务的费用,我在 Kimi 开放平台看了下 API 用量,只要 5 毛钱。

值得注意的是,Claude Code 中的所有 Prompt、工具,都是为了 Claude AI 自身所开发封装的。

而 Kimi 作为一个外来 Agent 模型,能在未经适配的环境下,体现出了极强的泛化与适应能力,展现了一流的 Agentic 智力。

——说句“Kimi 通过自主使用 CC,实现了 Trae + Claude 4 sonnet 同样的 Coding 实战效果”,并不过分。

Kimi K2 夺舍 Claude Code 的方法,发现自 Github 社区,非官方用法。如感兴趣,下文也提供了详细的教程指引。

小结:Kimi K2 通过 Claude Code ,能稳定完成实际项目的 Coding Agent 任务。值得推荐读者针对自身情况,进一步测试体验。

Btw,你也可以通过 Cline ,接入 Kimi K2 干活。

🗂️ 更多测试:整体顺利,点赞

另外,我也继续用 Kimi Code 测试了很多其他的 Agent 任务,但受限于篇幅,不再一一列举过程。

直接呈现一些关键结果:

1)从 0 到 1,开发一款生死时速 Html 游戏

Kimi 的任务规划:

正如上文所言,毕竟 Kimi 用的是 Claude Code 的工具,很多 Prompt、参数的封装和 K2 其实并未做过适配。

在后续迭代测试时,有时会出现Invalid tool parameters的报错,导致任务进程中断,可以理解。也期待 Kimi 下次发布真正的 Kimi Code,充分发挥 K2 的 Agent 能力。

2)批处理本地文件,整合数据为表格

要求 Kimi 自行阅读 48 份 txt 文档,将每篇文档的元信息统一提取制表:

整体也很顺利:

Kimi 生成的 Markdown 文件内容如下:

数据内容没有任何问题。读取本地内容,进行数据处理的任务,同样通过了基础测试。

📎 附:如何用 Kimi K2 使用 Claude Code?

鉴于现在是 2025 年,我们可以用 AI+ 的安装方法——让 Kimi K2 全程指导你安装:

1)安装 Claude Code(如果未装)

1)打开 Kimi Chat,发送以下消息

参考以下网页,一步步指导我在 Mac 终端中安装该程序:[完整粘贴 Claude Code 官方设置文档:https://docs.anthropic.com/zh-CN/docs/claude-code/setup]

如:

Kimi 会回应你一份比官方文档清晰、易读很多的指导方案:

跟着照做就好。

2)如遇安装问题,不知如何处理?

也很简单。

比如这是出问题的最后一次命令记录 ⬇️

按如下方式粘贴发送给 Kimi:

我在这一步出现问题了,终端记录为:

[粘贴终端中最后一次命令记录]

即可得到下一步回应:

3)替换 Claude Code 为 Kimi Code,即可运行!

当安装完成、运行claude之前,我建议你把终端切到一个测试文件夹中(用于控制读写范围,CC 只能访问该路径下的内容)

cd [路径名称]

成功后,会显示出路径变化:

然后需要替换 Kimi 的 API,输入以下内容即可:

export ANTHROPIC_AUTH_TOKEN=[替换为你的 Moonshot API Key]

export ANTHROPIC_BASE_URL=https://api.moonshot.cn/anthropic

1.如无 Moonshot API Key ,需前往 https://platform.moonshot.cn/console/api-keys 创建并获取(没余额的话,先到「账户充值」充一点就好)

2.注意!如果你是在 moonshot.ai(海外站)生成的,则要把 ANTHROPIC_BASE_URL 替换为https://api.moonshot.ai/anthropic,不然就无法顺利运行

再运行claude,一切顺利即可看到 welcome 提示,

然后就可以直接输入自然语言,开始让 Kimi 替你试着干点活了。

不止如此:远比 Claude 便宜的价格,以及彻底的开源

还记得上面 Chat Memo 的迭代任务,只花了 0.5 元的 token 费用吗?

其实包含后文的全部测试,全部跑下来也只花了不到 1 美金。

是的,Kimi K2 这个 1T 总参数、32B 激活参数的 MoE 模型,不仅在能力上让人惊喜,在价格和开放性上也有着相当的诚意。

相比 Claude Sonnet 4 的 3 美金/百万 tokens,Kimi K2 只需要其 20% 的价格,即可换来接近的 Coding 表现:

每百万输入 tokens:4 元

每百万输出 tokens:16 元

也兼容 OpenAI 和 Anthropic 的 API 格式,可以无缝集成到现有的 Agent 程序里,大幅降低了开发者的迁移成本。

所以,除了普通用户可以在 https://www.kimi.com/ 中可以直接体验 K2 外,AI 应用公司们也能通过 API 低成本用 Kimi K2 来构造一些本土 Agent、Coding 应用了。

另外,月之暗面也在同一时间开源了 Kimi K2 的两个版本:

Kimi-K2-Base:未经过指令微调的基础预训练模型,适合需要进行深度自定义和学术研究的场景。Kimi-K2-Instruct:通用指令微调版本,在 Coding / Agent 任务中表现优异,开箱即用。

官方已将模型与权重文件开源至 Hugging Face:https://huggingface.co/moonshotai/Kimi-K2-Instruct

🎐 写在最后:Kimi K2,不止于“纸面 SOTA”

横向对比也好、真实场景实测也罢,我觉得可以下一个明确的结论了:

Kimi K2 并非只是在跑分上好看的模型。

在这两天贴近真实环境的测试中,Kimi 切实展现出了接近国际顶尖模型的 Agent / Coding 能力。

它的进步在两个关键维度上肉眼可见:

1. 代码能力不再是短板:无论是一次成型的 3D 动态山脉,还是准确理解上万字长文并生成 Bento Grid 风格一图流,Kimi K2 的代码生成质量和审美,都完全不输 Claude 和 Gemini。这直接打破了我对国产模型“不擅代码、审美一般”的刻板印象。

2. Agent 能力更是惊喜:在「Chat Memo」项目的真实迭代需求测试中,Kimi K2 仅凭 Claude Code 这个未经适配的 Agent 外壳,达到了需要 Trae + Claude 多轮 Prompt 才取得的同等开发结果。

它能从零开始自主理解项目架构、自主规划任务、并调用(非原生的)工具完成开发,已经证明了 Kimi K2 作为 一个 Agentic 模型的核心能力:一流的智力与出色的泛化能力。

(2025 年下半年,凭借越来越好用的国产开源 Agentic 模型,垂直 Agent 赛道无疑将真正卷出天际)

我也让 Kimi K2,自行阅读了本文,让 Kimi 按照它的理解生成了一份 PPT 和一图流总结(AI 自卖自夸),样式真的非常好看:

PPT:https://www.kimi.com/share/d1q4ha9l51j9hfaia26g

长图:https://www.kimi.com/share/d1praevaa0vadk8tesm0

大模型发展到 2025 年中这个阶段,仅靠简单的 Chat 问答测试,已经很难去评判模型水平的高低。

未来模型能力的较量,将发生在各个真实的项目里,发生在每一次 Context 理解、自主规划、工具调用、任务执行中。

届时,衡量是否选用一个模型的标准,将是一个更朴素、也更严苛的复合指标:综合可用性。它包含了三个核心维度:

  1. 质量:在我的目标任务上,它能做到什么程度?
  2. 效率:它完成任务的速度有多快、多稳定?
  3. 成本:完成这个结果,需要多少费用?

谁能让 AI 变得更好用、靠谱、便宜,谁就能在下一阶段的 AI Agent 应用浪潮中,赢得更广泛的开发者与用户。

而这一轮,Kimi K2 准备得相当不错。

感谢你的耐心阅读 🥰

如果这篇文章对你有所启发,也欢迎分享给你的朋友~

本文由人人都是产品经理作者【一泽Eze】,微信公众号:【一泽Eze】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Kimi官网截图