惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

云风的 BLOG
云风的 BLOG
V2EX - 技术
V2EX - 技术
T
Troy Hunt's Blog
TaoSecurity Blog
TaoSecurity Blog
Attack and Defense Labs
Attack and Defense Labs
SecWiki News
SecWiki News
M
MIT News - Artificial intelligence
N
News and Events Feed by Topic
Help Net Security
Help Net Security
IT之家
IT之家
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
博客园 - 聂微东
The GitHub Blog
The GitHub Blog
The Last Watchdog
The Last Watchdog
Martin Fowler
Martin Fowler
Hacker News: Ask HN
Hacker News: Ask HN
酷 壳 – CoolShell
酷 壳 – CoolShell
人人都是产品经理
人人都是产品经理
H
Heimdal Security Blog
B
Blog
Blog — PlanetScale
Blog — PlanetScale
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
Hacker News - Newest:
Hacker News - Newest: "LLM"
T
Threat Research - Cisco Blogs
I
InfoQ
腾讯CDC
L
LangChain Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
Know Your Adversary
Know Your Adversary
Cloudbric
Cloudbric
Project Zero
Project Zero
T
Tor Project blog
小众软件
小众软件
博客园 - 司徒正美
www.infosecurity-magazine.com
www.infosecurity-magazine.com
H
Help Net Security
Webroot Blog
Webroot Blog
量子位
NISL@THU
NISL@THU
Schneier on Security
Schneier on Security
Google Online Security Blog
Google Online Security Blog
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
月光博客
月光博客
宝玉的分享
宝玉的分享
V
V2EX
T
Tailwind CSS Blog
Spread Privacy
Spread Privacy
G
Google Developers Blog
K
Kaspersky official blog

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
自媒体人必备:文心一言、Kimi等4款AI大模型测评对比及推荐
李子木说运营 · 2024-04-28 · via 人人都是产品经理

现在,国内已经有海量大模型诞生,那么,哪款大模型的表现会更好?这篇文章里,作者站在自媒体人的角度,对四款大模型做了评估和对比,一起来看一下。

说到AI,很多人会想到ChatGPT,而我们现在也有许多好用的国产AI大模型。

在2023年的中国,8个月内诞生了238个大模型,阿里、华为、腾讯、京东、字节、360、科大讯飞等一众大厂纷纷下场,还有复旦、清华等高校机构加速研究,以及智谱AI、月之暗面等黑马出现。

这些海量AI大模型里,子木挑选了4款市面上反响比较好的、也是我常用的AI大模型进行评估对比,帮助你选择适合自己的国产AI大模型。

本文评估的4个AI大模型

文心一言4.0、通义千问、kimiAI、天工AI。

一、大语言模型的5个评估维度

对于AI大模型的评估,目前还没有权威、统一的评估维度,我根据文案创作的需求、使用习惯,建立了自己的AI大模型内容创作评估维度:

1. 语言质量与创意性

这是用AI创作中最关注的部分,体现AI写出来的内容质量。

它包括:

文本流畅度,用来评估AI生成的文案是否自然流畅,语法正确,符合人类日常交流习惯,我会用主题文章、简历撰写这两个题目来进行测试评估;

个性化内容,用来评估AI是否可以根据我们输入的个性化要求,比如语气、风格等等来定制文案,满足不同的创作需求,我会用不同人物介绍同一个事物的2个问题来进行测试评估。

2. 领域适应性

用来评估AI模型是否具备特定行业或领域的专业知识,能否生成相关性强、准确无误的文案内容,我比较关注的是新媒体、教育培训行业,所以我一般会用这两个行业的代表性问题来进行测试评估,这一块每个行业的问题不一样,大家可以根据自己的行业来设计问题。如果有需要的话,也可以提问或联系我交流。

3. 逻辑性

用来评估AI创作内容的逻辑性,我会用公务员考试常用的逻辑推理题,和故事的续写这两个问题来测试评估,逻辑推理题是看它的推理过程,结果是否正确,而故事的续写,看情节是否合理、人物的行为是否符合逻辑。

4. 时效性

时效性决定了AI生成内容时是否能用到最新的案例或事件、我们在用AI寻找资讯时是否能给到最新的信息。我会用最新的热点事件、1个月前、3个月前的3个不同问题,来评估测试AI的时效性。

5. 成本与易用性

AI作为一个辅助工具,是不是方便使用、使用成本如何,也是我们需要考虑的点。

二、4款国产大模型对比

1. 大模型简介

  1. 文心一言4.0:是百度推出的知识增强大语言模型,可以输出文本内容,也可以生成图片。
  2. 通义千问:是阿里云发布的千亿级参数大模型,可以分析文档,提炼文档的关键信息。
  3. KimiAI:月之暗面开发的大模型,可以上传PDF、word、ppt、图片等多种格式的文档,还可以分析网页内容,比较有意思的是,还能直接访问小红书的链接,抓取内容进行总结。
  4. 天工AI昆仑万维开发的双千亿级大语言模型,它的语言能力也很不错。

2. 文本流畅度对比

我把4个大模型写的“一花独放不是春”命题作文内容,给中学语文老师看了,满分60分,可以打到40分以上的程度,整体表现都还不错。

文心一言4.0的文笔流畅度更高,文彩也更好。对于主题的整体理解更加准确,没有什么逻辑问题,可以算得上是一篇文采不错的作文。

通义千问的流畅度也还不错,但是行文手法不如文心一言老练,比较中规中矩,相对文心一言4.0弱一些。

kimiAI的语言流畅度跟通义千问类似,但对于主题的理解相对弱一些,文章的整体性相对最弱,有一些段落偏离了题目本身的意思。

天工AI的行文流畅、老练,只是有一两个段落显得有些生搬硬套,前后意思不一致,有意思的是,天工AI表现出了比较强的政治素养,写出来的内容不像高考作文,而更像申论作文,做政务公文类的可以优先考虑天工AI。

打分:

  • 文心一言4.0 ⭐ ⭐ ⭐ ⭐ ⭐
  • 通义千问 ⭐ ⭐ ⭐ ⭐
  • kimi AI ⭐ ⭐ ⭐
  • 天工AI ⭐ ⭐ ⭐

3. 个性化内容对比

四个AI大模型都能够区分不同的口吻,同时,也能够区分不同的身份角色对于同一件事情所关注的不同的方面。

从8岁女孩的角度来介绍一辆新能源车,4个大模型都会把重点放在了车子是用电的、很神奇的描述上,也都用到了小孩子能理解的语言,用打比方的、形象化的描述来讲这个车子。其中,kimi AI对于角色年龄的把握比其他三个大模型稍微弱一点。

而从男企业家的角度来介绍新能源车,4个大模型都选择了将新能源车定义为这个企业家自己的产品,从更宏观的角度开始介绍这辆车,都表达了对于“未来出行”的创新和积极探索,侧重从技术的角度来介绍。

所以在个性化内容方面,4个大模型表现差不多,kimiAI要稍微弱一些。

打分:

  • 文心一言4.0 ⭐ ⭐ ⭐ ⭐ ⭐
  • 通义千问 ⭐ ⭐ ⭐ ⭐ ⭐
  • kimi AI ⭐ ⭐ ⭐ ⭐
  • 天工AI ⭐ ⭐ ⭐ ⭐ ⭐

4. 逻辑性对比

AI思考逻辑测试,内容是一道经典的公务员考试的行测问题。

4个AI都在很短的时间内给出正确答案,AI参加公务员考试,估计能秒杀99.9%的人。

在回答的内容中,文心一言给到的思路最详尽、看起来条理也相对最清晰,而天工AI给到的思路最简略,没有描述太多的思考过程,我认为这是相对欠缺的。

AI续写逻辑测试,内容一个故事的续写。

我在故事里设计了3个人物,发现藏宝地图的小明、他的好朋友小帅、妹妹小美,而故事也是围绕着寻宝的冒险之旅展开,这样,就能考察AI对于人物的设定,是否符合逻辑,以及故事线是否符合逻辑。

在这个测试中,文心一言的表现相对较好,发挥了较强的对于人物风格的把控能力,能够在故事中写人物对话,对话的风格也符合3个人物的性格设定,故事内容更长,相对更细致。

通义千问则发挥了更多的创造力,赋予了人物更多不同的特点,不过内容更概括简短。

kimi的表现与通义千问相似,也是通过赋予人物不同特点来塑造人物,对故事的描述更加细节一些,内容也稍长一点。

天工AI的内容则更加简短,没有把控不同的人物风格、也没有赋予人物不同的特点,表现相对是最弱的。

打分:

  • 文心一言4.0 ⭐ ⭐ ⭐ ⭐ ⭐
  • 通义千问 ⭐ ⭐ ⭐ ⭐
  • kimi AI ⭐ ⭐ ⭐ ⭐
  • 天工AI ⭐ ⭐ ⭐

5. 时效性对比

这是我非常非常看重的方面,在内容的创作中,引用时下的热点资讯,对于自媒体运营而言,是一种重要的能力,所以我们会需要时效性强的AI。我用最新、一个月前、三个月前的三个问题来进行测试。

在这一轮测试中,表现最弱的,反而是曾经的搜索巨头百度所开发的文心一言

对于2月29日前的最新热点“董宇辉为什么清空微博”这件事情的解释上,通义千问、kimi、天工三个大模型都给出了正确答案,只有文心一言给出的答案不正确。

对于一个月前哈尔滨的热点、三个月前的双十一销售额,则4个大模型都给出了正确答案。

同时,文心一言kimi AI都给出了答案所引用的参考资料,但文心一言给的参考资料,主要都来自百度系自己的内容,主要是好看视频、百家号,但这里存在一个bug:大语言模型不能解析视频内容,所以对于董宇辉为什么清空微博这件事情,文心一言虽然根据视频的标题,找到了好看视频中的参考资料,但是因为不能解析视频内容,找到参考资料也看不懂,就像找到一份天书,仍然只能根据自己的逻辑编造一个回答。

而同样给出了参考资料的kimi AI,对于董宇辉清空微博的事件,则引用了更新的、也更全面的资讯。它引用了最近1天的内容链接,引用来源包括腾讯网、知乎、澎湃媒体等,搜索来源比文心一言更广。

我在使用kimi AI搜索AI相关的内容时,它能给到的参考资料范围也很广、很精准,除了主要来源知乎之外,还会给到包括GitHub、人民数据、中国通信院,和一些可以公域访问的数据报告的链接,搜索能力和时效性是比较强的。

另外2个AI大模型,通义千问和天工AI虽然没有给到引用链接,但对3个问题的回答都是准确的。

所以在时效性上,kimiAI最强,它不仅能比较大范围地搜索到相关资讯,并且能给出引用链接,让我们能够直接通过链接,去判断这个内容的有效性、是否正确,通义千问和天工AI相对较弱,因为不能给出引用链接,对我们判断起来相对更困难一点,最弱的是文心一言。

打分:

  • 文心一言4.0 ⭐ ⭐ ⭐
  • 通义千问 ⭐ ⭐ ⭐ ⭐
  • kimi AI ⭐ ⭐ ⭐ ⭐ ⭐
  • 天工AI ⭐ ⭐ ⭐ ⭐

6. 成本易用性对比

目前,4个AI大模型都能直接通过网页链接访问到,kimiAI、文心一言、天工AI都能在微信小程序里使用,非常方便,通义千问虽然没有官方的小程序入口,但是使用网页端也是比较方便的。在成本上,除了文心一言4.0需要49.9元的月费,或588.8元的年费,其他3款都是暂时免费。

打分:

  • 文心一言4.0 ⭐ ⭐ ⭐ ⭐
  • 通义千问 ⭐ ⭐ ⭐ ⭐ ⭐
  • kimi AI ⭐ ⭐ ⭐ ⭐ ⭐
  • 天工AI ⭐ ⭐ ⭐ ⭐ ⭐

三、总结

在实际使用中,我一般会选择文心一言4.0加kimi AI的组合

用kimiAI搜索资料、拓展内容,它是我目前比较喜欢用的搜索方式,在向kimiAI提问时,我会先看它给的回答,然后看它给的参考资料,其中有哪些资料是权威、官方的,比如数据报告等,在这些资料中找一找是否有新的信息。这样的搜索方式,比百度、小红书、微信搜索更加精准快速。

文本创作时,我会倾向于用文心一言4.0,它生成的内容更加流畅、符合逻辑,内容质量相对更高。

专栏作家

李子木说运营,公众号:李子木说运营,人人都是产品经理专栏作家。自媒体及IP孵化顾问,前互联网大厂品牌项目负责人,致力于研究企业及个人品牌影响力与获客。

本文原创发布于人人都是产品经理,未经许可,禁止转载

题图来自 Unsplash,基于 CC0 协议

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。