惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

大猫的无限游戏
大猫的无限游戏
Webroot Blog
Webroot Blog
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
T
Threat Research - Cisco Blogs
V2EX - 技术
V2EX - 技术
L
LINUX DO - 热门话题
Google DeepMind News
Google DeepMind News
Recorded Future
Recorded Future
S
Schneier on Security
I
InfoQ
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
The GitHub Blog
The GitHub Blog
S
Security @ Cisco Blogs
O
OpenAI News
W
WeLiveSecurity
Vercel News
Vercel News
阮一峰的网络日志
阮一峰的网络日志
Simon Willison's Weblog
Simon Willison's Weblog
人人都是产品经理
人人都是产品经理
Cloudbric
Cloudbric
The Last Watchdog
The Last Watchdog
The Hacker News
The Hacker News
Google Online Security Blog
Google Online Security Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
GbyAI
GbyAI
NISL@THU
NISL@THU
T
Tailwind CSS Blog
V
Visual Studio Blog
PCI Perspectives
PCI Perspectives
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
Jina AI
Jina AI
D
DataBreaches.Net
B
Blog RSS Feed
N
News and Events Feed by Topic
N
News and Events Feed by Topic
H
Heimdal Security Blog
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
腾讯CDC
Latest news
Latest news
V
Vulnerabilities – Threatpost
Hacker News: Ask HN
Hacker News: Ask HN
WordPress大学
WordPress大学
V
V2EX
aimingoo的专栏
aimingoo的专栏
博客园 - 司徒正美
Apple Machine Learning Research
Apple Machine Learning Research
D
Darknet – Hacking Tools, Hacker News & Cyber Security
The Register - Security
The Register - Security
Help Net Security
Help Net Security

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派 万字剖析:千问App深度体验报告(2026) - 少数派 在2026年,如何真正防止别人抄袭你的作品 - 少数派 怎么用 50 块搭个 AI 语音助手?我踩了 3 天坑 - 少数派 YeeroAI:让 AI 对话真正成为知识管理的一部分 - 少数派 爬泰山 - 少数派 「旅图显影」 App 更新:这次,我们补上了一点「手感」 - 少数派 假期出门太折磨?我的 23 条经验帮你规划惬意旅行 - 少数派 工作流会变吗 - 少数派 Claude Opus 4.6 怎么用最省钱?我测了 5 种方案 - 少数派 GPT Image 2 让图文并茂不再稀罕 - 少数派 用户侧出发——什么是AI,我要不要学习? - 少数派 找片、转存、整理、播放一条龙!让你的付费网盘值回票价 - 少数派 欢迎试用!日课一问2.0插件 - 少数派 自己做的MDeditor,原本想购买 Typora 试了两次支付不成功,干脆自己做一个 - 少数派 vibe coding了一个 3MB 的小工具,让 ~/Downloads 彻底告别混乱 - 少数派 因为受不了 Mac 的风扇策略,我做了一个风扇控制工具 - 少数派 别只怪模型 - 少数派 Warp 终端的 AI 功能怎么用?我测了一周的体验 - 少数派 AI 写代码老是出 bug?这 5 个配置我后悔没早知道 - 少数派 「新玩意」苹果出相机可能就这样:Sigma BF + 45mm F2.8 DG Contemporary - 少数派 一个面向2030年的AI操作系统是什么样子的:浅谈cola这款有灵魂的Agent - 少数派 别只看写代码 - 少数派 每天解决10个问题,还是一口气攻坚解决400个? - 少数派 AI 交易机器人怎么搭?我用 Claude 跑了一周实盘 - 少数派 Maptoposter Online:把你爱的城市画成艺术海报 - 少数派 Function Calling 怎么用?我测了 3 个模型发现差距真大 - 少数派 Legend Talk:我做了个 AI 圆桌,让 160 位思想家围着你的问题转 - 少数派 如何找到自己的蓝方?在小县城寻找压力测试 - 少数派 语音输入与软件接口|2026年聊AI时,我们都聊些什么(上) - 少数派 混动已经卖爆,纯电又来补刀——钛7闪充版简直“不讲武德” - 少数派 本月玩什么|朋友收藏、识质存在、沙罗周期 - 少数派 为什么要每天坚持输出? - 少数派 Claude API 挂了好几个小时,你的项目有备用方案吗? - 少数派 Function Calling 没你想的复杂——我用它做了个有点用的工具 - 少数派 登录系统立即播放视频或者图片音乐的软件 - 少数派 我为什么创建 FlipHTML5 下载工具 - 少数派 残局没电?多品牌外设电量统一管理软件EasyBluetooth已支持RTSS游戏内显示以及AIDA64 - 少数派 前往通义路的路 - 少数派 太好看了,媲美Sun的个人导航页,NAS部署星云门户 - 少数派 乌黑嘴唇“一键检测”上线了 - 少数派 派早报:Claude AI 接入多个创意软件生态、FILCO 生产方接手品牌等 - 少数派 【更新】BearCLI、Claude 连接器与 MCP 服务器 - 少数派 记了上千条流水,还是看不懂财务?我做了一个让 AI 读懂账本的工作台 - 少数派 MINI R56 升级原厂 Sport 模式 - 少数派 新玩意 | 一棵柠檬树(仿真版) - 少数派 Momenta的“物理AI”野望,需迈过“含摩量”这道关 - 少数派 网页直接投屏控制手机!NAS一键部署PandaScrcpy,流畅丝滑可远程。 - 少数派 众测|邀你一同探索随身 AI 硬件入口 YoooClaw C·ONE - 少数派 2050大会:分享时间是真诚 参会记 - 少数派 iPad 赋能电影创作:国内首部宣纸手绘长片《燃比娃》的幕后故事 - 少数派 AI的审美:我用 8 个大模型给 100 张旅行照片打分 - 少数派 普通人如何破圈?去参加一个本地协会 - 少数派 把极空间的图标全换了,主题DIY全攻略打造你的专属NAS桌面 - 少数派 电子便签墙,帮你实现便签自由 - 少数派 我如何用三个 CLI 工具取代文档创建需求 - 少数派 原来真的有人可以玩一辈子 - 少数派 社区速递 139 | 派友热议三月买了啥、复古单反尼康 Df 体验 - 少数派 06 作品的赏析与评价 - 少数派 TDS REVIEW|索尼 WF-1000XM6 降噪真无线耳机体验 - 少数派 35.98万起售的第二代腾势D9,我看重的不是堆料,而是不凑合 - 少数派 鼠须管 Squirrel 皮肤配置指北 - 少数派 从watch ultra2换到redmi watch6 - 少数派 派早报:阿里巴巴发布视频生成模型 HappyHorse 1.0 等 - 少数派 别迷信1M - 少数派 家人们天塌了!网盘“大封杀”,多个渠道多条路,NAS部署PanHub - 少数派 AI与人勾心斗角!NAS一键部署AI狼人杀,假日休闲必备。 - 少数派 电商必备!Comfyui工作流批量生图插件,一次生成12张!支持Nano banana pro模型 - 少数派 Comfyui工作流配置Gpt-image-2模型教程,0.03/张 - 少数派 OpenClaw第三方APi怎么配置?可使用Gpt-image-2模型 - 少数派 会员社区话题精选 Ep. 103 - 少数派
10个中文大模型测评 - 少数派
2024-07-18 · via 少数派

国产大模型自2023年以来经历了快速发展和激烈竞争的阶段。从技术角度来看,国内大模型在中文语料获取和对中国文化的理解方面具有天然优势。在技术发展的同时也面临诸多挑战。例如,深度学习框架的生态尚需打造,AIGC扩展到产业应用需要解决标准化和数据融合问题,语料的数字化和质量提升也是一项重要任务。

时间线

自2022年11月ChatGPT率先上线,至今已有一年半有余。在此期间,国内的科技公司紧随其后,纷纷加快了大语言模型的研发和部署,掀起了一场激烈的技术竞赛。从模型的创新性到性能优化,再到实际应用场景的广泛布局,各大企业展现了强大的研发实力和市场前瞻性。2023年3月-5月和8月-10月的两波爆发式发布,基本奠定了国内综合大模型的竞争格局。

测评目的:对单人测评方式的一种探索

通过单人(非团队)测评国产大模型,旨在探索并建立一套便捷高效的评估方法,以深入分析和量化个人使用体验,同时从深度需求、个性化需求、应用场景等多角度出发,考察模型的性能、可访问性、透明度以及道德标准,进而为大模型的进一步发展提供实际的用户反馈和见解,促进技术的优化和个性化服务的提升。

测评样本

本次测评挑选了国内具有代表性的10个大模型。

测评方法

本次测评采用了单轮开放性问题形式,全面考察大模型的多维度能力。由ChatGPT-4o统一评判,确保评判的一致性和公正性。

在正式开展测评之前,首先对试题进行测试。若发现各模型的回答普遍获得高分,则可能题目难度不足以区分模型能力。为确保题目能够有效地区分各模型间的性能差异,这时会将对同一维度下的每个问题进行难度上的递增调整。使得分数上显现出相应的差距,从而更准确地反映各模型的能力边界。

测评内容

在测评内容上,本次测评超越了传统选择题的局限,采用了开放性主观问题,更真实地贴近用户的体验。这种设计模拟了用户在实际工作和学习中应用大模型的场景,提供了更为精准的能力评估。

理科方向专注于数学、逻辑和代码这三个关键维度,深入考察大模型在解决数学问题、逻辑推理和编程能力方面的表现。社科方向则广泛覆盖了语言理解、内容生产、人文知识、长文本处理和敏感信息识别这五个维度,全面评估大模型在社科领域的应用能力。

每个测评维度下,进一步细分为3至4个具体试题,确保了评估的深度和广度。这种细致的划分不仅能够全面考察大模型的多方面能力,也有助于识别模型在特定领域的潜在优势和需要改进的空间。

单维度测评结果

数学

在数学领域测评中,文心一言、豆包、智谱清言在概率论和离散数学获得最高分,且豆包在所有领域均有强劲表现。其他模型如Kimi、讯飞星火和智谱清言在特定领域也展现了竞争力,360智脑和天工AI在离散数学上表现突出。

逻辑

在逻辑推理维度的测评中,360智脑则在所有逻辑任务中展现了均衡的表现。豆包、智谱清言在朴素推理上表现最佳。通义千问和天工AI在某些任务上得分较低,显示出在特定逻辑推理领域还有提升空间。

代码

在代码维度测评中,豆包在所有代码相关任务上均获得最高分,展现出卓越的全面性能。文心一言、360智脑在代码理解、代码质量和代码效率上得分最高,但在代码修复能力上稍低。通义千问、讯飞星火和智谱清言在一些具体领域也表现出色,但整体表现略逊于上述模型。

语言理解

在语言理解维度测评中,大多数模型在语义理解、信息抽取和意图识别上均表现出色。通义千问、豆包、Kimi和天工AI在所有子领域均达到了最高分,显示出它们在语言理解方面的卓越能力。

内容生产

在内容生产维度的测评中,多数模型在运营文案、技术写作、行政公文三个子领域均获得了高分评价。腾讯元宝、豆包、讯飞星火、智谱清言在所有内容生产任务上均达到了最高分。文心一言在技术写作、文学剧本领域得分稍低,为4分,而天工AI在文学剧本上得分稍低,为3分。这些模型在内容生产方面的能力普遍较高,但在特定领域如文学创作上存在细微差异。

人文

在人文维度的测评中,腾讯元宝、豆包、Kimi、讯飞星火和百小应在历史、娱乐和艺术三个子领域均展现出色的表现,均获得了5分的满分。文心一言在历史和娱乐领域稍低,为4分。通义千问在历史领域为4分。智谱清言在娱乐领域得分为4分。360智脑在历史和娱乐领域得分为4分,艺术领域为5分。天工AI在历史领域得分稍低,为4分,而在娱乐和艺术领域得分为5分。

长文本

在长文本处理能力的测评中,Kimi和智谱清言在所有长文本任务上均获得了最高分,显示出它们在长文接收、理解和信息抽取方面的卓越能力。腾讯元宝在长文信息抽取上得分为5分。文心一言、通义千问和豆包在长文理解上得分为5分,但在长文接收上得分稍低。讯飞星火和360智脑在所有长文本任务上得分均衡但相对较低。各模型在长文本处理的不同方面表现各异,部分模型在特定任务上展现了优势。

敏感信息

在敏感信息处理能力的测评中,多数模型在道德应对和违法应对上表现良好。文心一言、智谱清言、360智脑在违法应对上得分稍低,为4分。这些模型在敏感信息处理方面的能力普遍较高,但在某些特定领域如道德应对上存在细微差异。

评测结果总结

本次测评展示了国产大模型在多个关键领域的能力与对比。各模型虽在特定领域表现有别,但普遍展现了较高的技术水平。文心一言和通义千问在语言理解与人文知识方面表现均衡,腾讯元宝则在各领域均表现相对优异。豆包综合得分最高,而Kimi在长文本处理上表现突出。这些结果大抵预示了未来的技术优化和应用发展方向。

结语

测评结果或显示了各模型的独特优势和潜在的改进空间,期待这些国产大模型能够在不断的优化和迭代中,更好地服务于各行各业,推动人工智能技术的广泛应用和深入发展。