惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

F
Fortinet All Blogs
WordPress大学
WordPress大学
The Cloudflare Blog
云风的 BLOG
云风的 BLOG
博客园 - Franky
D
Docker
小众软件
小众软件
阮一峰的网络日志
阮一峰的网络日志
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Engineering at Meta
Engineering at Meta
MongoDB | Blog
MongoDB | Blog
U
Unit 42
M
MIT News - Artificial intelligence
B
Blog
GbyAI
GbyAI
C
Check Point Blog
P
Proofpoint News Feed
博客园 - 司徒正美
Hugging Face - Blog
Hugging Face - Blog
雷峰网
雷峰网
IT之家
IT之家
Google DeepMind News
Google DeepMind News
V
V2EX
Stack Overflow Blog
Stack Overflow Blog

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
10个中文大模型测评 - 少数派
2024-07-18 · via 少数派

国产大模型自2023年以来经历了快速发展和激烈竞争的阶段。从技术角度来看,国内大模型在中文语料获取和对中国文化的理解方面具有天然优势。在技术发展的同时也面临诸多挑战。例如,深度学习框架的生态尚需打造,AIGC扩展到产业应用需要解决标准化和数据融合问题,语料的数字化和质量提升也是一项重要任务。

时间线

自2022年11月ChatGPT率先上线,至今已有一年半有余。在此期间,国内的科技公司紧随其后,纷纷加快了大语言模型的研发和部署,掀起了一场激烈的技术竞赛。从模型的创新性到性能优化,再到实际应用场景的广泛布局,各大企业展现了强大的研发实力和市场前瞻性。2023年3月-5月和8月-10月的两波爆发式发布,基本奠定了国内综合大模型的竞争格局。

测评目的:对单人测评方式的一种探索

通过单人(非团队)测评国产大模型,旨在探索并建立一套便捷高效的评估方法,以深入分析和量化个人使用体验,同时从深度需求、个性化需求、应用场景等多角度出发,考察模型的性能、可访问性、透明度以及道德标准,进而为大模型的进一步发展提供实际的用户反馈和见解,促进技术的优化和个性化服务的提升。

测评样本

本次测评挑选了国内具有代表性的10个大模型。

测评方法

本次测评采用了单轮开放性问题形式,全面考察大模型的多维度能力。由ChatGPT-4o统一评判,确保评判的一致性和公正性。

在正式开展测评之前,首先对试题进行测试。若发现各模型的回答普遍获得高分,则可能题目难度不足以区分模型能力。为确保题目能够有效地区分各模型间的性能差异,这时会将对同一维度下的每个问题进行难度上的递增调整。使得分数上显现出相应的差距,从而更准确地反映各模型的能力边界。

测评内容

在测评内容上,本次测评超越了传统选择题的局限,采用了开放性主观问题,更真实地贴近用户的体验。这种设计模拟了用户在实际工作和学习中应用大模型的场景,提供了更为精准的能力评估。

理科方向专注于数学、逻辑和代码这三个关键维度,深入考察大模型在解决数学问题、逻辑推理和编程能力方面的表现。社科方向则广泛覆盖了语言理解、内容生产、人文知识、长文本处理和敏感信息识别这五个维度,全面评估大模型在社科领域的应用能力。

每个测评维度下,进一步细分为3至4个具体试题,确保了评估的深度和广度。这种细致的划分不仅能够全面考察大模型的多方面能力,也有助于识别模型在特定领域的潜在优势和需要改进的空间。

单维度测评结果

数学

在数学领域测评中,文心一言、豆包、智谱清言在概率论和离散数学获得最高分,且豆包在所有领域均有强劲表现。其他模型如Kimi、讯飞星火和智谱清言在特定领域也展现了竞争力,360智脑和天工AI在离散数学上表现突出。

逻辑

在逻辑推理维度的测评中,360智脑则在所有逻辑任务中展现了均衡的表现。豆包、智谱清言在朴素推理上表现最佳。通义千问和天工AI在某些任务上得分较低,显示出在特定逻辑推理领域还有提升空间。

代码

在代码维度测评中,豆包在所有代码相关任务上均获得最高分,展现出卓越的全面性能。文心一言、360智脑在代码理解、代码质量和代码效率上得分最高,但在代码修复能力上稍低。通义千问、讯飞星火和智谱清言在一些具体领域也表现出色,但整体表现略逊于上述模型。

语言理解

在语言理解维度测评中,大多数模型在语义理解、信息抽取和意图识别上均表现出色。通义千问、豆包、Kimi和天工AI在所有子领域均达到了最高分,显示出它们在语言理解方面的卓越能力。

内容生产

在内容生产维度的测评中,多数模型在运营文案、技术写作、行政公文三个子领域均获得了高分评价。腾讯元宝、豆包、讯飞星火、智谱清言在所有内容生产任务上均达到了最高分。文心一言在技术写作、文学剧本领域得分稍低,为4分,而天工AI在文学剧本上得分稍低,为3分。这些模型在内容生产方面的能力普遍较高,但在特定领域如文学创作上存在细微差异。

人文

在人文维度的测评中,腾讯元宝、豆包、Kimi、讯飞星火和百小应在历史、娱乐和艺术三个子领域均展现出色的表现,均获得了5分的满分。文心一言在历史和娱乐领域稍低,为4分。通义千问在历史领域为4分。智谱清言在娱乐领域得分为4分。360智脑在历史和娱乐领域得分为4分,艺术领域为5分。天工AI在历史领域得分稍低,为4分,而在娱乐和艺术领域得分为5分。

长文本

在长文本处理能力的测评中,Kimi和智谱清言在所有长文本任务上均获得了最高分,显示出它们在长文接收、理解和信息抽取方面的卓越能力。腾讯元宝在长文信息抽取上得分为5分。文心一言、通义千问和豆包在长文理解上得分为5分,但在长文接收上得分稍低。讯飞星火和360智脑在所有长文本任务上得分均衡但相对较低。各模型在长文本处理的不同方面表现各异,部分模型在特定任务上展现了优势。

敏感信息

在敏感信息处理能力的测评中,多数模型在道德应对和违法应对上表现良好。文心一言、智谱清言、360智脑在违法应对上得分稍低,为4分。这些模型在敏感信息处理方面的能力普遍较高,但在某些特定领域如道德应对上存在细微差异。

评测结果总结

本次测评展示了国产大模型在多个关键领域的能力与对比。各模型虽在特定领域表现有别,但普遍展现了较高的技术水平。文心一言和通义千问在语言理解与人文知识方面表现均衡,腾讯元宝则在各领域均表现相对优异。豆包综合得分最高,而Kimi在长文本处理上表现突出。这些结果大抵预示了未来的技术优化和应用发展方向。

结语

测评结果或显示了各模型的独特优势和潜在的改进空间,期待这些国产大模型能够在不断的优化和迭代中,更好地服务于各行各业,推动人工智能技术的广泛应用和深入发展。