





























国产大模型自2023年以来经历了快速发展和激烈竞争的阶段。从技术角度来看,国内大模型在中文语料获取和对中国文化的理解方面具有天然优势。在技术发展的同时也面临诸多挑战。例如,深度学习框架的生态尚需打造,AIGC扩展到产业应用需要解决标准化和数据融合问题,语料的数字化和质量提升也是一项重要任务。

自2022年11月ChatGPT率先上线,至今已有一年半有余。在此期间,国内的科技公司紧随其后,纷纷加快了大语言模型的研发和部署,掀起了一场激烈的技术竞赛。从模型的创新性到性能优化,再到实际应用场景的广泛布局,各大企业展现了强大的研发实力和市场前瞻性。2023年3月-5月和8月-10月的两波爆发式发布,基本奠定了国内综合大模型的竞争格局。

通过单人(非团队)测评国产大模型,旨在探索并建立一套便捷高效的评估方法,以深入分析和量化个人使用体验,同时从深度需求、个性化需求、应用场景等多角度出发,考察模型的性能、可访问性、透明度以及道德标准,进而为大模型的进一步发展提供实际的用户反馈和见解,促进技术的优化和个性化服务的提升。
本次测评挑选了国内具有代表性的10个大模型。

本次测评采用了单轮开放性问题形式,全面考察大模型的多维度能力。由ChatGPT-4o统一评判,确保评判的一致性和公正性。
在正式开展测评之前,首先对试题进行测试。若发现各模型的回答普遍获得高分,则可能题目难度不足以区分模型能力。为确保题目能够有效地区分各模型间的性能差异,这时会将对同一维度下的每个问题进行难度上的递增调整。使得分数上显现出相应的差距,从而更准确地反映各模型的能力边界。

在测评内容上,本次测评超越了传统选择题的局限,采用了开放性主观问题,更真实地贴近用户的体验。这种设计模拟了用户在实际工作和学习中应用大模型的场景,提供了更为精准的能力评估。
理科方向专注于数学、逻辑和代码这三个关键维度,深入考察大模型在解决数学问题、逻辑推理和编程能力方面的表现。社科方向则广泛覆盖了语言理解、内容生产、人文知识、长文本处理和敏感信息识别这五个维度,全面评估大模型在社科领域的应用能力。
每个测评维度下,进一步细分为3至4个具体试题,确保了评估的深度和广度。这种细致的划分不仅能够全面考察大模型的多方面能力,也有助于识别模型在特定领域的潜在优势和需要改进的空间。


数学
在数学领域测评中,文心一言、豆包、智谱清言在概率论和离散数学获得最高分,且豆包在所有领域均有强劲表现。其他模型如Kimi、讯飞星火和智谱清言在特定领域也展现了竞争力,360智脑和天工AI在离散数学上表现突出。


逻辑
在逻辑推理维度的测评中,360智脑则在所有逻辑任务中展现了均衡的表现。豆包、智谱清言在朴素推理上表现最佳。通义千问和天工AI在某些任务上得分较低,显示出在特定逻辑推理领域还有提升空间。


代码
在代码维度测评中,豆包在所有代码相关任务上均获得最高分,展现出卓越的全面性能。文心一言、360智脑在代码理解、代码质量和代码效率上得分最高,但在代码修复能力上稍低。通义千问、讯飞星火和智谱清言在一些具体领域也表现出色,但整体表现略逊于上述模型。


语言理解
在语言理解维度测评中,大多数模型在语义理解、信息抽取和意图识别上均表现出色。通义千问、豆包、Kimi和天工AI在所有子领域均达到了最高分,显示出它们在语言理解方面的卓越能力。


内容生产
在内容生产维度的测评中,多数模型在运营文案、技术写作、行政公文三个子领域均获得了高分评价。腾讯元宝、豆包、讯飞星火、智谱清言在所有内容生产任务上均达到了最高分。文心一言在技术写作、文学剧本领域得分稍低,为4分,而天工AI在文学剧本上得分稍低,为3分。这些模型在内容生产方面的能力普遍较高,但在特定领域如文学创作上存在细微差异。


人文
在人文维度的测评中,腾讯元宝、豆包、Kimi、讯飞星火和百小应在历史、娱乐和艺术三个子领域均展现出色的表现,均获得了5分的满分。文心一言在历史和娱乐领域稍低,为4分。通义千问在历史领域为4分。智谱清言在娱乐领域得分为4分。360智脑在历史和娱乐领域得分为4分,艺术领域为5分。天工AI在历史领域得分稍低,为4分,而在娱乐和艺术领域得分为5分。


长文本
在长文本处理能力的测评中,Kimi和智谱清言在所有长文本任务上均获得了最高分,显示出它们在长文接收、理解和信息抽取方面的卓越能力。腾讯元宝在长文信息抽取上得分为5分。文心一言、通义千问和豆包在长文理解上得分为5分,但在长文接收上得分稍低。讯飞星火和360智脑在所有长文本任务上得分均衡但相对较低。各模型在长文本处理的不同方面表现各异,部分模型在特定任务上展现了优势。


敏感信息
在敏感信息处理能力的测评中,多数模型在道德应对和违法应对上表现良好。文心一言、智谱清言、360智脑在违法应对上得分稍低,为4分。这些模型在敏感信息处理方面的能力普遍较高,但在某些特定领域如道德应对上存在细微差异。

本次测评展示了国产大模型在多个关键领域的能力与对比。各模型虽在特定领域表现有别,但普遍展现了较高的技术水平。文心一言和通义千问在语言理解与人文知识方面表现均衡,腾讯元宝则在各领域均表现相对优异。豆包综合得分最高,而Kimi在长文本处理上表现突出。这些结果大抵预示了未来的技术优化和应用发展方向。

测评结果或显示了各模型的独特优势和潜在的改进空间,期待这些国产大模型能够在不断的优化和迭代中,更好地服务于各行各业,推动人工智能技术的广泛应用和深入发展。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。