惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
SegmentFault 最新的问题
G
Google Developers Blog
H
Help Net Security
月光博客
月光博客
阮一峰的网络日志
阮一峰的网络日志
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
P
Proofpoint News Feed
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
B
Blog RSS Feed
爱范儿
爱范儿
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 三生石上(FineUI控件)
大猫的无限游戏
大猫的无限游戏
人人都是产品经理
人人都是产品经理
GbyAI
GbyAI
D
Docker
Hugging Face - Blog
Hugging Face - Blog
I
InfoQ
博客园 - 司徒正美
Last Week in AI
Last Week in AI
Microsoft Security Blog
Microsoft Security Blog
美团技术团队
Stack Overflow Blog
Stack Overflow Blog
M
MIT News - Artificial intelligence

博客园 - 慕容木木

DeepSeek Harness - DeepSeek 开源 Agent 运行时底座,万物皆插件,7400+ Star 一日爆火 如何调整3D打印的松紧? 3D耗材拉丝需要干燥的方法 WeMD - 更优雅的 Markdown 公众号排版工具,一键复制到微信 【免费软件】Motrix Next - 全能下载神器回归,体积缩小4倍、迅雷替代 【免费软件】Recordly - 开源录屏神器,一键制作专业演示视频 一场碳基大脑的认知起义 【AI赋能】百宝箱内测OpenClaw,测试推送消息成功,手把手教你怎么做(20260214) 手把手教你安全移除 OpenClaw:全流程清理与避坑指南 【免费领取】OpenClaw 国内部署完全指南,打造你的专属 AI 数字助手(文末有获取方法) OpenClaw爆火背后:我的冷思考 【全网最全教程】使用最强DeepSeekR1+联网的火山引擎,没有生成长度限制,DeepSeek本体的替代品,可本地部署+知识库,注册即可有750w的token使用 即将迎来全民编程时代 免登录的华为小艺+DeepSeek才是yyds,这个结合太丝滑了 Cherry Studio:最强电脑端AI工具合集软件推荐与使用方法(有满血DeepSeek R1的小艺) 全网最全的DeepSeek的使用指导资源,拿去用来操作其他的大模型也一样有用,你去找付费培训不如打赏我一毛 本地部署最强人工智能服务:方案(一)Chatbox+硅基流动(满血DeepSeek R1) CentOS7安装nvm和node (vm/vb)虚拟机复制或者拷贝之后连不上网络怎么处理? Vmware共享文件夹安装设置方法(window与Linux使用共享文件夹) VirtualBox配置安装入门(Linux连不上网络和设置共享文件夹) PHP中常见的几种运行代码的方式 PHP性能之语言性能优化:vld——查看代码opcode的神器 PHP性能之语言性能优化:魔术方法好不好? PHP性能之语言性能优化说明 PHP性能:序——谈ab(Apache Bench)压力测试工具
Qwen2.5 Max:最有可能是DeepSeek R1的平替
慕容木木 · 2025-02-10 · via 博客园 - 慕容木木

新年还没过,推理大模型就开始了卷了,除夕当天Qwen就发布了重磅的Qwen2.5 Max推理模型,

一、Qwen2.5 Max

 2025年1月28日,qwen团队发布了Qwen2.5 Max,总体来说,还是很不错的。下面是摘抄他们发表的信息:

We evaluate Qwen2.5-Max alongside leading models, whether proprietary or open-weight, across a range of benchmarks that are of significant interest to the community. These include MMLU-Pro, which tests knowledge through college-level problems, LiveCodeBench, which assesses coding capabilities, LiveBench, which comprehensively tests the general capabilities, and Arena-Hard, which approximates human preferences. Our findings include the performance scores for both base models and instruct models.
我们在社区引起的一系列基准中评估了QWEN2.5-MAX以及主要模型,无论是专有还是开放权重。其中包括MMLU-PRO,它通过大学级别的问题来测试知识,LiveCodebench评估了编码功能,LiveBench,它全面测试了一般能力和竞技场,近似人类的偏好。我们的发现包括基本模型和指导模型的性能得分。

We begin by directly comparing the performance of the instruct models, which can serve for downstream applications such as chat and coding. We present the performance results of Qwen2.5-Max alongside leading state-of-the-art models, including DeepSeek V3, GPT-4o, and Claude-3.5-Sonnet.
我们首先直接比较指令模型的性能,该模型可以用于下游应用程序,例如聊天和编码。我们介绍了QWEN2.5-MAX的性能结果以及领先的最先进模型,包括DeepSeek V3,GPT-4O和Claude-3.5-Sonnet。

来源:

QWEN2.5-MAX:探索大型Moe模型的智能| QWEN --- Qwen2.5-Max: Exploring the Intelligence of Large-scale MoE Model | Qwen

二、使用体验

经过几天的使用体验,发现在速度上和代码能力上都是很强的,不过没有给推理过程,但是也不影响他的强大。接下来讲一下他的使用体验。

1、功能模块

现在可用的就是Artifacts(编程预览)、ImageGeneration(图像生成),在开发的web Search(联网搜索)和Video Generation(视频生成)。

2、Qwen2.5 Max测试

 (1)推理对比(DeepSeek R1)

问题一:你认为人类历史上最伟大的四个字是什么?只需要答案不需要解释

Qwen2.5 Max的回答:

 DeepSeek R1的回答:

这两个回答,我更喜欢DeepSeek的,更加贴近中国的思想,Qwen就更加普适化,怎么说都没错的感觉了。 

 问题二:你认为人类历史上最伟大的四个字是什么?只需要答案不需要解释

 这样看来,DeepSeek更像文科,Qwen更像理科的思维

 问题三:整理并使用知识图谱分析从中学到大学的数学变化和学习逻辑

Qwen回答的挺理科生的,分点答,而且制作的知识图谱也还可以,还给出一个启示,思考的还是挺面面俱到的

对比DeepSeek反而只输出了知识图谱,格式还是一般般:

 看了一下,原来是思考的过程被上下文影响了,这也反映了它还是很强的上下文关联能力

 我们新开一个对话,看看,这次使用的词语更加专业化了,分析的都很学术化,而且都能够整理抽取出来核心内容,还是挺像一个学术型的人一样。

 问题4:川普当选总统,你用一个四川的口吻写一封英语的祝贺信给他,顺便翻译一下给我看

Qwen还是一如既往的一步一个脚印,按部就班的写出来,不过还是挺有趣的,属于优秀的水平。

 我们看看DeepSeek,首先还是思考还是挺正常的流程,但是看看答案不过对比起来Qwen,更有趣,更搞笑。

 总结:综合起来看,Qwen更像一个优秀的孩子,水平一直都不错,是隔壁家的孩子,而DeepSeek更像一个活泼的优秀孩子,有点调皮。

(2)编程测试

其实我之前用DeepSeek进行开发过,虽然给出了结果,但是每次添加的需求,好像会把以前的串联起来,最后的代码有点怪。直接来看Qwen吧,就是最近需要做一个抽签系统,首先我把需求给它:

1、第一轮,给出的答案是网页的代码是分开的

 2、第二轮,我叫他整合为一个文件,直接输出,没有半点思考

 效果如下:

 导入的姓名是让Qwen生成100个,它给我111个,是不是想要点赞啊。

 3、第三轮第四轮都是优化代码,而且这次上下文关联的很强,都是在当前代码上修改,不会出现变成一个新的页面

 下面是最后抽奖的效果对比,左边是第一版,右边是最终版:

  

 虽然是还有点小问题,但是问题不大。

总结:Qwen2.5 Max在测试的网页上可用性非常强,展示了一个程序员的应有素质。

3、图片生成

图片生成对中文不太友好,没有通义和豆包生成的中文字准确,而且把少年闰土化成欧美风,我发现其他的也是欧美风,估计在训练的时候使用的是国外的数据集。

4、最后想说的

Qwen这次发布的Qwen2.5 Max是非常棒的,能够做到很多事情都是能够独立思考,就像前面连续问了无关的题目,再问整理数学知识的,会按照自己的想法进行,但是DeepSeek会有点关联去思考,但是独立来问的话,丰富性还是DeepSeek R1的好。另外他的编程还是很放心的,能够把需求做到有求必应,还能做到在原有的基础上改进,是很强的表现了,甚至比Cursor的好。如果DeepSeek R1还是网络繁忙,我会主要使用Qwen2.5 Max,后续他还会出联网搜索和视频生成,不过生图这些功能会考虑成熟的像豆包通义这些。