惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
DataBreaches.Net
IT之家
IT之家
The Cloudflare Blog
Apple Machine Learning Research
Apple Machine Learning Research
WordPress大学
WordPress大学
N
Netflix TechBlog - Medium
阮一峰的网络日志
阮一峰的网络日志
P
Proofpoint News Feed
L
LangChain Blog
博客园 - Franky
美团技术团队
J
Java Code Geeks
Microsoft Security Blog
Microsoft Security Blog
博客园 - 叶小钗
小众软件
小众软件
Y
Y Combinator Blog
B
Blog RSS Feed
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
D
Docker
Hugging Face - Blog
Hugging Face - Blog
Jina AI
Jina AI
罗磊的独立博客
大猫的无限游戏
大猫的无限游戏
Vercel News
Vercel News

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
AI大模型测评,深度解析最强开源模型Qwen3
贝琳_belin · 2025-05-01 · via 人人都是产品经理

前几天,阿里发布了Qwen3的新模型。从数值表现来看已经超越了DeepSeek和一众大模型,但实际表现如何?这篇文章,我们来看看作者的分析。

一、基础介绍

4月29日,在经历了claude 3.7 ,Gemini 2.5 和 GPT 4.1 模型发布之后,通义千问终于正式发布了Qwen3系列模型,凭借仅需 DeepSeek R1 模型三分之一的硬件成本,实现了性能的全面超越,同时追平了全球顶尖的 Gemini 2.5 Pro,同时还搭载了mcp能力。此外,小型 MoE(混合专家模型) 模型 Qwen3-30B-A3B 的激活参数数量是 QwQ-32B 的 10%,表现更胜一筹,甚至像 Qwen3-4B 这样的小模型也能匹敌 Qwen2.5-72B-Instruct 的性能。

千问 3 系列模型共包含 6 个不同型号,参数量从最小的 0.6B 到最大的 235B-A22B,覆盖移动端部署到企业级应用的多元场景需求。旗舰型模型 Qwen3-235B-A22B 中的 “235B-A22B”,是混合专家模型的独特标识,代表模型总参数量达 2350 亿,每次推理仅激活 220 亿参数,在推理数学、编程和对话性能上远超 DeepSeek R1,逼近 Gemini 2.5 Pro 的水准。

千问 3 系列共 8 款模型全面开源!6 款稠密(Dense)模型,2 款 MoE 模型。

二、核心亮点

多种思考模式

值得一提的是,Qwen3 具备两种思考模式:

  1. 推理形态下,模型会展现思考过程,虽然耗时稍长,但在处理复杂任务时能力显著增强;
  2. 普通形态则省略思考步骤,响应迅速,更适合日常对话和长文本创作。

这种灵活性使用户能够根据具体任务控制模型进行“思考”的程度。例如,复杂的问题可以通过扩展推理步骤来解决,而简单的问题则可以直接快速作答,无需延迟。

至关重要的是,这两种模式的结合大大增强了模型实现稳定且高效的“思考预算”控制能力。

多语言

同时,Qwen3 模型支持 119 种语言和方言。这一广泛的多语言能力为国际应用开辟了新的可能性,让全球用户都能受益于这些模型的强大功能。

增强的 Agent 能力

同时,该系列模型大幅升级 MCP 能力,能精准识别外部函数,并支持多工具的灵活串联与并联调用,为 Agent 开发提供了强大助力。

三、部署方面

在部署成本方面,Qwen3-235B-A22B 展现出显著优势。作为稀疏 Mixture-of-Experts(MoE)架构的大模型,其硬件资源消耗远低于同规模的 dense 模型。得益于高效的模型设计与 FP8 精度权重支持,Qwen3-235B-A22B 最低可在 4 张 H20 或 H800 显卡上完成高效推理部署,大幅降低了推理门槛与能耗成本。

相比之下,DeepSeek R1 采用 dense 架构,在部署时需占用高达 1300GB 显存资源,通常依赖双节点、8 张 A100 显卡协同运行,整体硬件开销约为 Qwen3 的三倍。

此外,Qwen3-235B-A22B 还支持通过 Quick Transformers 框架实现 CPU 与 GPU 的混合推理,进一步压缩硬件支出,提升灵活性与适配性。这些优势使其成为当前大模型企业级落地应用的理想选择,兼具性能与性价比。

四、技术层面

在技术训练层面,Qwen3 借鉴了 DeepSeek R1 基于强化学习的后训练流程,对 235B-A22B 和 32B 两款大尺寸模型进行四阶段复杂训练,其中包括

  1. 长思维链冷启动
  2. 长思维链强化学习
  3. 思维模式融合
  4. 通用强化学习

不仅显著提升推理能力,还实现了普通问答与推理模式的智能切换,强化了文本编写能力。

此后,团队运用模型蒸馏方法,以大尺寸模型生成的数据集对小尺寸预训练模型进行优化。不同于 DeepSeek R1 采用 Llama 等外部模型作为基础,Qwen3 的小尺寸蒸馏模型均基于原生训练的 Qwen3 大模型,训练流程进一步优化,为开源模型的发展提供了极具价值的参考。

五、案例展示

1、代码生成与理解

我使用了leetcode的中的一道难度为【hard】的代码题

结论:结果是正确的,这样也展现出了他极强的代码能力

2、生成网页能力

根据以下内容生成一个html动态广告网页,要求:

1.使用扁平风格的视觉设计,浅色背景配合与#0FB990和#101010 相近的颜色作为高亮

2.淡淡的网格线在背景中制造科技感

3.强调超大字体或字突出核心要点,画面中有超大视觉元素强调重点,与小元素的比例形成反差

4.中英文混用,中文大字体相体,英文小字作为点组

5.简洁的线条图形化作为数据可视化或者配图元素

6.运用高亮,自身透明度渐变制造科技感,但是不同高亮色不要互相渐变

7.模仿apple官网的动效,向下浪动鼠标配合动效

结论:虽然看起来有点简单,但整体效果还是可以的,后期在经过修改,还是可以用的。

3、指令遵循

请按照下面的步骤进行操作:首先,想出一句恰好 10个字的中文句子。然后,将这句中的每个汉字转换成对应的拼音(不带声调)。最后,将转换后的整句拼音结果倒序输出。请严格按照要求给出答案。

评分标准:

  • 句子符合要求: 提供的句子恰好为 10 个汉字,语句通顺且符合常理。
  • 拼音转换:正确将句子中每个汉字转换为对应的拼音,拼写无误且不含声调。
  • 倒序输出:正确的将整句拼音倒序排列输出,顺序完全反转,无遗漏或多余字符。
  • 格式正确: 输出中各拼音之间的分隔清晰如使用空格分隔每个拼音),没有附加多余说明。
  • 指令完整遵循:严格按照三个步骤执行,无省略或额外步骤,最终答案满足所有要求。

结论:这个回答就比较差了,跟我们预想的相差很多

4、逻辑推理能力

某钻石失窃案中,警方怀疑甲、乙、丙三人中的一人是小偷。三人分别做了如下陈述: 甲说:”小偷是乙。”乙说:”小偷是丙。”丙说:”小偷是乙。”已知这三人中只有一人说了真话。请推理判断谁偷了钻石。

评分标准:

  • 结论正确:正确推断出真正的小偷身份(丙)。
  • 推理过程: 合理运用”只有一人真话”的条件进行分析,对每种可能情况展开严谨推理。
  • 逻辑性:论证过程符合逻辑,各陈述真假的推断衔接合理,没有自相矛盾。
  • 表述清晰:推理步骤表达清楚且有条理

结论:答案正确,且逻辑清晰

通过这几个案例,可以看出,Qwen3的整体性能还是不错的,大家也都可以自己去上手尝试一下。

六、总结

回顾 2024 年,大模型领域虽百花齐放,但开源技术圈却陷入瓶颈。Llama 4 被曝作弊,Meta 发展受挫;谷歌 Gemini 3和智谱 GLM 4 等开源模型多为小尺寸,难以满足工业级应用需求。

在此背景下,千问 3 系列模型的发布意义非凡。尽管标号为 “3”,但按照千问模型每隔 0.5 版本算一代的惯例,这已是该系列的第五代产品。

历经两年打磨、五个版本迭代与上百款模型优化,千问模型从开源领域的 “新秀” 成长为当之无愧的行业标杆,扛起全球开源大模型的发展大旗,成为推动技术进步的中坚力量。

本文由 @贝琳_belin 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务