惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

J
Java Code Geeks
Martin Fowler
Martin Fowler
B
Blog RSS Feed
D
DataBreaches.Net
L
LangChain Blog
月光博客
月光博客
S
SegmentFault 最新的问题
阮一峰的网络日志
阮一峰的网络日志
V
Visual Studio Blog
美团技术团队
Jina AI
Jina AI
博客园 - 司徒正美
雷峰网
雷峰网
Last Week in AI
Last Week in AI
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
IT之家
IT之家
博客园 - 三生石上(FineUI控件)
WordPress大学
WordPress大学
小众软件
小众软件
罗磊的独立博客
博客园_首页
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
A
About on SuperTechFans
Engineering at Meta
Engineering at Meta

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
HuggingFace上的热门开源模型,一半都来自中国了
硅星人 · 2025-03-14 · via 人人都是产品经理

中国开源模型因开放协议、算法优化和生态支持,成为全球开发者首选

在最新的HuggingFace热门模型榜单中,中国模型的含量超过了50%。包括刚刚上新的QwQ-32B不同型号的推理模型,HunyuanVideo-12V的全新版本、长期霸榜的DeepSeekR1,以及Qwen和R1的衍生模型。

DeepSeek开源R1给整个大模型行业扔下一颗炸弹,引发了模型社区和企业的激烈讨论后,几乎已经确定了开源为主流技术路线,此前一直坚持闭源路线的如OpenAI、百度、月之暗面也相继表示将尝试开源路线。

与以往不同的是,R1之后的冲榜不只体现在数量多上,更体现在质量上。“早期一些大厂的开源模型只是挂上去,后续不会再运营和维护,现在在模型性能、实用性和稳定性上都有突破,对部署算力的要求更低,算是逐渐走出了独立曲线。”一位开发者讲道。

更值得注意的是,越来越多国际开发者选择中国基础模型作为微调起点,相比于Llama和Phi,以DeepSeek和Qwen系列模型为基点的衍生模型越来越多。

我们与多位开发者和企业聊了聊,为什么中国开源模型如此受欢迎?

1.要做就做真开源

在选择微调模型前,首先要关注的就是开放协议。

中国开源模型基本上采用的都是最为宽松Apache 2.0开放协议或MIT协议,这意味着开发者可以自由进行二次开发、商用,且基于这些模型开发的专利归开发者本人所有,有效规避了法律风险,为企业提供了确定性。

一位活跃于HuggingFace社区的资深开发者分享道:“我们团队最初只是试用Qwen系列,但很快发现其API设计和开源资源之完善超出预期。更重要的是,我们不必担心未来突然改变协议或限制使用,这种确定性对商业项目至关重要。”

不少海外初创公司也提到中国模型非常有利的许可模式让他们能够直接使用,无需繁琐的法律审查。即便是离商业化最近的视频模型,Wan和HunyuanVideo除了需要遵守相应的法规和限制条款,也是可以免费商用的。相比之下,Meta的Llama采用自主制定协议限制商用,且专利归原公司所有,这无疑增加了开发者的法律顾虑。

当我们随手打开HuggingFace中Llama模型的评论区就会发现,在开发者测试中,多次出现访问模型的请求被拒绝的情况。这种不稳定的访问体验,加上模棱两可的使用条款,让许多开发者望而却步。一位企业AI技术负责人直言:“我们不能基于一个随时可能被限制使用的模型来构建产品。”

其次,中国模型在开源深度上更进一步。不仅开放了从小到大等全系列不同参数规格的模型权重,还提供了各种量化版本和完整的训练数据集,甚至包括微调所需的数据模板。这种全面性让开发者能够根据实际需求和硬件条件选择最适合的版本。

“比如说适用于Qwen的编码数据集CodeAlpaca-20K,可在 Hugging Face 上可以直接找到。该数据集包含20000 条与编码相关的指令、输入和输出,可以满足基本的微调需求。”

这种完全的开放风格也影响了最新的中国模型开源,当HunyuanVideo-12v版本开源时,相较于2个月前的版本,开放权重更高。模型总参数量保持130亿,适用于多种类型的角色和场景,包括写实视频制作、动漫角色甚至CGI角色制作的生成。开源内容包含权重、推理代码和LoRA训练代码,支持开发者基于混元训练专属LoRA等衍生模型。

另一方面,从模型本身出发,Llama3目前仅提供8B、70B和405B三种规格,却缺少被业内公认为算力与性能最佳平衡点的32B参数规模。对大多数开发者而言,7B模型性能已不足以支撑复杂应用,而70B以上则需要强大的服务器支持,成本高昂。Qwen系列在这方面迭代更快,规格覆盖更全面,从超轻量到重量级都有解决方案。

一位海外开发者评价:“LLama3的迭代速度明显慢于Qwen系列,尤其是模型参数量规格的覆盖程度更是存在巨大的短板,至今仍然没有补齐。”

当然,在性能方面,中国模型已与顶级闭源模型相当甚至在某些领域超越。DeepSeek-R1自上线以来,已经成为开源社区最受欢迎的推理模型,最新评测数据显示,Qwen-72B模型已经超过GPT4水平,而在处理中文等特定任务时表现更佳。DeepSeek系列在代码生成能力上也获得了超过顶级模型的评分。

有开发者对比发现,完全微调Qwen 1.5 0.5B模型比使用QLoRA对Phi 1.5进行微调的效果要好得多,且Phi的微调时间要接近Qwen的5倍。

与其他打着“开源”旗号却设置诸多限制的模型不同,中国模型在开放程度和性能表现上找到了平衡,这正吸引全球开发者加入这一生态。

2.让咖啡店老板都能跑大模型

由于美国对高端GPU的出口管制,迫使中国开发者从依赖硬件堆砌的传统路径转向“算法优先”的创新模式。这种“算力短缺倒逼算法升级”的逻辑,推动中国开源模型形成独特的竞争力:通过架构创新与算法优化,在有限算力下实现可用性最大化,降低部署门槛,让咖啡店老板都能跑大模型。

比如最新的QwQ-32B推理模型,几乎完全超越了OpenAI-o1-mini,远胜于o1-mini及相同尺寸的R1蒸馏模型,在保持性能的前提下把模型做小到32B的最佳部署参数区间,是呈现出来的一个趋势。

“本质上是用算法复杂度置换高算力需求,当模型参数量降低两个数量级时,训练所需的显存从千兆字节级压缩至消费级显卡可承载的96GB以内,大模型的部署不再依赖专业计算集群。”

参数变小后再通过特定的算法降低内存和对显存的需求,QwQ-32B在消费级显卡4090或一台装备M4芯片的MacBook上就能完成部署。

再比如视频生成类模型HunyuanVideo-12V和Wan2.1版本,也可在T2V-1.3B 型号仅需 8.19 GB VRAM,可兼容几乎所有消费级 GPU。可在约 4 分钟内(未使用量化等优化技术)在 RTX 4090 上生成 5 秒的 480P 视频。

另外一方面,是中国大模型已经完全建立起了开放生态,开源方法得到了第三方项目和工具的广泛支持。

在训练和微调方面,多个开源框架为中国大模型提供了强大支持。例如,DeepSpeed Chat 提供了一键式RLHF(基于人类反馈的强化学习)训练框架,支持从数据预处理到模型评估的完整训练流程,显著降低了复杂任务的开发门槛。

此外,LLaMA Efficient Tuning 提供了基于PEFT(参数高效微调技术)的微调框架,支持LoRA、Adapter等多种微调模式,使开发者能够以更低的计算成本实现模型性能的优化。这些开源工具不仅覆盖了从预训练到微调的全流程,还通过模块化设计提高了灵活性和易用性,为开发者提供了丰富的选择。

在模型推理方面,同样有多种高效框架支持中国大模型的部署。例如,vLLM 针对大批量Prompt输入场景进行了优化,通过动态内存管理和高效调度算法,显著提升了推理速度和吞吐量。而 Xinference 则是一个功能全面的分布式推理框架,支持多节点并行计算,简化了大语言模型的部署流程,尤其适合高并发、低延迟的应用场景。

这些框架与中国大模型(如Qwen、DeepSeek等)完全适配,不仅提升了推理效率,还降低了硬件资源需求,使得模型的部署更加便捷和经济。

模型最开放、型号最全,与开放生态工具完全耦合,同时兼具着最低的部署门槛,使更多开发者能够参与试用,来自中国厂商的这样的开源模型还会越来越多,一个全新的生态结构正在慢慢建立起来。

本文由人人都是产品经理作者【硅星人】,微信公众号:【硅星人Pro】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。