惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

H
Help Net Security
大猫的无限游戏
大猫的无限游戏
雷峰网
雷峰网
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 聂微东
V
Visual Studio Blog
爱范儿
爱范儿
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
美团技术团队
有赞技术团队
有赞技术团队
云风的 BLOG
云风的 BLOG
Google DeepMind News
Google DeepMind News
Blog — PlanetScale
Blog — PlanetScale
The Cloudflare Blog
Engineering at Meta
Engineering at Meta
博客园 - 三生石上(FineUI控件)
WordPress大学
WordPress大学
Vercel News
Vercel News
F
Fortinet All Blogs
Last Week in AI
Last Week in AI
M
MIT News - Artificial intelligence
小众软件
小众软件
月光博客
月光博客
A
About on SuperTechFans

博客园 - ffl

用AI像大一新生一样学东西 [AI翻译]我如何用大模型写软件 [AI翻译]来自Zig的教训 [AI翻译] 标题:Agentic AI 手册:生产级模式 [AI翻译]:我们如何让 Python 的 packaging 库提速三倍 翻译:Akin 的航天器设计法则 Navida和Groq的交易资金多么? 翻译:这并不是未来 一个完整的软件开发过程,AI在哪些地方加速? 从业务读写流程出发,理解各种分布式系统组件的意义 类型标注,太多和太少一样糟糕 【AI翻译】什么是第三方API?优势、应用场景与最佳实践 【AI翻译】分布式系统中的心跳机制 【AI翻译】Python 3.14来了,有多快? Argo CD 与 Kubernetes 资源关系简述 技术文章阅读todo-list DLM(Diffusion Language Model) vs AR(Autoregressive) 标注的原理:少而完备,监督模型训练的根本 对比理解:什么是AI味浓厚的文章? 重要文章:Asymmetry of verification and verifier’s law
几何平均比算术平均对极值不敏感。
ffl · 2025-08-06 · via 博客园 - ffl

背景:Deepseek里用算术平均来作为价值函数的替代,后面有人用几何平均改进了训练的稳定性。微博 @马少平 THU 转评:“几何平均对极值不敏感”,我们找AI给个实际的对比:

我们来用实际例子对比一下算术平均几何平均在面对极值时的表现差异。


⚖️ 定义回顾

类型 计算方式 对极值敏感性
算术平均 所有数值求和后除以数量 高:极值会显著拉动结果
几何平均 所有数值相乘后开 n 次方 低:极值影响被乘法和开方“稀释”

📊 实例对比:极值影响

示例 1:无极值

数据集:[5, 6, 7]

  • 算术平均:$ \frac{5 + 6 + 7}{3} = 6 $
  • 几何平均:$ \sqrt[3]{5 \times 6 \times 7} \approx 5.96 $

两者非常接近。


示例 2:加入极大值

数据集:[5, 6, 100]

  • 算术平均:$ \frac{5 + 6 + 100}{3} = 37 $
  • 几何平均:$ \sqrt[3]{5 \times 6 \times 100} \approx 17.1 $

👉 算术平均被极值严重拉高,而几何平均仍保持相对稳健。


示例 3:加入极小值

数据集:[5, 6, 0.1]

  • 算术平均:$ \frac{5 + 6 + 0.1}{3} \approx 3.7 $
  • 几何平均:$ \sqrt[3]{5 \times 6 \times 0.1} \approx 2.3 $

👉 算术平均下降,但几何平均下降更明显,因为乘积中极小值会“压制”整体。


🧠 总结

  • 算术平均适合数据分布均匀的场景,如考试成绩、温度记录。
  • 几何平均适合处理乘法关系或比例变化,如投资回报率、模型奖励函数。
  • 在有极值的情况下,几何平均更稳健,不容易被“绑架”。

如果你正在设计某种奖励机制或聚合策略,选择哪种平均方式会直接影响系统的稳定性和鲁棒性。