惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Blog — PlanetScale
Blog — PlanetScale
博客园_首页
WordPress大学
WordPress大学
博客园 - 聂微东
P
Privacy International News Feed
Forbes - Security
Forbes - Security
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
Last Week in AI
Last Week in AI
C
CERT Recently Published Vulnerability Notes
月光博客
月光博客
NISL@THU
NISL@THU
美团技术团队
T
Tailwind CSS Blog
Jina AI
Jina AI
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Apple Machine Learning Research
Apple Machine Learning Research
C
Cisco Blogs
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
The Hacker News
The Hacker News
B
Blog
P
Palo Alto Networks Blog
L
Lohrmann on Cybersecurity
有赞技术团队
有赞技术团队
The Register - Security
The Register - Security
S
Securelist
A
Arctic Wolf
MyScale Blog
MyScale Blog
H
Help Net Security
N
Netflix TechBlog - Medium
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
T
Threatpost
Recent Commits to openclaw:main
Recent Commits to openclaw:main
Security Latest
Security Latest
T
Tor Project blog
V
Vulnerabilities – Threatpost
V
V2EX
AI
AI
Hugging Face - Blog
Hugging Face - Blog
大猫的无限游戏
大猫的无限游戏
博客园 - Franky
Simon Willison's Weblog
Simon Willison's Weblog
小众软件
小众软件
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
H
Hackread – Cybersecurity News, Data Breaches, AI and More
T
Troy Hunt's Blog
Schneier on Security
Schneier on Security
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
H
Heimdal Security Blog
Google Online Security Blog
Google Online Security Blog
Know Your Adversary
Know Your Adversary

博客园 - 太一吾鱼水

产权 图像和点云 安装MySQL8 大模型的能力 WSL使用 PyVista 知识图谱构建 Karpathy四大原则 AI问答:向量数据库本地化存储的方案? ArcGIS Pro连接PostgreSQL空间数据库 点云密度计算 向量数据库与嵌入模型 Agent设计模式:Plan-and-Execute 氛围编程的一些体会 Agent Skills [AdvaGIS] 预测农作物产量 图片赋色方法学习 Claude code安装与GLM模型配置 ArcGIS Pro开发学习 视觉基础模型DINOv3 aliceVision_utils_split360Images 立体相机标定 SAM3使用 古建筑学习 ContextCapture无人机影像与激光点云融合建模感受 Randla-Net深入理解 ROC、PR曲线绘制 Zero-Shot、One-Shot、Few-Shot概念
损失曲线出现先下降后上升
太一吾鱼水 · 2025-09-19 · via 博客园 - 太一吾鱼水

1. 在深度学习模型训练过程中,为什么一个epoch内损失函数会出现先下降后上升的现象?

  训练中,损失先降后升可能与以下因素相关:

  1)学习率过高,初期权重更新使损失下降,但后期过大更新导致拟合偏差;

  2)数据批次(batch)分布不均,某些批次噪声大或样本特殊,影响参数调整;

  3)正则化项作用,在训练初期不显著,但随着权重增大逐渐占据主导,使总损失上升;

  4)优化器动量效应,前期快速收敛,后期因累积梯度造成振荡。解决方法包括调整学习率策略、优化数据shuffle方式、控制正则化强度等。

  模型一开始损失值下降代表着从欠拟合状态逐步向拟合(just right)的状态变化,损失值上升代表着从拟合状态向过拟合状态变化。

2.学习率(learning rate)过小一般会产生以下几种典型问题:

  1) 收敛速度极慢
  学习率决定每次参数更新的步伐。学习率过小时,模型参数每次只做很小的调整,一次更新收敛效果有限,因此训练收敛速度非常慢,模型可能需要训练非常多的轮次(epochs)才能达到较好的效果。

  2)易陷入局部极小值或鞍点
  学习率过小时,模型缺乏足够的“能量”跳出不理想的位置,更容易陷入局部极小值或鞍点而无法到达全局最优。

  3) 浪费计算资源
  训练轮数和迭代次数大幅增加,导致时间和计算资源的消耗严重,效率极低。

  4) 早期效果看不出模型是否有效
  由于参数更新幅度极小,刚开始训练时难以看到 loss 明显下降,影响模型调试与早期判断。