惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

爱范儿
爱范儿
T
Troy Hunt's Blog
B
Blog
N
Netflix TechBlog - Medium
H
Help Net Security
PCI Perspectives
PCI Perspectives
罗磊的独立博客
SecWiki News
SecWiki News
S
Security Affairs
Webroot Blog
Webroot Blog
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
Hacker News: Ask HN
Hacker News: Ask HN
Google Online Security Blog
Google Online Security Blog
酷 壳 – CoolShell
酷 壳 – CoolShell
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
V
Visual Studio Blog
V2EX - 技术
V2EX - 技术
Recorded Future
Recorded Future
Schneier on Security
Schneier on Security
The Last Watchdog
The Last Watchdog
博客园 - 【当耐特】
Attack and Defense Labs
Attack and Defense Labs
S
Secure Thoughts
Hugging Face - Blog
Hugging Face - Blog
Forbes - Security
Forbes - Security
Application and Cybersecurity Blog
Application and Cybersecurity Blog
TaoSecurity Blog
TaoSecurity Blog
Recent Commits to openclaw:main
Recent Commits to openclaw:main
M
MIT News - Artificial intelligence
博客园_首页
A
About on SuperTechFans
Microsoft Azure Blog
Microsoft Azure Blog
T
Tailwind CSS Blog
The Cloudflare Blog
P
Proofpoint News Feed
D
DataBreaches.Net
N
News and Events Feed by Topic
G
Google Developers Blog
B
Blog RSS Feed
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
MyScale Blog
MyScale Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
AI
AI
O
OpenAI News
雷峰网
雷峰网
C
Check Point Blog
大猫的无限游戏
大猫的无限游戏
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Blog — PlanetScale
Blog — PlanetScale
有赞技术团队
有赞技术团队

博客园 - 石云华

Exadata环境中的CVE-2026-31431漏洞说明 DBCA后,只能启动一个实例,都是rp_filter惹的祸 分析Exadata写入慢的性能故障 Exadata更换Infiniband交换机 数据库集群中的bond1接口出现网络丢包 EM13告警:Metric evaluation error start - oracle.sysman.emSDK.agent.fetchlet.exception.FetchletException: Permission denied(publickey,password) Exadata,更换完思科交换机后,与上联交换机无法通信 Exadata更换计算节点的硬盘 Exalogic虚拟机的网络无法启动,提示Device has different MAC address than expected 单个ASM磁盘free空间为0,导致rebalance时提示“ASM磁盘组空间耗尽(ORA-15041)” Exadata的思科交换机,重启后进入到了rommon模式 SYSAUX表空间中的SYS.EXP_HEAD$表,占用大量空间 PX并行进程产生大量的trace日志,导致文件系统撑爆 回收站存在大量对象,导致Insert into...select语句夯住 用dg broker执行switchover时,报0RA-01017 增量备份恢复的方式修改缺失归档的DataGuard 未设置min_free_kbytes参数,导致操作系统进行页缓存回收时,整个操作系统夯住 Exadata数据库性能异常,备份进程卡住 MySQL 5.7版本,搭建一个两主一从的多源主从复制环境 恢复某个数据文件不适当,导致DataGuard无法open数据库 Exadata计算节点的内存出现故障,导致CPU耗尽 Bug 34885986 - Flashback log file was not reused even if db_flashback_retention_target is passed
/var/log/message日志中的“megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success”信息
石云华 · 2026-07-09 · via 博客园 - 石云华

案例概述

客户的一台Exadata,计算节点的/var/log/message日志中,几乎每天凌晨3点左右,都会刷新几条关于RAID卡的日志。具体如下所示:

Sep 2 03:06:08 dm03dbadm01 kernel: [21337482.898465] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Sep 2 03:06:08 dm03dbadm01 kernel: [21337482.900843] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Sep 2 03:06:08 dm03dbadm01 kernel: [21337483.343151] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success

客户想让检查下,硬件层面是否存在问题。

案例分析

(1). 检查该计算节点的ilom日志和alerthistory日志,未发现硬件异常。

(2).重新分析/var/log/message日志,发现每天的固定时间点,有大量关于RAID的日志产生。

Aug 26 03:02:54 dm03dbadm01 MRdiagd: MR Controller event (seq 6275) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=66 (LD:Info)
Aug 26 03:03:25 dm03dbadm01 MRdiagd: MR Controller event (seq 6276) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:03:54 dm03dbadm01 MRdiagd: MR Controller event (seq 6277) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:04:23 dm03dbadm01 MRdiagd: MR Controller event (seq 6278) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:04:51 dm03dbadm01 MRdiagd: MR Controller event (seq 6279) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:05:20 dm03dbadm01 MRdiagd: MR Controller event (seq 6280) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:05:49 dm03dbadm01 MRdiagd: MR Controller event (seq 6281) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:06:08 dm03dbadm01 kernel: [20734108.557891] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 26 03:06:08 dm03dbadm01 kernel: [20734108.560714] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 26 03:06:09 dm03dbadm01 kernel: [20734108.979049] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 26 03:06:19 dm03dbadm01 MRdiagd: MR Controller event (seq 6282) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:06:49 dm03dbadm01 MRdiagd: MR Controller event (seq 6283) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:07:19 dm03dbadm01 MRdiagd: MR Controller event (seq 6284) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:07:48 dm03dbadm01 MRdiagd: MR Controller event (seq 6285) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
......
Aug 26 04:00:55 dm03dbadm01 MRdiagd: MR Controller event (seq 6376) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=58 (LD:Info)
Aug 26 04:06:30 dm03dbadm01 MRdiagd: MR Controller event (seq 6377) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=94 (PD:Progress)
Aug 26 04:06:30 dm03dbadm01 MRdiagd: MR Controller event (seq 6378) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=94 (PD:Progress)
Aug 26 04:06:36 dm03dbadm01 MRdiagd: MR Controller event (seq 6379) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=94 (PD:Progress)
......
Aug 27 03:06:08 dm03dbadm01 kernel: [20820305.106942] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 27 03:06:08 dm03dbadm01 kernel: [20820305.109701] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 27 03:06:09 dm03dbadm01 kernel: [20820305.542352] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
......
Aug 28 03:06:07 dm03dbadm01 kernel: [20906500.548825] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 28 03:06:08 dm03dbadm01 kernel: [20906500.904938] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
......
Aug 29 03:06:08 dm03dbadm01 kernel: [20992697.292202] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 29 03:06:08 dm03dbadm01 kernel: [20992697.294315] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 29 03:06:59 dm03dbadm01 kernel: [20992748.722111] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success

可以看出,在每天的凌晨3点06分,都会生成“megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success”这条信息, 这应该是RAID卡的例行检查工作。

(3).继续看26号这天RAID生成的其他日志,例如:code=65 (LD:Progress) 和 code=94 (PD:Progress)等。 code=65,代表逻辑驱动器的一致性校验进行中,通常代表进度更新,每完成一定百分比汇报一次。code=94,代表物理驱动器的一致性校验进行中。 这说明当前的RAID卡在进行磁盘检测工作。

(4).一些常见的RAID Event Messages code,如下所示:

code=110 (PD:Info) - this would be event 0x006e - Logged when recovery completed successfully and fixed a medium error

code=58 (LD:Info) - this would be 0x003a - Logs Consistency Check is being done on a LD

code=65 (LD:Progress) - this would be 0x0041 - Logs Consistency Check progress on a LD, will log when CC is complete.

code=112 (PD:Warning) - this would be 0x0070 - Logged when a drive is removed from the controller

code=251 (LD:Critical) - 0x00fb - Logged when a logical drive state changes to degraded state

code=445 (PD:Warning) - 0x01bd - Warning that Patrol Read was aborted on a PD. Typically this is aborted because Consistency Check is already running, and these cannot run concurrently, so this is not actually a problem.

(5).假如出现code=268 (PD:Warning) 或者 code=223 (SAS:Warning)之类的日志,就需要引起关注。完整的Event Messages,可以参考RAID卡的官方手册。如图所示:

image

 案例总结

在本案例中,/var/log/message日志中的这些关于RAID的日志,属于RAID卡日常例行检查工作产生的正常日志,可以忽略。