惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Engineering at Meta
Engineering at Meta
C
Cyber Attacks, Cyber Crime and Cyber Security
博客园 - 司徒正美
月光博客
月光博客
Hugging Face - Blog
Hugging Face - Blog
T
Tailwind CSS Blog
罗磊的独立博客
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
博客园 - 三生石上(FineUI控件)
博客园_首页
博客园 - 【当耐特】
Cisco Talos Blog
Cisco Talos Blog
J
Java Code Geeks
C
CXSECURITY Database RSS Feed - CXSecurity.com
S
SegmentFault 最新的问题
人人都是产品经理
人人都是产品经理
Jina AI
Jina AI
AWS News Blog
AWS News Blog
S
Schneier on Security
NISL@THU
NISL@THU
F
Fortinet All Blogs
L
LINUX DO - 热门话题
Google DeepMind News
Google DeepMind News
量子位
IT之家
IT之家
T
The Exploit Database - CXSecurity.com
爱范儿
爱范儿
GbyAI
GbyAI
T
The Blog of Author Tim Ferriss
T
Tor Project blog
V
Vulnerabilities – Threatpost
V
Visual Studio Blog
宝玉的分享
宝玉的分享
Spread Privacy
Spread Privacy
L
Lohrmann on Cybersecurity
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
Y
Y Combinator Blog
D
Darknet – Hacking Tools, Hacker News & Cyber Security
P
Privacy International News Feed
S
Securelist
P
Palo Alto Networks Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
A
Arctic Wolf
T
Tenable Blog
B
Blog
C
CERT Recently Published Vulnerability Notes
P
Proofpoint News Feed
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
T
Threat Research - Cisco Blogs
T
Threatpost

博客园 - 石云华

Exadata环境中的CVE-2026-31431漏洞说明 DBCA后,只能启动一个实例,都是rp_filter惹的祸 分析Exadata写入慢的性能故障 Exadata更换Infiniband交换机 数据库集群中的bond1接口出现网络丢包 EM13告警:Metric evaluation error start - oracle.sysman.emSDK.agent.fetchlet.exception.FetchletException: Permission denied(publickey,password) Exadata,更换完思科交换机后,与上联交换机无法通信 Exadata更换计算节点的硬盘 Exalogic虚拟机的网络无法启动,提示Device has different MAC address than expected 单个ASM磁盘free空间为0,导致rebalance时提示“ASM磁盘组空间耗尽(ORA-15041)” Exadata的思科交换机,重启后进入到了rommon模式 SYSAUX表空间中的SYS.EXP_HEAD$表,占用大量空间 PX并行进程产生大量的trace日志,导致文件系统撑爆 回收站存在大量对象,导致Insert into...select语句夯住 用dg broker执行switchover时,报0RA-01017 增量备份恢复的方式修改缺失归档的DataGuard 未设置min_free_kbytes参数,导致操作系统进行页缓存回收时,整个操作系统夯住 Exadata数据库性能异常,备份进程卡住 MySQL 5.7版本,搭建一个两主一从的多源主从复制环境 恢复某个数据文件不适当,导致DataGuard无法open数据库 Exadata计算节点的内存出现故障,导致CPU耗尽 Bug 34885986 - Flashback log file was not reused even if db_flashback_retention_target is passed
/var/log/message日志中的“megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success”信息
石云华 · 2026-07-09 · via 博客园 - 石云华

案例概述

客户的一台Exadata,计算节点的/var/log/message日志中,几乎每天凌晨3点左右,都会刷新几条关于RAID卡的日志。具体如下所示:

Sep 2 03:06:08 dm03dbadm01 kernel: [21337482.898465] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Sep 2 03:06:08 dm03dbadm01 kernel: [21337482.900843] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Sep 2 03:06:08 dm03dbadm01 kernel: [21337483.343151] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success

客户想让检查下,硬件层面是否存在问题。

案例分析

(1). 检查该计算节点的ilom日志和alerthistory日志,未发现硬件异常。

(2).重新分析/var/log/message日志,发现每天的固定时间点,有大量关于RAID的日志产生。

Aug 26 03:02:54 dm03dbadm01 MRdiagd: MR Controller event (seq 6275) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=66 (LD:Info)
Aug 26 03:03:25 dm03dbadm01 MRdiagd: MR Controller event (seq 6276) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:03:54 dm03dbadm01 MRdiagd: MR Controller event (seq 6277) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:04:23 dm03dbadm01 MRdiagd: MR Controller event (seq 6278) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:04:51 dm03dbadm01 MRdiagd: MR Controller event (seq 6279) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:05:20 dm03dbadm01 MRdiagd: MR Controller event (seq 6280) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:05:49 dm03dbadm01 MRdiagd: MR Controller event (seq 6281) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:06:08 dm03dbadm01 kernel: [20734108.557891] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 26 03:06:08 dm03dbadm01 kernel: [20734108.560714] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 26 03:06:09 dm03dbadm01 kernel: [20734108.979049] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 26 03:06:19 dm03dbadm01 MRdiagd: MR Controller event (seq 6282) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:06:49 dm03dbadm01 MRdiagd: MR Controller event (seq 6283) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:07:19 dm03dbadm01 MRdiagd: MR Controller event (seq 6284) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
Aug 26 03:07:48 dm03dbadm01 MRdiagd: MR Controller event (seq 6285) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=65 (LD:Progress)
......
Aug 26 04:00:55 dm03dbadm01 MRdiagd: MR Controller event (seq 6376) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=58 (LD:Info)
Aug 26 04:06:30 dm03dbadm01 MRdiagd: MR Controller event (seq 6377) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=94 (PD:Progress)
Aug 26 04:06:30 dm03dbadm01 MRdiagd: MR Controller event (seq 6378) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=94 (PD:Progress)
Aug 26 04:06:36 dm03dbadm01 MRdiagd: MR Controller event (seq 6379) tracer=Controller_500062b2012b7100 ctrlId=500062b2012b7100 code=94 (PD:Progress)
......
Aug 27 03:06:08 dm03dbadm01 kernel: [20820305.106942] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 27 03:06:08 dm03dbadm01 kernel: [20820305.109701] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 27 03:06:09 dm03dbadm01 kernel: [20820305.542352] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
......
Aug 28 03:06:07 dm03dbadm01 kernel: [20906500.548825] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 28 03:06:08 dm03dbadm01 kernel: [20906500.904938] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
......
Aug 29 03:06:08 dm03dbadm01 kernel: [20992697.292202] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 29 03:06:08 dm03dbadm01 kernel: [20992697.294315] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success
Aug 29 03:06:59 dm03dbadm01 kernel: [20992748.722111] megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success

可以看出,在每天的凌晨3点06分,都会生成“megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success”这条信息, 这应该是RAID卡的例行检查工作。

(3).继续看26号这天RAID生成的其他日志,例如:code=65 (LD:Progress) 和 code=94 (PD:Progress)等。 code=65,代表逻辑驱动器的一致性校验进行中,通常代表进度更新,每完成一定百分比汇报一次。code=94,代表物理驱动器的一致性校验进行中。 这说明当前的RAID卡在进行磁盘检测工作。

(4).一些常见的RAID Event Messages code,如下所示:

code=110 (PD:Info) - this would be event 0x006e - Logged when recovery completed successfully and fixed a medium error

code=58 (LD:Info) - this would be 0x003a - Logs Consistency Check is being done on a LD

code=65 (LD:Progress) - this would be 0x0041 - Logs Consistency Check progress on a LD, will log when CC is complete.

code=112 (PD:Warning) - this would be 0x0070 - Logged when a drive is removed from the controller

code=251 (LD:Critical) - 0x00fb - Logged when a logical drive state changes to degraded state

code=445 (PD:Warning) - 0x01bd - Warning that Patrol Read was aborted on a PD. Typically this is aborted because Consistency Check is already running, and these cannot run concurrently, so this is not actually a problem.

(5).假如出现code=268 (PD:Warning) 或者 code=223 (SAS:Warning)之类的日志,就需要引起关注。完整的Event Messages,可以参考RAID卡的官方手册。如图所示:

image

 案例总结

在本案例中,/var/log/message日志中的这些关于RAID的日志,属于RAID卡日常例行检查工作产生的正常日志,可以忽略。