惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

美团技术团队
N
Netflix TechBlog - Medium
WordPress大学
WordPress大学
云风的 BLOG
云风的 BLOG
J
Java Code Geeks
V
Visual Studio Blog
H
Help Net Security
Engineering at Meta
Engineering at Meta
Hugging Face - Blog
Hugging Face - Blog
Microsoft Security Blog
Microsoft Security Blog
腾讯CDC
博客园 - 【当耐特】
B
Blog
Stack Overflow Blog
Stack Overflow Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
大猫的无限游戏
大猫的无限游戏
GbyAI
GbyAI
博客园 - 司徒正美
博客园 - 叶小钗
Y
Y Combinator Blog
MyScale Blog
MyScale Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
G
Google Developers Blog
酷 壳 – CoolShell
酷 壳 – CoolShell

博客园 - 石云华

gpnptool手动修改GPnP-Profile信息,解决GI集群因心跳配置异常而无法启动的问题 hugePage配置不当,浪费太多物理内存,内存不足导致集群重启 terminating the instance due to error 472,故障原因分析 Exadata存储节点的RPM数据库损坏 duplicate方式搭建DataGuard时,报ORA-19563: header validation failed for file错误 Oracle 19.25 RAC 业务 IP 平滑变更实操 EM13c监控Exadata,提示Agent Unreachable Exadata环境中的CVE-2026-31431漏洞说明 /var/log/message日志中的“megaraid_sas 0000:65:00.0: Application firmware crash dump mode set success”信息 DBCA后,只能启动一个实例,都是rp_filter惹的祸 分析Exadata写入慢的性能故障 数据库集群中的bond1接口出现网络丢包 EM13告警:Metric evaluation error start - oracle.sysman.emSDK.agent.fetchlet.exception.FetchletException: Permission denied(publickey,password) Exadata,更换完思科交换机后,与上联交换机无法通信 Exadata更换计算节点的硬盘 Exalogic虚拟机的网络无法启动,提示Device has different MAC address than expected 单个ASM磁盘free空间为0,导致rebalance时提示“ASM磁盘组空间耗尽(ORA-15041)” Exadata的思科交换机,重启后进入到了rommon模式 SYSAUX表空间中的SYS.EXP_HEAD$表,占用大量空间 PX并行进程产生大量的trace日志,导致文件系统撑爆 回收站存在大量对象,导致Insert into...select语句夯住 用dg broker执行switchover时,报0RA-01017 增量备份恢复的方式修改缺失归档的DataGuard 未设置min_free_kbytes参数,导致操作系统进行页缓存回收时,整个操作系统夯住 Exadata数据库性能异常,备份进程卡住 MySQL 5.7版本,搭建一个两主一从的多源主从复制环境 恢复某个数据文件不适当,导致DataGuard无法open数据库 Exadata计算节点的内存出现故障,导致CPU耗尽 Bug 34885986 - Flashback log file was not reused even if db_flashback_retention_target is passed
Exadata更换Infiniband交换机
石云华 · 2026-04-10 · via 博客园 - 石云华

1、故障概述

客户的一台Exadata X3-2, 前段时间在巡检的过程中,发现其中一台Infiniband交换机有“坏块”的告警信息。这块,这台交换机彻底故障,已经无法启动。经过分析,发现该交换机的主板已经损坏 。只能更换新的Infiniband交换机。

本文主要描述更换Infiniband交换机的主要步骤。

[root@ex01sw-iba0 ~]# showunhealthy
WARNING Flash disk has bad blocks
FAILURE - 1 sensors NOT OK
[root@ex01sw-iba0 ~]#

image

2、故障解决。

幸亏在第一次发现有坏块时,及时对交换机的配置信息做了备份。

1. 备份Infiniband交换机的配置信息。
参考:How To Back Up and Restore Switch Settings for Sun Datacenter InfiniBand Switch 36 & Gateway Switch
具体步骤:
(1).用ilom-admin用户登录Infiniband交换机的ILOM URL。例如:http://dbm002-i1.us.example.com.
(2).选择Maintenance页面。
(3).选择Backup/Restore选项。
(4).选择Backup操作,并且选择Browser方式。
(5).输入assphrase。类似于备份密钥。
(6).点击Run,最终保存为XML文件。
(7).备份/root/.ssh/authorized_keys、/home/nm2user/.ssh/authorized_keys、/etc/hosts 和 /etc/opensm/opensm.conf。
(8).保存version命令输出。
(9).保存setsmpriority list命令输出。

2. 升级新交换机的固件版本。
在新交换机更换之前,检查新交换机的固件版本与当前环境中的版本是否一致,如果不一致,在更换之前,先升级新交换机的固件版本。
# version

3. 恢复新交换机的配置信息。
在新交换机更换之前,利用备份的信息来恢复这台新交换机。
参考:How To Back Up and Restore Switch Settings for Sun Datacenter InfiniBand Switch 36 & Gateway Switch
具体步骤:
(1).在恢复配置之前,执行version命令,确保新交换机的固件版本与现有环境中的版本完全一致。
(2).用ilom-admin用户登录Infiniband交换机的ILOM URL。例如:http://dbm002-i1.us.example.com.
(3).选择Maintenance页面。
(4).选择Backup/Restore选项。
(5).选择Restore操作,并且选择Browser方式。
(6).点击Browse,并且选择备份的XML文件。
(7).输入assphrase。
(8).点击Run,最终进行恢复操作。
(9).还原/root/.ssh/authorized_keys、/home/nm2user/.ssh/authorized_keys、/etc/hosts 和 /etc/opensm/opensm.conf。
(10).重启openSM服务。
# disablesm
# enablesm

4. 如果需要更换的Infiniband交换机为master,则需要手动切换成standby。
具体步骤:
(1).用ibswitches命令检查当前环境有几台Infiniband交换机。
(2).检查所有Infiniband交换机上的opensmd服务是否正常运行。
service opensmd status
(3).检查哪台交换机是master。
# sminfo
或者
# getmaster
(4).如果需要更换的Infiniband交换机为master,则需要手动执行命令将master切换至其他交换机上。
# disablesm
(5).再次检查master是否已经切换至其他交换机上。
# sminfo
或者
# getmaster

5. 正式更换Infiniband交换机。
(1).拔掉Infiniband交换机的电源插头,关闭交换机。
(2).拔掉Infiniband交换机上的所有网线。
(3).将交换机从机架的前部取出。
(4).更换新的交换机。
(5).插入网线。
(6).插入电源线。
(7).验证网络连通性。
/opt/oracle.SupportTools/ibdiagtools/verify-topology