IBM P系列小型机日常维护故障定位故障排除(4)

2020-02-21 18:14

查的错误原因,如果是工作状态下出现这些硬件损坏,则系统将被挂

起或宕机。

其损坏对仅对系统产生功能影响(机器不会宕机并能正常启动)的硬

件包括:

网卡、本地硬盘有坏块、显卡、SSA卡和其他外围设备

这些设备的损坏只影响特定功能,如网络功能、显示功能、访问磁阵的功能等,对于本地硬盘有坏块的情况,则要看坏块中是否包含了重要的系统文件,如果不是重要系统文件,则系统功能不受影响,但也

建议立即更换该硬盘。

故障定位和排除:

以上硬件故障信息都可以使用:

液晶屏上的错误码或:

errpt –dH 查看到

根据错误码确定是什么硬件出了故障,对商用系统来讲,由于是双机系统,如果损坏机器是主机可以将此服务器切换成备机,然后修复故

障机器,恢复系统。

3.2磁阵故障

磁阵引起的故障是目前碰到的最频繁、危害最大的故障,据不完全统计,其故障覆盖到总故障的70%以上,具体来讲,可能引起磁阵故障

的环节包括:

磁阵硬盘、7133柜子、主机上的SSA卡、连接7133与主机的SSA线、硬盘的位置和ssa线的接线方式、以及盘柜使用的电压及周围磁场、

磁阵/硬盘/ssa卡的微码等都可能造成7133的异常。

7133磁阵的问题是最复杂的,一般有物理损坏的原因也有环境原因,这是主因,如接线、插盘位置不符合要求、未及时查看系统告警等造成系统中断等辅因。按照我们的经验,不管是什么硬件故障导致7133故障,系统都会产生告警,如果能及时发现问题并采取措施,一般都

能防止故障的发生。

故障定位:

7133硬件故障也可以使用:

errpt –dH 查看到

伴随的错误码有:

B4C00618 0115140004 P H ssa0 RESOURCE UNAVAILABLE

FE9E9357 0401082304 P H ssa0 DISK OPERATION ERROR

FE9E9357 1205000803 P H pdisk3 DISK OPERATION ERROR

03913B94 1122031103 U H LVDD HARDWARE DISK BLOCK

RELOCATION ACHIEVED

613E5F38 1121125103 P H LVDD I/O ERROR DETECTED BY LVM

625E6B9A 0401090004 P H ssa0 ADAPTER DETECTED OPEN

SERIAL LINK

26CA120B 0206081104 P H ssa0 CACHE STORAGE CARD

所有的错误码都预示着7133有异常,红色部分则表示肯定出现了硬件故障,需要立即进行检查并采取措施,否则磁阵将很快不能访问。对

于蓝色部分:

625E6B9A 0401090004 P H ssa0 ADAPTER DETECTED OPEN

SERIAL LINK

表示ssa出现了开环,出现开环不仅影响IO性能,也增加了风险,即

如果另一个环路也出现问题,将不能访问磁阵。

开环一般有两种情况:1)如果625E6B9A报错比较频繁,如每天几次,则表示系统很有可能出了硬件故障,虽然不会导致访问磁阵失败,但需要立即查出原因并解决。查错方法可以参考下面的描述。2)如果 625E6B9A错误偶尔报一次,则要具体情况具体对待,有可能是读写忙出现的误报,也按下面方法进行排查,如果没有查出具体的原因,则

可以继续观察。

26CA120B 0206081104 P H ssa0 CACHE STORAGE CARD

该错误一般是在:SSA卡带write cache并打开FastWrite,而ssa卡上用于write cache供电的可充电镍镉电池达到或接近安全寿命的情况下产生的。这类错误产生将影响IO写性能,并且由于在FastWrite打开的情况下,主备机需要同步ssa卡上的write cache,所以甚至

会影响到主备机同步。具体解决方法可参考下文。

故障排除:

对于红色部分错误的问题排除,一般可以使用diag命令进行进一步诊

断:

#diag -> Task Selection -> SSA Service Aids -> Link Verification

检查环路中是否出现了???的盘符或状态不是good的硬盘

或使用:

#smitty ssaraid -> List All Defined SSA RAID Arrays

查看磁盘阵列RAID盘的状态是否是Good。如果是degrade或其他状

态表示RAID盘出现问题了

这时候不建议再进行单独硬盘的Certify,而是赶紧通知IBM准备好相同型号和大小的硬盘(至少两块)到现场进行进一步的诊断和坏盘更

换。

625E6B9A 0401090004 P H ssa0 ADAPTER DETECTED OPEN

SERIAL LINK

的排查方法:

1、要求将7133中未插硬盘的槽位全部插上dummy盘。 (dummy盘:哑元盘,就是那个空壳子,相当于代替SSA硬盘装在磁盘阵列的塑料模

型,当磁盘阵列的16个槽位没有被SSA硬盘插满时才用到.)

2、看看Loop状态:diag--->Task Selection-->SSA Service Aids-->Link Verification.正常Adapter Port下的两列数字是连续不间断的排列,且Status都为good,如果Physical列有???????符号.或Status不是good,则说明已经存在硬盘或链路故障,这种情况则

要立即采取行动,做进一步检查以确定是否要更换硬盘。检查单盘是

否有问题的方法如下:

diag--->Task Selection-->SSA Service Aids-->Certify Disk

选择认为存在故障的硬盘进行检查

3、如果7133存在硬件故障时,可从状态灯上观察到:

当单块硬盘出现故障或未被使用时,其面板上的硬盘状态灯会不亮

阵列的状态灯黄灯会亮

或接SSA线的端口的指示灯也会熄灭

如果通过以上三种方法都未发现问题,而系统仍报Open Serial Link

错误,建议继续跟踪。

26CA120B 0206081104 P H ssa0 CACHE STORAGE CARD

的处理方法:

背景介绍:

IBM小型机上连接7133磁阵所配置的SSA卡一般都带有一块充电电池,该电池用于在突然停电的情况下保护ssa卡上的fast write cache中的信息不丢失,这块电池的安全寿命一般是22000小时,差不多两年半的时间,也就是说,当fast write模式启动的情况下,一

般两年半以后需要更换这块电池。


IBM P系列小型机日常维护故障定位故障排除(4).doc 将本文的Word文档下载到电脑 下载失败或者文档不完整,请联系客服人员解决!

下一篇:崇文区2008年高三第二次模拟考试数学文科

相关阅读
本类排行
× 注册会员免费下载(下载后可以自由复制和排版)

马上注册会员

注:下载文档有可能“只有目录或者内容不全”等情况,请下载之前注意辨别,如果您已付费且无法下载或内容有问题,请联系我们协助你处理。
微信: QQ: