查的错误原因,如果是工作状态下出现这些硬件损坏,则系统将被挂
起或宕机。
其损坏对仅对系统产生功能影响(机器不会宕机并能正常启动)的硬
件包括:
网卡、本地硬盘有坏块、显卡、SSA卡和其他外围设备
这些设备的损坏只影响特定功能,如网络功能、显示功能、访问磁阵的功能等,对于本地硬盘有坏块的情况,则要看坏块中是否包含了重要的系统文件,如果不是重要系统文件,则系统功能不受影响,但也
建议立即更换该硬盘。
故障定位和排除:
以上硬件故障信息都可以使用:
液晶屏上的错误码或:
errpt –dH 查看到
根据错误码确定是什么硬件出了故障,对商用系统来讲,由于是双机系统,如果损坏机器是主机可以将此服务器切换成备机,然后修复故
障机器,恢复系统。
3.2磁阵故障
磁阵引起的故障是目前碰到的最频繁、危害最大的故障,据不完全统计,其故障覆盖到总故障的70%以上,具体来讲,可能引起磁阵故障
的环节包括:
磁阵硬盘、7133柜子、主机上的SSA卡、连接7133与主机的SSA线、硬盘的位置和ssa线的接线方式、以及盘柜使用的电压及周围磁场、
磁阵/硬盘/ssa卡的微码等都可能造成7133的异常。
7133磁阵的问题是最复杂的,一般有物理损坏的原因也有环境原因,这是主因,如接线、插盘位置不符合要求、未及时查看系统告警等造成系统中断等辅因。按照我们的经验,不管是什么硬件故障导致7133故障,系统都会产生告警,如果能及时发现问题并采取措施,一般都
能防止故障的发生。
故障定位:
7133硬件故障也可以使用:
errpt –dH 查看到
伴随的错误码有:
B4C00618 0115140004 P H ssa0 RESOURCE UNAVAILABLE
FE9E9357 0401082304 P H ssa0 DISK OPERATION ERROR
FE9E9357 1205000803 P H pdisk3 DISK OPERATION ERROR
03913B94 1122031103 U H LVDD HARDWARE DISK BLOCK
RELOCATION ACHIEVED
613E5F38 1121125103 P H LVDD I/O ERROR DETECTED BY LVM
625E6B9A 0401090004 P H ssa0 ADAPTER DETECTED OPEN
SERIAL LINK
26CA120B 0206081104 P H ssa0 CACHE STORAGE CARD
所有的错误码都预示着7133有异常,红色部分则表示肯定出现了硬件故障,需要立即进行检查并采取措施,否则磁阵将很快不能访问。对
于蓝色部分:
625E6B9A 0401090004 P H ssa0 ADAPTER DETECTED OPEN
SERIAL LINK
表示ssa出现了开环,出现开环不仅影响IO性能,也增加了风险,即
如果另一个环路也出现问题,将不能访问磁阵。
开环一般有两种情况:1)如果625E6B9A报错比较频繁,如每天几次,则表示系统很有可能出了硬件故障,虽然不会导致访问磁阵失败,但需要立即查出原因并解决。查错方法可以参考下面的描述。2)如果 625E6B9A错误偶尔报一次,则要具体情况具体对待,有可能是读写忙出现的误报,也按下面方法进行排查,如果没有查出具体的原因,则
可以继续观察。
26CA120B 0206081104 P H ssa0 CACHE STORAGE CARD
该错误一般是在:SSA卡带write cache并打开FastWrite,而ssa卡上用于write cache供电的可充电镍镉电池达到或接近安全寿命的情况下产生的。这类错误产生将影响IO写性能,并且由于在FastWrite打开的情况下,主备机需要同步ssa卡上的write cache,所以甚至
会影响到主备机同步。具体解决方法可参考下文。
故障排除:
对于红色部分错误的问题排除,一般可以使用diag命令进行进一步诊
断:
#diag -> Task Selection -> SSA Service Aids -> Link Verification
检查环路中是否出现了???的盘符或状态不是good的硬盘
或使用:
#smitty ssaraid -> List All Defined SSA RAID Arrays
查看磁盘阵列RAID盘的状态是否是Good。如果是degrade或其他状
态表示RAID盘出现问题了
这时候不建议再进行单独硬盘的Certify,而是赶紧通知IBM准备好相同型号和大小的硬盘(至少两块)到现场进行进一步的诊断和坏盘更
换。
625E6B9A 0401090004 P H ssa0 ADAPTER DETECTED OPEN
SERIAL LINK
的排查方法:
1、要求将7133中未插硬盘的槽位全部插上dummy盘。 (dummy盘:哑元盘,就是那个空壳子,相当于代替SSA硬盘装在磁盘阵列的塑料模
型,当磁盘阵列的16个槽位没有被SSA硬盘插满时才用到.)
2、看看Loop状态:diag--->Task Selection-->SSA Service Aids-->Link Verification.正常Adapter Port下的两列数字是连续不间断的排列,且Status都为good,如果Physical列有???????符号.或Status不是good,则说明已经存在硬盘或链路故障,这种情况则
要立即采取行动,做进一步检查以确定是否要更换硬盘。检查单盘是
否有问题的方法如下:
diag--->Task Selection-->SSA Service Aids-->Certify Disk
选择认为存在故障的硬盘进行检查
3、如果7133存在硬件故障时,可从状态灯上观察到:
当单块硬盘出现故障或未被使用时,其面板上的硬盘状态灯会不亮
阵列的状态灯黄灯会亮
或接SSA线的端口的指示灯也会熄灭
如果通过以上三种方法都未发现问题,而系统仍报Open Serial Link
错误,建议继续跟踪。
26CA120B 0206081104 P H ssa0 CACHE STORAGE CARD
的处理方法:
背景介绍:
IBM小型机上连接7133磁阵所配置的SSA卡一般都带有一块充电电池,该电池用于在突然停电的情况下保护ssa卡上的fast write cache中的信息不丢失,这块电池的安全寿命一般是22000小时,差不多两年半的时间,也就是说,当fast write模式启动的情况下,一
般两年半以后需要更换这块电池。