网站大量收购独家精品文档,联系QQ:2885784924

[计算机]IBM P系列小型机_故障定位、故障排除.doc

[计算机]IBM P系列小型机_故障定位、故障排除.doc

  1. 1、本文档共10页,可阅读全部内容。
  2. 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
  3. 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  4. 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
[计算机]IBM P系列小型机_故障定位、故障排除

第三章、故障定位、故障排除 根据我们在实际商用系统中碰到问题,我们总结出了以下几种常见故障及其定位方式和解决方法。 3.1硬件故障 硬件故障有很多种,对系统产生的影响也不一样,这里按其故障对系统的影响程度分:致命影响的硬件故障和只影响功能的硬件故障两类进行硬件分类: 其损坏对系统产生致命影响(将使机器宕机或无法启动)的硬件包括: 主板、CPU、I/O柜(包含本地盘、光驱、PCI插槽等的柜子)或CEC柜(包含CPU/MEMORY等的柜子)、I/O柜I/O柜与CEC柜的接线、电源模块、风扇、本地硬盘、内存损坏等等 注:I/O柜和CEC柜一般在比较高端的小型机才有,如M80,低端的是合一的。 这些设备的损坏等将使系统无法完成自检、引导和启动,液晶显示屏上都将有错误信息,可根据液晶显示屏上的错误码对照Service Guide查的错误原因,如果是工作状态下出现这些硬件损坏,则系统将被挂起或宕机。 其损坏对仅对系统产生功能影响(机器不会宕机并能正常启动)的硬件包括: 网卡、本地硬盘有坏块、显卡、SSA卡和其他外围设备 这些设备的损坏只影响特定功能,如网络功能、显示功能、访问磁阵的功能等,对于本地硬盘有坏块的情况,则要看坏块中是否包含了重要的系统文件,如果不是重要系统文件,则系统功能不受影响,但也建议立即更换该硬盘。 故障定位和排除: 以上硬件故障信息都可以使用: 液晶屏上的错误码或: errpt –dH 查看到 根据错误码确定是什么硬件出了故障,对商用系统来讲,由于是双机系统,如果损坏机器是主机可以将此服务器切换成备机,然后修复故障机器,恢复系统。 3.2磁阵故障 磁阵引起的故障是目前碰到的最频繁、危害最大的故障,据不完全统计,其故障覆盖到总故障的70%以上,具体来讲,可能引起磁阵故障的环节包括: 磁阵硬盘、7133柜子、主机上的SSA卡、连接7133与主机的SSA线、硬盘的位置和ssa线的接线方式、以及盘柜使用的电压及周围磁场、磁阵/硬盘/ssa卡的微码等 都可能造成7133的异常。 7133磁阵的问题是最复杂的,一般有物理损坏的原因也有环境原因,这是主因,如接线、插盘位置不符合要求、未及时查看系统告警等造成系统中断等辅因。按照我们的经验,不管是什么硬件故障导致7133故障,系统都会产生告警,如果能及时发现问题并采取措施,一般都能防止故障的发生。 故障定位: 7133硬件故障也可以使用: errpt –dH 查看到 伴随的错误码有: B4C00618 0115140004 P H ssa0 RESOURCE UNAVAILABLE FE9E9357 0401082304 P H ssa0 DISK OPERATION ERROR FE9E9357 1205000803 P H pdisk3 DISK OPERATION ERROR 03913B94 1122031103 U H LVDD HARDWARE DISK BLOCK RELOCATION ACHIEVED 613E5F38 1121125103 P H LVDD I/O ERROR DETECTED BY LVM 625E6B9A 0401090004 P H ssa0 ADAPTER DETECTED OPEN SERIAL LINK 26CA120B 0206081104 P H ssa0 CACHE STORAGE CARD 所有的错误码都预示着7133有异常,红色部分则表示肯定出现了硬件故障,需要立即进行检查并采取措施,否则磁阵将很快不能访问。对于蓝色部分: 625E6B9A 0401090004 P H ssa0 ADAPTER DETECTED OPEN SERIAL LINK 表示ssa出现了开环,出现开环不仅影响IO性能,也增加了风险,即如果另一个环路也出现问题,将不能访问磁阵。 开环一般有两种情况:1)如果625E6B9A报错比较频繁,如每天几次,则表示系统很有可能出了硬件故障,虽然不会导致访问磁阵失败,但需要立即查出原因并解决。查错方法可以参考下面的描述。2)如果 625E6B9A错误偶尔报一次,则要具体情况具体对待,有可能是读写忙出现的误报,也按下面方法进行排查,如果没有查出具体的原因,则可以继续观察。 26CA120B 0206081104 P H ssa0 CACHE STORAGE CARD 该错误一般是在:SSA卡带write cache并打开FastWrite,而ssa卡上用于write cache供电的可充电镍镉电池达到或接近安全寿命的情况下产生的。这类错误产生将影响IO写性能,并且由于在FastWrite打开的情况下

文档评论(0)

ipbohn97 + 关注
实名认证
内容提供者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档