云计算运维

Windows Server 2003 - Windows Server 2019 系统工具,Linux系统脚本,Mysql、Nginx、PHP、Redis、K8S、Seafile、Weblogic 、Jenkins、DNS、DHCP、FTP、IIS、Zookeeper、Rabbitmq、Oracle、Tomcat、Mavrn等服务搭建维护,请关注我.

GZ-011:DELL R730 实战:ESXi 系统盘RAID1 单盘故障(故障代码:PDR1001 | 非原厂SSD替换 | 业务零中断)我是如何做到业务零中断的?


非原厂 SSD 替换、vMotion 迁移、自动重建全过程实录(附完整操作清单)

作者:李工

适用环境:服务器:DELL R730  系统:ESXi 7.0.3 RAID卡:PERC H730P Mini


📋 故障速览

项目 详情
故障现象 1号盘黄灯报警,iDRAC报PDR1001
影响范围 ESXi系统盘RAID1(单盘故障,冗余仍在)
业务影响 ——虚拟机正常vMotion迁移,主机未宕机
处理方式 冷替换硬盘 + 自动重建
耗时 约30分钟(含关机、更换、验证)

💡 核心结论前置:本次故障验证了生产环境ESXi系统盘做RAID1的必要性——单盘故障情况下主机未宕机、业务无感知。


一、故障现象

症状 说明
服务器前面板 硬盘位1号盘黄色故障灯(常亮)
iDRAC告警 PDR1001 Fault detected on drive 1 in disk drive bay 1. Check drive.
ESXi界面 主机存储状态显示红色叹号,但虚拟机仍可运行
硬盘本身 拔出后插入Windows USB硬盘盒,能正常识别,显示"设备运转正常"

⚠️ 李工提示:硬盘能被Windows识别 ≠ 没有故障。服务器RAID卡对硬盘错误容忍度远低于消费级系统,会提前预警"踢盘"。


GZ-011:DELL R730 实战:ESXi 系统盘RAID1 单盘故障(故障代码:PDR1001 | 非原厂SSD替换 | 业务零中断)我是如何做到业务零中断的?
GZ-011:DELL R730 实战:ESXi 系统盘RAID1 单盘故障(故障代码:PDR1001 | 非原厂SSD替换 | 业务零中断)我是如何做到业务零中断的?

二、环境信息

项目 详情
服务器型号 DELL PowerEdge R730
RAID卡 PERC H730P Mini
故障RAID组 Virtual Disk 0:OS-SSD,RAID1,223GB(ESXi系统盘)
原硬盘接口 SATA SSD
替换硬盘 金胜(KingSpec)240GB SATA SSD(非戴尔原厂,临时替代)
另一RAID组 Virtual Disk 1:DATA-SSD-4x960G,RAID10,1.745TB(数据盘,未受影响)
虚拟化平台 VMware ESXi 7.0.3

三、操作前准备

序号 准备事项 状态 备注
1 替换硬盘:SATA接口,容量≥原盘(240GB),建议SSD ✅ 金胜240GB SATA SSD 本案例实测可用
2 虚拟机已通过vMotion迁移至其他主机 ✅ 已迁空 生产环境必做或备份
3 记录ESXi管理IP、账号密码 ✅ 已确认
4 十字螺丝刀(拆装硬盘托架) ✅ 已准备 R730托架需4颗螺丝固定

⚠️ 致命误区:RAID1组内SAS和SATA不可混用!原盘是SATA,替换盘必须也是SATA。


四、操作流程(共6步)

第1步:定位故障硬盘

  • 服务器前面板找到亮黄色灯的硬盘槽位 → 本案例为 1号盘位
  • 确认灯色:黄色/琥珀色常亮 = 预测性故障(需更换)
GZ-011:DELL R730 实战:ESXi 系统盘RAID1 单盘故障(故障代码:PDR1001 | 非原厂SSD替换 | 业务零中断)我是如何做到业务零中断的?

第2步:服务器关机

  • 关闭ESXi主机上所有虚拟机(本案例已提前vMotion迁空)
  • 执行ESXi系统关机:Shutdown→ 等待服务器完全断电

⚠️ 本案例服务器已关机(SATA接口不支持热插拔),直接进行冷替换操作。


CC-015:VMware vMotion 实战——虚拟机在线迁移,业务不中断完整实操

第3步:物理更换硬盘

  1. 按下故障硬盘托架释放按钮,拔出整个托架
  2. 拆下托架上的故障硬盘(4颗螺丝)
  3. 将新硬盘(金胜240GB SATA SSD)装入托架,固定螺丝
  4. 将托架插回原槽位(1号盘位),推入直到听到"咔嗒"锁紧声

GZ-011:DELL R730 实战:ESXi 系统盘RAID1 单盘故障(故障代码:PDR1001 | 非原厂SSD替换 | 业务零中断)我是如何做到业务零中断的?


第4步:开机并进入RAID管理界面

  1. 接通电源,启动服务器
  2. 开机自检(POST)时,看到DELL徽标后反复按 F2 键
  3. 进入 System Setup→ Integrated RAID Controller 1: Dell PERC H730P Mini Configuration Utility
  4. 进入 Main Menu→ Virtual Disk Management
GZ-011:DELL R730 实战:ESXi 系统盘RAID1 单盘故障(故障代码:PDR1001 | 非原厂SSD替换 | 业务零中断)我是如何做到业务零中断的?

第5步:验证RAID重建状态

在 Virtual Disk Management中检查:

检查项 正常状态 本案例状态
Virtual Disk 0 状态 Ready 或 Optimal ✅ Ready
RAID级别 RAID1 ✅ RAID1
容量 223GB ✅ 223GB
后台初始化 100% 或 无提示 ✅ 自动完成

进入 Physical Disk Management确认两块物理盘:

硬盘 接口 容量 状态
Physical Disk 00:01:00 SATA SSD 223GB ✅ Online
Physical Disk 00:01:01 SATA SSD 237.875GB ✅ Online
GZ-011:DELL R730 实战:ESXi 系统盘RAID1 单盘故障(故障代码:PDR1001 | 非原厂SSD替换 | 业务零中断)我是如何做到业务零中断的?

第6步:等待后台初始化完成

  • 若看到 Background Initialization 0%→ 正常现象(RAID卡在校验两块盘数据一致性)
  • 进度达到100%后自动消失,无需干预

GZ-011:DELL R730 实战:ESXi 系统盘RAID1 单盘故障(故障代码:PDR1001 | 非原厂SSD替换 | 业务零中断)我是如何做到业务零中断的?

GZ-011:DELL R730 实战:ESXi 系统盘RAID1 单盘故障(故障代码:PDR1001 | 非原厂SSD替换 | 业务零中断)我是如何做到业务零中断的?

GZ-011:DELL R730 实战:ESXi 系统盘RAID1 单盘故障(故障代码:PDR1001 | 非原厂SSD替换 | 业务零中断)我是如何做到业务零中断的?


五、验证恢复结果

验证项 操作 预期结果 本案例
ESXi Web界面 登录ESXi主机 存储状态正常,无红色叹号 ✅ 正常
物理指示灯 查看前面板 新硬盘绿灯常亮 ✅ 绿色常亮
RAID状态 F2进入RAID管理 VD 0 状态 = Ready ✅ Ready
虚拟机运行 启动并运行虚拟机 正常无报错 ✅ 正常
ESXi存储 存储→ 数据存储 状态 = 已挂载 ✅ 已挂载

GZ-011:DELL R730 实战:ESXi 系统盘RAID1 单盘故障(故障代码:PDR1001 | 非原厂SSD替换 | 业务零中断)我是如何做到业务零中断的?
GZ-011:DELL R730 实战:ESXi 系统盘RAID1 单盘故障(故障代码:PDR1001 | 非原厂SSD替换 | 业务零中断)我是如何做到业务零中断的?

GZ-011:DELL R730 实战:ESXi 系统盘RAID1 单盘故障(故障代码:PDR1001 | 非原厂SSD替换 | 业务零中断)我是如何做到业务零中断的?

六、FAQ(实战避坑)

问题 解答
Windows能识别故障盘,服务器为何报警? Windows容忍度高,RAID卡对坏道/超时更敏感,会提前"踢盘"预警
非原厂硬盘能用吗? 可以,但不保证100%兼容。本案例金胜盘已验证可正常重建RAID1
RAID1重建需要多久? 223GB SSD约5~30分钟,取决于数据量
重建期间能开虚拟机吗? 可以,后台初始化优先级低,不影响业务
Background Initialization是什么? RAID卡后台校验两块盘数据一致性的任务,跑完才算真正稳定
重启后初始化从100%变0%正常吗? 正常! RAID卡重新触发校验,让其跑完即可
以后想换回原厂盘怎么办? 备份数据 → 删除RAID → 用两块新盘重建RAID1 → 恢复数据

七、关键结论(记死这6条)

序号 要点
1 接口必须一致:原盘SATA → 替换盘也必须SATA(SAS不可混用)
2 容量≥原盘:240GB替换240GB,重建后容量不变
3 非原厂盘可用:本案例验证金胜盘可正常重建(但建议优先原厂)
4 自动重建:插入新盘后RAID卡自动重建,无需人工干预
5 后台初始化:进度0%→100%是正常校验,耐心等待即可
6 最终确认:两盘均为Online、VD状态Ready → 恢复成功

八、数据盘组说明(免恐慌)

本服务器还有一组RAID10数据盘:

项目 详情
虚拟磁盘 Virtual Disk 1:DATA-SSD-4x960G
RAID级别 RAID 10
容量 1.745TB
状态 Ready(正常,未受影响)

此RAID组在本次故障中无需任何操作


九、【李工生产环境建议】ESXi 系统盘 RAID1 必要性

结合本次故障,谈一个生产环境的核心问题:ESXi 系统盘要不要做 RAID1?

说明:经费有限用的旧的SSD固态盘(容量小旧盘再利用),没想到这么快就出现问题。

✅ 强烈建议:生产环境 ESXi 系统盘做 RAID1(或 BOSS 卡双 M.2 镜像)

本次故障中,RAID1 发挥了三个关键作用:

作用 说明
单盘故障 ≠ 系统崩溃 1号盘黄灯报警,另一块盘撑住系统 → ESXi 持续运行
计划内维护而非紧急救火 告警但在线 → 可选择工作时间窗口处理,而非半夜应急
简化恢复流程 换盘 → 自动重建 → 无需重装ESXi、无需重新绑定vCenter

⚠️ RAID1 ≠ 万能,正确姿势是"三层防护"

防护层级 是否必须 说明
ESXi系统盘RAID1 ✅ 强烈建议 防单盘故障,保主机在线
ESXi主机配置备份(.tgz) ✅ 建议 Host → Actions → Export Configuration
虚拟机备份(Veeam/Replication) ✅ 生产必做 RAID1 不保护虚拟机数据

💡 本次业务零中断的真正原因

RAID1(系统盘冗余)+ 独立RAID10数据盘 + vMotion迁空虚拟机 = 三重保障

  • 分享: