简介:这份文档是IBM System x3650 M3服务器RAID配置的实操指南,主要面向需要独立完成存储阵列部署的服务器运维工程师、系统集成商和机房管理人员。内容围绕ServeRAID MR系列控制器的WebBIOS配置工具展开,按实际配置顺序介绍了启动进入配置界面的快捷键、多控制器选择方式、逻辑视图与物理视图的区别,以及适配器属性、虚拟磁盘、物理磁盘、热备盘、事件日志等常用菜单的具体作用。同时,文档重点说明了配置向导中清除配置、新建配置、添加配置三种模式的差异和数据安全风险,并对RAID 0、1、5、6、10各等级在冗余能力、性能表现和可用容量上的特点做了归纳。整个资源为单个doc文档,压缩包大小约1.31MB,便于下载后直接在服务器旁查阅或打印。目前该资源已有104人学习下载,适合刚接触IBM服务器RAID配置的入门者,也适合需要快速核对WebBIOS菜单功能的日常运维人员作为参考手册。
1. x3650 M3 做 RAID,为什么绕不开 Ctrl+H:一台老服务器的开篇
接手一台转手过好几轮的 IBM System x3650 M3,最头疼的不是机器点不亮,而是它插着六块盘,你却不知道哪块是系统盘。开机自检的时候每块硬盘都正常亮灯,进系统之后只能看到一块盘,十有八九是上一手把 RAID 配置留在阵列卡里,或者阵列压根没建。这台 2010 年前后发布的服务器,到今天还大量出现在旧机房、二手市场、虚拟化测试环境里,靠的是 Intel 5500 平台配 ServeRAID 阵列卡的成熟组合。所谓“做 RAID”,在 M3 上基本就是一件事:开机按 Ctrl+H 进入 WebBIOS,把物理盘组织成虚拟驱动器。这篇文章把完整流程、参数取舍、批量命令和容易翻车的几个现场一次讲清楚。
2. 动手之前先认硬件:M5015 与 M1015 的差别、RAID 级别怎么选
x3650 M3 整个生命周期里出现过两种主流的盘控方案:板载的 M1015 和 PCIe 插槽上的 M5015。你在网上搜“x3650 m3 raid”出来的问题帖,一半以上的翻车现场都跟这两块卡分不开。做规划之前,先低头看一眼机器,别上来就按快捷键。
2.1 一眼认出 M5015 还是 M1015
M1015 是 LSI SAS2008 芯片的方案,通常板载直连背板,没有独立缓存,也没有电池。M5015 是 LSI SAS2108 芯片,带 512MB 缓存和一颗可更换的 BBU 电池,一般插在机箱后部或侧面的 PCIe 槽上。区分方法很简单:开机进 WebBIOS 之后看 Adapter 信息里有没有 Cache Size 和 BBU 字样,有就是 M5015;另外直接拆侧板看阵列卡上有没有一块小方电池,也能一眼认出来。
这两张卡决定了你能用的 RAID 策略。M1015 没有缓存,做 RAID 5 的随机写入性能很难看,因为每条写 I/O 都要做奇偶校验并落到物理盘上;M5015 有写缓存加电池保护,RAID 5 的写入才有实用价值。所以配置之前先确定手里是哪张卡,后面的 Write Policy 和 RAID 级别选择都依赖这个前提。
提示:如果手头机器连 WebBIOS 都进不去,先别急着拆机。很多情况下不是硬件坏了,而是阵列卡的 Option ROM 被上一手关闭,具体处理方式看第 5 章。
2.2 RAID 0/1/5/10 的区别与选型:一张表讲透
“RAID 0 1 5 10 区别”是搜索这个标题时最常被带出来的问题。在 x3650 M3 上,M5015 支持 RAID 0、1、5、6、10 和 50、60,M1015 也能支持其中大部分级别,但硬件缓存差异让实际表现差很多。先看这张选型表:
| 级别 | 最少盘数 | 可用容量 | 随机写表现 | 容错能力 | M3 上建议用途 |
|---|---|---|---|---|---|
| RAID 0 | 1 | 100% | 好 | 无 | 临时计算数据、测试环境 |
| RAID 1 | 2 | 50% | 一般 | 1 块盘 | 操作系统盘 |
| RAID 5 | 3 | (n-1)/n | 差(写惩罚) | 1 块盘 | 数据盘、备份存储 |
| RAID 10 | 4 | 50% | 好 | 每个镜像组 1 块 | 数据库、虚拟机存储 |
M3 最常见的组合是:两块 SAS 10K 盘做 RAID 1 装系统,四块以上盘做 RAID 5 或 RAID 10 放业务数据。RAID 0 在服务器上只建议放临时数据,坏了能重新生成的东西才丢上去。机器内存小于 64GB、跑传统数据库的,数据盘优先 RAID 10,因为 RAID 5 在随机写入场景下延迟偏高;如果是文件服务器、备份库这类顺序读写为主,RAID 5 的容量利用率更好。
2.3 盘位、背板与 SSD 混插的边界
x3650 M3 前面板有 2.5 英寸或 3.5 英寸盘位,背板同时支持 SAS 和 SATA。配置之前把每块盘的型号、容量、序列号顺着盘位记下来,不要相信盘位标签。很多时候上一手把盘插乱了,你在 WebBIOS 里看到的是按背板端口枚举的编号,不是物理位置。M3 这代机器对 SSD 的支持属于“能用但别指望高速”,因为背板是 6Gbps SAS 接口,SATA SSD 也能识别,但没有 U.2/NVMe 的概念。如果计划用 SSD 做虚拟化缓存,SATA SSD 直连阵列卡做 RAID 1 可行,但不要和老机械盘混在同一组里。
3. WebBIOS 建阵列全流程:从 Ctrl+H 到系统认盘的分步操作
M3 上没有图形化的 RAID 管理界面,WebBIOS 就是最直接的交互入口。这章按实际操作的顺序走一遍,每个界面选什么、为什么这样选,边上解释到位。
3.1 如何进入 RAID 设置:进 WebBIOS 前的两个 BIOS 开关
开机自检时,屏幕下方会出现类似 “Press + for WebBIOS” 的提示,这时候按 Ctrl+H 就能进入阵列卡配置界面。但如果你发现这个提示根本没出现,或者按了没反应,先检查两个地方。
第一个是 F1 进入的 UEFI Setup 里,Devices and I/O Ports 菜单下阵列卡的 Option ROM 必须设为 Enabled。这个开关控制着自检时是否加载阵列卡 BIOS,被关掉后 Ctrl+H 自然失效。第二个是启动模式,如果 BIOS 设成 UEFI Only,部分 M5015 固件版本不会显示 WebBIOS 入口,需要改成 Legacy Only 或 Both。和浪潮、曙光服务器开机按 Ctrl+R 进 RAID 的方式不同,IBM 的 x86 服务器走的是 Ctrl+H,这个差异经常让习惯了其他品牌的运维在 M3 上找不到北。
# 传统 BIOS 引导下,开机自检按 F1 进入 UEFI Setup # 在 Devices and I/O Ports 菜单中确认: # IBM ServeRAID M5015 (or M1015) Option ROM = Enabled # 若使用 UEFI 引导,需要在 Boot Manager 中选择 # IBM ServeRAID M5015 Configuration Utility 作为启动项这段操作里最关键的是 Option ROM 开关和启动模式两个前提。M3 的 UEFI 菜单是 IBM 定制过的,不要拿其他品牌服务器的 BIOS 菜单结构去套。如果机器跑的是传统 Legacy 引导,只需确认 Option ROM Enabled,然后重启等 Ctrl+H 提示即可。
3.2 从 Configuration Wizard 到 Virtual Drive 创建
进入 WebBIOS 后会先让你选控制器,如果机器插了多块阵列卡会列出多个 Adapter,选中目标卡后点 Start。主界面左侧是菜单树,右侧是物理盘和虚拟驱动器状态。创建阵列的入口在 Configuration Wizard,这里有几个关键选项:
# Adapter Selection(选择 M5015 或 M1015) -> Start # 主界面 -> Configuration Wizard -> New Configuration # New Configuration 会清空所有虚拟驱动器,除非是全新机器,否则先确认旧配置没用 # 配置方式选 Manual,不要选 Redundant,后者会自动重组旧配置,容易出歧义 # 从 Available Drives 中勾选物理盘,加入 Drive Groups # 点击 Accept DG 后进入 Virtual Drive 配置界面: # RAID Level = RAID5 # Select Size = 使用全部容量 # Strip Size = 256KB # Read Policy = Read Ahead # Write Policy = Write Back with BBU # IO Policy = Direct # Initialize 选择 Initialize 做后台初始化 # Accept -> Yes -> 回到主界面确认 Virtual Drive 状态为 OptimalManual 配置方式意味着你自己控制哪些盘进阵列、什么级别、什么策略,逻辑清晰,排查问题也方便。Strip Size 的取值影响顺序读和随机读的比例,OLTP 类数据库建议 64KB,大文件存储建议 256KB。Read Policy 选 Read Ahead 适合顺序读,混合负载可以选 Adaptive Read Ahead,让阵列卡自己判断。Write Policy 单独说:有 BBU 的 M5015 选 Write Back with BBU,性能最好;M1015 没有电池,选 Write Back 会出现掉电丢缓存数据风险,建议选 Write Through。
3.3 初始化、启动项与系统识别
创建完成后虚拟驱动器处于 Initializing 状态。初始化有三种选择:No Init 速度快但元数据没完全建立,生产环境不建议;Fast Init 几秒完成,标记后台慢慢建;Full Init 耗时最长但最干净。我一般用 Full Init,同时继续装系统或做其他事,等初始化在后台跑完。
# 阵列状态确认:WebBIOS 主界面查看 Virtual Drive 状态 # 状态为 Optimal 表示阵列正常 # 状态为 Degraded 表示有盘掉线,先别急着装系统 # Raid Level 栏确认是 RAID5 / RAID1 / RAID10,别把级别建错装系统时还有一个常见问题:Windows Server 2008 R2 或 2012 安装界面认不到逻辑盘,需要提前加载 MegaRAID 驱动;Linux 发行版一般能直接识别到 /dev/sda。如果你在 UEFI 引导下装系统,记得启动项里选虚拟驱动器,而不是把物理盘当作启动设备,否则重启后可能又掉回 BIOS。阵列建完、系统装好之后,还有一件事要在这一章收尾:把控制器型号、固件版本、逻辑盘序号、物理盘序列号记录下来,后续排障全靠这份台账。
4. 批量配置不靠鼠标:用 MegaCLI 与 storcli 在 Linux 下快速建 RAID
WebBIOS 适合一台台处理,但一次性配置十几台 M3,或者机器放在远端机房只给你 SSH,再用界面操作就不现实了。M5015/M1015 都是 LSI 芯片,Linux 下可以用 MegaCLI 和 storcli 做同样的操作。这一章解决一个具体问题:Linux 如何查询是否有 RAID、怎么批量建阵列。
4.1 MegaCLI 的安装与查询命令:先摸清现有阵列
MegaCLI 是 LSI 为 MegaRAID 系列提供的命令行工具,IBM 的 OEM 版本也沿用这套命令。安装后执行文件通常在 /opt/MegaRAID/MegaCli/ 目录下。装完第一件事不是建阵列,而是查询当前状态:
# 查看阵列卡整体信息 /opt/MegaRAID/MegaCli/MegaCli64 -AdpAllInfo -aALL # 查看所有逻辑盘的状态(级别、容量、状态) /opt/MegaRAID/MegaCli/MegaCli64 -LDInfo -Lall -aALL # 查看物理盘状态,里面包含 Enclosure 和 Slot 编号 /opt/MegaRAID/MegaCli/MegaCli64 -PDList -aALL-aALL 表示对所有阵列卡执行,-Lall 表示列出全部逻辑盘。PDList 输出里最有用的是 Firmware state 字段,Online 表示这块盘正常在阵列里,Rebuild 表示正在重建,Failed 就是已经掉了。另一个关键信息是 Enclosure Device ID 和 Slot Number,这两个数字会直接用在后面的建阵列命令里。
4.2 用 MegaCLI 创建、删除阵列的参数说明
查询清楚之后,创建阵列就是一条命令的事。MegaCLI 用方括号把盘位分组,格式是 [EnclosureID:SlotNumber],多块盘用逗号分隔:
# 三块盘创建 RAID5,Enclosure 252 的 0、1、2 号槽位 /opt/MegaRAID/MegaCli/MegaCli64 -CfgLdAdd -r5 [252:0,252:1,252:2] -a0 # 两块盘创建 RAID1 /opt/MegaRAID/MegaCli/MegaCli64 -CfgLdAdd -r1 [252:5,252:6] -a0 # 删除逻辑盘,注意:数据会全部清空 /opt/MegaRAID/MegaCli/MegaCli64 -CfgLdDel -L0 -a0-a0 后面的数字是 Adapter 编号,单卡机器就写 -a0。创建 RAID 5 三块盘,可用容量约等于最小盘容量乘以两块盘的大小;如果有盘容量不一致,阵列按最小容量盘计算。删除命令 -CfgLdDel -L0 表示删除第一个逻辑盘,执行前一定用 LDInfo 确认 L0 是你要删的那组,这条命令没有后悔药。
4.3 storcli:新系统里的替代工具与 ESXi 场景
MegaCLI 的旧版本在 RHEL 7/8、Ubuntu 18 以上的 glibc 版本里经常报错,这时候建议用 storcli,命令语法更统一,输出也更易读:
# 查看控制器和逻辑盘状态 storcli /c0 show # 创建 RAID10,Enclosure 252 的 0~3 号盘 storcli /c0 add vd type=raid10 drives=252:0-3 size=all # 查看某一块物理盘的具体信息 storcli /c0/e252/s0 show/c0 是控制器 0,/e252 是 Enclosure 252,/s0 是 0 号槽位,drives=252:0-3 表示连续槽位的简化写法。如果你要管理的机器跑的是 ESXi,MegaCLI 不具备直接安装条件,storcli 也没有原生版;ESXi 场景我一般分两步:先用 Linux 引导盘把 RAID 建好,确认逻辑盘状态 Optimal,再正常安装 ESXi。还有一类情况是安装 ESXi 时认不到逻辑盘,这通常不是阵列问题,而是安装镜像缺 M5015 的驱动,属于第 5 章要展开的一个翻车点。
5. 避坑:x3650 M3 配 RAID 最容易翻车的五个现场
M3 这代机器的问题有个特点:故障本身不复杂,但症状藏得深。以下五个现场是我在实际处理中遇到过的经典场景,按“现象 → 原因 → 解决”的路径记录,方便你对照排查。
5.1 开机按 Ctrl+H 没反应,自检提示一闪而过
现象:开机自检时看不到 “Press + for WebBIOS” 提示,或者看到了但按键没反应,系统直接进入启动流程。
原因:最常见的是阵列卡 Option ROM 被上一手在 BIOS 里关闭了,自检阶段根本不加载 WebBIOS。其次是启动模式改成 UEFI Only 后,部分固件版本不再显示传统入口。还有一个容易被忽略的细节:键盘插在 KVM 延长线或 USB HUB 上,BIOS 阶段枚举不到。
解决:F1 进 UEFI Setup,Devices and I/O Ports 里把阵列卡 Option ROM 设为 Enabled;启动优先级改成 Legacy Only 或 Both;键盘直接插机箱前面板 USB 口,再重启试一次。这三步能解决九成以上的进不去问题。
5.2 新盘上机全部变成 Foreign 状态
现象:把上一台机器拆下来的盘插进 M3,WebBIOS 里硬盘状态不是 Ready 而是 Foreign,配置向导里无法把这些盘加入新阵列。
原因:盘上残留了上一块阵列卡的 RAID 元数据。M5015 或 M1015 检测到非本控制器生成的配置,会把它标记为 Foreign Configuration,防止你误操作覆盖数据。
解决:先确认盘上没有你需要保留的数据,然后 WebBIOS 主界面选择控制器,点击 Clear Foreign Configuration 清除残留配置。清完之后盘的 Firmware state 会变成 Ready,再进 Configuration Wizard 正常创建阵列。注意如果机器里存在多块卡的旧配置,清除前逐一确认是哪个 Adapter 的。
5.3 BBU 报错后写性能骤降,阵列卡自动降级
现象:日志里出现 BBU failed 或 battery learning cycle 报错,WebBIOS 里 Write Policy 从 Write Back 自动变成 Write Through,数据库写入延迟明显升高。
原因:M5015 的电池几乎永远处在“充电 → 自检 → 学习放电 → 再充电”的循环里。电池老化或者学习周期触发时,阵列卡检测不到掉电保护能力,自动把写策略降级为 Write Through,性能随之塌陷。
解决:用 MegaCLI 的 AdpBbuCmd -GetBbuStatus 查看电池状态,状态不是 Optimal 就考虑换新电池。新电池装上后要允许它跑完一次完整的充放电学习,学习期间性能会偏低,规划好维护窗口。创建阵列时把 Write Policy 显式选为 Write Back with BBU,让阵列卡了解你有电池保护,而不是让它自动揣测。
5.4 装 ESXi 认不到逻辑盘
现象:WebBIOS 里阵列状态明明 Optimal,但 ESXi 安装界面只看到本地 USB 或 SATA 设备,逻辑盘完全不显示。
原因:ESXi 安装镜像里没有包含 M5015 的 MegaRAID 驱动。老版本 ESXi 的兼容性列表里能找到,新版本官方逐步移除了对 M3 平台的支持,需要手动注入驱动。
解决:常见做法是用 IBM 官方提供的 M5015 驱动文件配合 ESXi Image Builder 打包一个自定义安装镜像,或者用带驱动的启动盘。图省事的话,先装 Linux 把阵列建好并确认系统能识别到 /dev/sda,再考虑 ESXi 的驱动问题。
5.5 换上新盘后重建反复失败,Rebuild 卡死在半路
现象:某块盘报警,换上同容量的新盘后自动开始重建,但执行到中途 Rebuild 失败,阵列状态一直停在 Degraded。
原因:现在市面上的大容量 SATA 盘大量采用 SMR 叠瓦式记录,这种盘的重建过程是长时间随机写负载,SMR 盘写放大严重,容易超时掉盘。老阵列卡的固件对 SMR 盘的容忍度很低,这也是最近几年“换新盘反而翻车”的主要源头。
解决:M3 这种老平台,换盘优先选 SAS 10K 盘或企业级 CMR 的 SATA 盘,数据库和虚拟化场景尤其不要用消费级 SMR 盘。买盘前查清楚型号是 SMR 还是 CMR,可以通过盘片数、缓存大小等参数做初步判断。别为了省预算在关键阵列里混入 SMR 盘,重建失败的恢复成本远高于省下的差价。
6. 阵列建完不是结束:验证、重建演练与日常巡检
配置完成只是第一步。一个 RAID 能跑三五年不出岔子,靠的是建完后的验证和长期巡检。我的固定套路是下面这三件事,每件都不复杂,但缺一件都容易在关键时刻被坑到。
6.1 用命令验证状态,认准几个关键字段
# 查看逻辑盘状态和重建进度 /opt/MegaRAID/MegaCli/MegaCli64 -LDInfo -Lall -aALL # 查看物理盘错误计数,重点看 Media Error 和 Other Error /opt/MegaRAID/MegaCli/MegaCli64 -PDList -aALL | grep -E "Firmware state|Media Error|Other Error"LDInfo 输出里看 State 是否为 Optimal,以及如果有重建在跑,能看到重建进度百分比。PDList 的 Media Error 和 Other Error 两个计数正常应该是 0,只要出现非零值,不管系统跑起来有没有异常,都该提前准备更换这块盘。错误计数是磁盘健康度最直接的信号,比看指示灯靠谱。
6.2 换块盘做一次真实的重建演练
头一回给 M3 换盘时,建议在业务低峰期做一次演练:用 LDInfo 确认哪块是数据盘,拔掉它,观察阵列状态变成 Degraded,再插回去触发自动重建,全程盯着 PDList 里的 Rebuild 进度。拔错盘的概率比你想象的高,尤其是多台机器堆在一个机柜里、盘位标签又模糊的情况下。演练一次之后你才能确认自己记录下来的 Enclosure 和 Slot 编号是对的,真正出故障时不会手忙脚乱。
6.3 电池保养与巡检习惯
# 查看 BBU 电池状态 /opt/MegaRAID/MegaCli/MegaCli64 -AdpBbuCmd -GetBbuStatus -aALL # 手动触发一次电池学习,便于安排维护窗口 /opt/MegaRAID/MegaCli/MegaCli64 -AdpBbuCmd -BbuLearn -a0电池的自动学习周期默认是三个月左右,学习期间写策略会短暂降级。如果业务不允许动不动性能跳水,可以手动触发学习,把时间安排在计划停机窗口。我的习惯是每次配完阵列,把控制器型号、固件版本、VD 序号、物理盘序列号和换盘记录写进维护台账,下次任何人接手都不用再猜。M3 上那些说不清的 RAID“玄学”故障,拆开看大多是掉电策略、驱动加载、盘类型这三个基础问题没排干净。希望这篇能帮你的 x3650 M3 从一块黑匣子变成一张清清楚楚的配置单,少走几步弯路,省几次返工,帮到你。
本文还有配套的精品资源,点击获取