儲存網絡中的光模組
儲存是對光模組最不寬容的環境:儲存陣列、HBA 和 SAN 交換機都會校驗模組身份,鏈路必須無損,一個臨界光模組表現出來的不是端口宕掉,而是應用時延升高。本頁說明光模組在儲存網絡各處的使用方式,以及需要注意的要點。
光模組所處的位置
| 位置 | 常見光模組 | 說明 |
|---|---|---|
| 儲存陣列前端口 | 16/32GFC SFP+/SFP28;25/100G 以太網 SFP28/QSFP28 | 陣列廠商發佈合格件清單,且通常出廠時已預裝光模組 |
| 主機 HBA | 16/32GFC SFP+/SFP28 | HBA 出廠時已配光模組;第三方模組通常能用,但會讓技術支援複雜化 |
| SAN 交換機端口與 ISL | 機房內用 SW,遠距離用 LW/ELW | 校驗最嚴格——見下文 |
| IP 儲存 NIC(iSCSI、NVMe/TCP、RoCE) | 25/100G 以太網光模組或 DAC | 遵循標準以太網規則 |
| 複製鏈路 | LW/ELW,或通過 DWDM 承載的 FC/以太網 | 距離與時延預算 |
無處不在的廠商校驗
儲存平台在三個層面校驗模組身份:
- SAN 交換機——許多交換機會將不合格光模組的端口狀態標記為 module invalid,並讓端口保持下線(FC 光模組)。
- 儲存陣列——控制器可能記錄 unsupported-SFP 警報,或拒絕啟動端口。
- HBA——通常比較寬容,但廠商技術支援在排查故障前可能要求使用合格光模組。
營運方最終普遍採用的實踐策略是:陣列和交換機端口使用合格光模組,在允許的地方使用第三方模組,並用編程工具讓替換模組呈現出嚴格端口所期望的身份資訊(參見 廠商鎖定)。
無損意味著「變慢」,而不是「宕機」
FC 和 RoCE 不會丟幀。因此,性能劣化的光模組會在其後端的 LUN 上表現為CRC 錯誤、信用停滯(慢排空,slow-drain)和時延上升——這會是一張儲存性能工單,而不是網絡故障報告。診斷路徑與任何鏈路故障相同(電平 → 清潔 → 更換 → OTDR),但必須從應用層症狀出發,逐步回溯到端口。
距離與複製
- 同步複製受時延限制——實際中最遠約 100 km——這就是城域容災站點使用 LW/ELW 光模組或通過 DWDM 承載 FC 的原因。
- 長距離 ISL 除了需要滿足光功率預算,還需要額外的緩衝信用;參見 SAN 網絡與距離。
監測
對每個 ISL 和陣列端口的 DDM 進行趨勢跟蹤:接收功率漂移和發射偏置電流增長,是激光器即將在某個週五夜裏失效的早期警告。安裝時應為每個光模組記錄基線數據。
在 CodingBox 中
每個光模組在進入儲存網絡之前都應在實驗室中讀取一遍:確認 FC 或以太網速率代碼、波長類型和廠商身份,記錄 DDM 作為基線;對於校驗嚴格的端口,則在 EEPROM editor 中將模組編碼為合格身份,同時在 code database 中保留原始資訊。
無損以太網對每條鏈路的要求——PFC、ECN、FEC、零 CRC: 儲存無損以太網;承載於其上的傳輸協議:NVMe over Fabrics。