監測與管理:DDM、OSC、OCM、RFTS 與警報
無源線路是沉默的;圍繞它的有源基礎設施才是光纖鏈路實時資訊的唯一來源。每個光模組都在測量自己的光,每台放大器都報告其泵浦和增益狀態,ROADM 節點監視頻譜,監控信道在各站點之間傳送這一切,遠程測試系統則在光纖承載業務的同時向其發送 OTDR 脈衝。本頁闡述可見性的各個層次、它們各自觸發的警報及其含義、如何維護基線和趨勢、採集數據的協議與工具、如何把模組數據與光纖數據相互印證以定位故障,以及能在客戶察覺問題之前發現問題的監測體系應遵循哪些實用規則。
可見性的層次
| 層次 | 來源 | 能看到甚麼 | 詳情 |
|---|
| 光模組診斷(DDM/DOM) | 模組的監測光電二極管和傳感器,由主機讀取 | Tx 和 Rx 功率、激光器偏置電流、溫度、供電電壓;400G 及以上和相干模組還有前 FEC 誤碼率、色度色散、DGD、OSNR(VDM) | DDM 基礎、VDM 與 FEC 指標 |
| 主機端口計數器 | 交換機、路由器或 NIC 的 MAC/PCS | 鏈路狀態和抖動次數、FEC 已糾正和未糾正塊數、CRC 錯誤、PCS 錯誤塊 | 管理與監測 |
| 放大器遙測 | EDFA 和拉曼放大設備 | 輸入和輸出功率、增益、泵浦電流和溫度、輸入丟失、APR 狀態 | 放大與再生 |
| 光信道監測器(OCM) | 內置於 ROADM 和終端節點的頻譜分析儀 | 各信道的功率和有無、OSNR 估計值、傾斜 | 傳輸與接入設備 |
| 光監控信道(OSC) | 線路站點之間的專用波長(1 510 或 1 610 nm) | 跨段損耗、遠端警報、與無人值守站點的管理連接 | 同上 |
| 遠程光纖測試系統(RFTS) | 以 1 625 或 1 650 nm 耦合到在用光纖上的 OTDR 設備 | 光纖本身出現的新事件、損耗變化、斷點位置 | 維護與修復 |
| 環境傳感器 | 機櫃、接頭盒、機房 | 門禁、溫度、濕度、進水、市電和電池狀態 | 同上 |
| 記錄與基線 | 開通測試和鏈路檔案 | 每根光纖和每個模組的「正常」狀態是甚麼 | 文件與標示 |
警報及其含義
| 警報 | 觸發方 | 含義 | 首先檢查 |
|---|
| 信號丟失(LOS) | 接收器:無光 | 光纖中斷、遠端發射器關閉、波長或信道錯誤、跳線脫落 | 遠端 Tx 功率和鏈路狀態(無鏈路) |
| 失鎖、丟幀(LOL、LOF) | CDR、PCS、OTN 成幀器 | 有光但不可用:速率或 FEC 不匹配、色散或噪聲超出容限、功率過低 | Rx 功率與靈敏度的對比、速率和 FEC 設定 |
| Rx 功率低警告或警報 | 模組閾值 | 線路損耗增大,或遠端 Tx 下降;典型閾值比靈敏度高幾 dB | 遠端 Tx 和近端 Rx 的趨勢(閾值與警報) |
| Rx 功率高 | 模組閾值 | 對 ER/ZR 而言損耗太小,或放大後的輸出直接進入接收器 | 加裝衰減器 |
| Tx 功率低、激光器偏置電流高 | 模組 | 激光器老化或失效 | 偏置電流趨勢(Tx 偏置電流與激光器老化) |
| 溫度過高 | 模組或設備 | 氣流受阻、風扇故障、站點過熱、模組超出其溫度等級 | 站點環境(溫度與電壓) |
| 前 FEC 誤碼率上升、出現不可糾正塊 | 主機或模組的 FEC 統計 | 餘量正在被消耗——原因可能是功率、色散、PMD、反射或連接器髒污——鏈路尚未失效前的先兆 | 與 Rx 功率和 OSNR 相互印證 |
| 鏈路抖動 | 主機 | 接觸不良、反射、功率臨界、溫度循環 | 鏈路抖動 |
| 模組未識別或不受支援 | 主機 | 插接不到位、編碼問題、類型不兼容 | 廠商鎖定 |
| 放大器輸入丟失,APR 動作 | 放大器 | 上游光纖中斷;泵浦出於安全考慮已關閉 | 切勿繞過 APR;查找斷點(安全與操作規範) |
| 跨段損耗增加(OSC) | 線路系統 | 光纖劣化、彎曲、進水、跨段中連接器髒污 | 用 RFTS 或 OTDR 檢測該跨段(解讀 OTDR 曲線) |
| RFTS 新事件或損耗變化 | 遠程 OTDR | 在定位出的距離處出現新的彎曲、接續點劣化、進水或中斷 | 換算為路由位置,派單處理 |
| 開門、進水、市電失效、電池電量低 | 環境 | 該站點即將變成一處光纖中斷點 | 應在電池耗盡前派單處理 |
警報的層級關係很重要:一次光纖中斷會在每個波長上觸發 LOS,在放大器上觸發輸入丟失,在 OSC 上觸發跨段損耗,並引發十幾條業務警報——根本原因是位於層級最底部的那一個。
基線與趨勢
| 做法 | 規則 |
|---|
| 開通時建立鏈路檔案 | 記錄遠端 Tx、近端 Rx、兩個模組的偏置電流和溫度;雙向 OTDR;所有波長的損耗 |
| 按變化量警報,而不僅靠絕對閾值 | 比基線 Rx 低 2 dB 就應引起關注,遠早於模組自身的低功率警報 |
| 輪詢間隔 | 功率值 1–5 分鐘;計數器每分鐘;RFTS 掃描為每小時到每天一次 |
| 季節性變化 | 架空和戶外線路出現 ±1 dB 波動屬於正常現象——應予以記錄 |
| 每次變更後重新建立基線 | 更換模組、重新熔接、重新接跳線 |
| 精度 | DDM 的絕對精度為 ±1–2 dB,但重複精度達 ±0.1 dB——非常適合看趨勢,但不適合用於認證(精度與局限) |
| 數據保留 | 至少保留一年的功率歷史數據,以觀察緩慢劣化和季節性規律(監測) |
協議與工具
| 機制 | 提供的內容 | 說明 |
|---|
CLI(show interface transceiver 及同類命令) | 按需查看每個端口的 DDM 值 | 便於腳本化;語法因 NOS 而異(讀取 DDM 的工具) |
| SNMP 輪詢與陷阱 | DDM、計數器、設備警報 | 光學數值使用廠商 MIB;部分平台使用 ENTITY-SENSOR-MIB |
| 流式遙測(gNMI、OpenConfig、NETCONF) | 每隔幾秒提供 DDM 和計數器 | 採用 openconfig-platform-transceiver 模型;最適合看趨勢 |
| ethtool、mlxlink 等 NIC 工具 | 從伺服器 NIC 讀取 DDM | NIC 工具與診斷 |
| 線路系統 EMS/NMS | 放大器、OCM、OSC 數據及光層警報 | 北向介面採用 TL1 或 NETCONF |
| RFTS 軟件 | 曲線對比、事件警報、距離的 GIS 地圖映射 | 需要路由記錄才能把距離映射到具體位置 |
| 統一 NMS、時序資料庫與儀表盤 | 把光纖、模組、業務和環境數據相互關聯 | 根因分析在此完成 |
把模組數據與光纖數據相互印證
| 觀察到的現象 | 可能原因 | 確認方法 |
|---|
| 近端 Rx 下降,遠端 Tx 和偏置電流不變 | 線路損耗增大:彎曲、連接器、進水、接頭盒 | OTDR 或 RFTS;檢查連接器 |
| 遠端 Tx 下降,其偏置電流上升 | 遠端激光器老化 | 更換模組(Tx 偏置電流與激光器老化) |
| 兩個方向同時劣化 | 共路問題:共用的接頭盒、管道、機櫃溫度 | 現場檢查 |
| Rx 正常,但前 FEC 誤碼率上升 | 色散、PMD、反射、非線性效應或噪聲——而非功率問題 | OSNR(相干模組的 VDM)、反射率、特性測試(光纖特性測試) |
| Rx 每天波動 1–2 dB | 戶外線路的溫度變化,或連接器處於臨界狀態 | 與天氣數據對照;檢查 |
| 平均功率正常但出現抖動 | 反射、接觸不良、端面髒污 | OTDR 上的反射率、端面檢查(端面檢查與清潔) |
| 業務正常但溫度偏高 | 氣流或風扇問題 | 現場檢查 |
| 某站點全部中斷 | 電源問題 | 環境警報、電池 |
| 一個波長中斷,其餘正常 | 該模組、其跳線,或 ROADM 信道設定問題 | 更換模組,檢查信道方案 |
實用規則
| 規則 | 原因 |
|---|
| 監測每條鏈路的兩端 | 線路損耗等於遠端 Tx 減近端 Rx;只看一端無法判斷是哪一側發生了劣化 |
| 通過主機讀取 DDM,同時保留檢測台的數值 | 主機的讀數是運行中的真實情況;檢測台的數值是接入線路之前的基線(應用內的 DDM) |
| 按鏈路而非按模組型號設定警報閾值 | 模組出廠閾值範圍較寬;而鏈路的餘量是具體的 |
| 測試保護路徑 | 沒有業務的備用路徑仍需監測其 Rx 功率,否則會悄無聲息地失效 |
| 也要監測監測設備本身 | RFTS 設備、OSC 終端和傳感器同樣會發生故障 |
| 保持記錄的時效性 | 沒有路由地圖,「12.3 km 處」的警報毫無意義(文件與標示) |
| 獨立設定管理網絡 | 中斷事件本身不應導致監測能力一同失效 |
在 CodingBox 中
檢測台是第一個監測點:CodingBox 在安裝之前就讀取模組的 DDM、閾值和 VDM 能力,因此鏈路檔案從一開始就擁有該模組單獨測得的已知良好值——Tx 功率、偏置電流、溫度——之後主機的讀數就可以與之對照判斷(應用內的 DDM、檢測光模組、 監測)。