CodingBox 說明文件

監測與管理:DDM、OSC、OCM、RFTS 與警報

無源線路是沉默的;圍繞它的有源基礎設施才是光纖鏈路實時資訊的唯一來源。每個光模組都在測量自己的光,每台放大器都報告其泵浦和增益狀態,ROADM 節點監視頻譜,監控信道在各站點之間傳送這一切,遠程測試系統則在光纖承載業務的同時向其發送 OTDR 脈衝。本頁闡述可見性的各個層次、它們各自觸發的警報及其含義、如何維護基線和趨勢、採集數據的協議與工具、如何把模組數據與光纖數據相互印證以定位故障,以及能在客戶察覺問題之前發現問題的監測體系應遵循哪些實用規則。

可見性的層次

層次來源能看到甚麼詳情
光模組診斷(DDM/DOM)模組的監測光電二極管和傳感器,由主機讀取Tx 和 Rx 功率、激光器偏置電流、溫度、供電電壓;400G 及以上和相干模組還有前 FEC 誤碼率、色度色散、DGD、OSNR(VDM)DDM 基礎VDM 與 FEC 指標
主機端口計數器交換機、路由器或 NIC 的 MAC/PCS鏈路狀態和抖動次數、FEC 已糾正和未糾正塊數、CRC 錯誤、PCS 錯誤塊管理與監測
放大器遙測EDFA 和拉曼放大設備輸入和輸出功率、增益、泵浦電流和溫度、輸入丟失、APR 狀態放大與再生
光信道監測器(OCM)內置於 ROADM 和終端節點的頻譜分析儀各信道的功率和有無、OSNR 估計值、傾斜傳輸與接入設備
光監控信道(OSC)線路站點之間的專用波長(1 510 或 1 610 nm)跨段損耗、遠端警報、與無人值守站點的管理連接同上
遠程光纖測試系統(RFTS)以 1 625 或 1 650 nm 耦合到在用光纖上的 OTDR 設備光纖本身出現的新事件、損耗變化、斷點位置維護與修復
環境傳感器機櫃、接頭盒、機房門禁、溫度、濕度、進水、市電和電池狀態同上
記錄與基線開通測試和鏈路檔案每根光纖和每個模組的「正常」狀態是甚麼文件與標示

警報及其含義

警報觸發方含義首先檢查
信號丟失(LOS)接收器:無光光纖中斷、遠端發射器關閉、波長或信道錯誤、跳線脫落遠端 Tx 功率和鏈路狀態(無鏈路
失鎖、丟幀(LOL、LOF)CDR、PCS、OTN 成幀器有光但不可用:速率或 FEC 不匹配、色散或噪聲超出容限、功率過低Rx 功率與靈敏度的對比、速率和 FEC 設定
Rx 功率低警告或警報模組閾值線路損耗增大,或遠端 Tx 下降;典型閾值比靈敏度高幾 dB遠端 Tx 和近端 Rx 的趨勢(閾值與警報
Rx 功率高模組閾值對 ER/ZR 而言損耗太小,或放大後的輸出直接進入接收器加裝衰減器
Tx 功率低、激光器偏置電流高模組激光器老化或失效偏置電流趨勢(Tx 偏置電流與激光器老化
溫度過高模組或設備氣流受阻、風扇故障、站點過熱、模組超出其溫度等級站點環境(溫度與電壓
前 FEC 誤碼率上升、出現不可糾正塊主機或模組的 FEC 統計餘量正在被消耗——原因可能是功率、色散、PMD、反射或連接器髒污——鏈路尚未失效前的先兆與 Rx 功率和 OSNR 相互印證
鏈路抖動主機接觸不良、反射、功率臨界、溫度循環鏈路抖動
模組未識別或不受支援主機插接不到位、編碼問題、類型不兼容廠商鎖定
放大器輸入丟失,APR 動作放大器上游光纖中斷;泵浦出於安全考慮已關閉切勿繞過 APR;查找斷點(安全與操作規範
跨段損耗增加(OSC)線路系統光纖劣化、彎曲、進水、跨段中連接器髒污用 RFTS 或 OTDR 檢測該跨段(解讀 OTDR 曲線
RFTS 新事件或損耗變化遠程 OTDR在定位出的距離處出現新的彎曲、接續點劣化、進水或中斷換算為路由位置,派單處理
開門、進水、市電失效、電池電量低環境該站點即將變成一處光纖中斷點應在電池耗盡前派單處理

警報的層級關係很重要:一次光纖中斷會在每個波長上觸發 LOS,在放大器上觸發輸入丟失,在 OSC 上觸發跨段損耗,並引發十幾條業務警報——根本原因是位於層級最底部的那一個。

基線與趨勢

做法規則
開通時建立鏈路檔案記錄遠端 Tx、近端 Rx、兩個模組的偏置電流和溫度;雙向 OTDR;所有波長的損耗
按變化量警報,而不僅靠絕對閾值比基線 Rx 低 2 dB 就應引起關注,遠早於模組自身的低功率警報
輪詢間隔功率值 1–5 分鐘;計數器每分鐘;RFTS 掃描為每小時到每天一次
季節性變化架空和戶外線路出現 ±1 dB 波動屬於正常現象——應予以記錄
每次變更後重新建立基線更換模組、重新熔接、重新接跳線
精度DDM 的絕對精度為 ±1–2 dB,但重複精度達 ±0.1 dB——非常適合看趨勢,但不適合用於認證(精度與局限
數據保留至少保留一年的功率歷史數據,以觀察緩慢劣化和季節性規律(監測

協議與工具

機制提供的內容說明
CLI(show interface transceiver 及同類命令)按需查看每個端口的 DDM 值便於腳本化;語法因 NOS 而異(讀取 DDM 的工具
SNMP 輪詢與陷阱DDM、計數器、設備警報光學數值使用廠商 MIB;部分平台使用 ENTITY-SENSOR-MIB
流式遙測(gNMI、OpenConfig、NETCONF)每隔幾秒提供 DDM 和計數器採用 openconfig-platform-transceiver 模型;最適合看趨勢
ethtool、mlxlink 等 NIC 工具從伺服器 NIC 讀取 DDMNIC 工具與診斷
線路系統 EMS/NMS放大器、OCM、OSC 數據及光層警報北向介面採用 TL1 或 NETCONF
RFTS 軟件曲線對比、事件警報、距離的 GIS 地圖映射需要路由記錄才能把距離映射到具體位置
統一 NMS、時序資料庫與儀表盤把光纖、模組、業務和環境數據相互關聯根因分析在此完成

把模組數據與光纖數據相互印證

觀察到的現象可能原因確認方法
近端 Rx 下降,遠端 Tx 和偏置電流不變線路損耗增大:彎曲、連接器、進水、接頭盒OTDR 或 RFTS;檢查連接器
遠端 Tx 下降,其偏置電流上升遠端激光器老化更換模組(Tx 偏置電流與激光器老化
兩個方向同時劣化共路問題:共用的接頭盒、管道、機櫃溫度現場檢查
Rx 正常,但前 FEC 誤碼率上升色散、PMD、反射、非線性效應或噪聲——而非功率問題OSNR(相干模組的 VDM)、反射率、特性測試(光纖特性測試
Rx 每天波動 1–2 dB戶外線路的溫度變化,或連接器處於臨界狀態與天氣數據對照;檢查
平均功率正常但出現抖動反射、接觸不良、端面髒污OTDR 上的反射率、端面檢查(端面檢查與清潔
業務正常但溫度偏高氣流或風扇問題現場檢查
某站點全部中斷電源問題環境警報、電池
一個波長中斷,其餘正常該模組、其跳線,或 ROADM 信道設定問題更換模組,檢查信道方案

實用規則

規則原因
監測每條鏈路的兩端線路損耗等於遠端 Tx 減近端 Rx;只看一端無法判斷是哪一側發生了劣化
通過主機讀取 DDM,同時保留檢測台的數值主機的讀數是運行中的真實情況;檢測台的數值是接入線路之前的基線(應用內的 DDM
按鏈路而非按模組型號設定警報閾值模組出廠閾值範圍較寬;而鏈路的餘量是具體的
測試保護路徑沒有業務的備用路徑仍需監測其 Rx 功率,否則會悄無聲息地失效
也要監測監測設備本身RFTS 設備、OSC 終端和傳感器同樣會發生故障
保持記錄的時效性沒有路由地圖,「12.3 km 處」的警報毫無意義(文件與標示
獨立設定管理網絡中斷事件本身不應導致監測能力一同失效

在 CodingBox 中

檢測台是第一個監測點:CodingBox 在安裝之前就讀取模組的 DDM、閾值和 VDM 能力,因此鏈路檔案從一開始就擁有該模組單獨測得的已知良好值——Tx 功率、偏置電流、溫度——之後主機的讀數就可以與之對照判斷(應用內的 DDM檢測光模組監測)。


如果您發現本文有不準確之處或錯誤,請選取相應片段並按 Ctrl+Enter,即可