鏈路不通:檢查清單
端口起不來是最常見的光學工單,也是最常靠試錯解決的問題。這份清單按檢查成本從低到高、命中故障的概率從高到低排序。按順序執行;每一步要麼修復鏈路,要麼排除一整類原因。
1. 模組到底被看到了嗎?
- 主機端:
show interfaces <if> transceiver(或對應的 NOS 命令)。甚麼都沒列出 → 模組未插到位、籠子被禁用,或主機無法讀取它的 EEPROM。 - 重新用力插好;換一個端口試試;在 CodingBox 的工作台上讀一下模組(Check transceiver)——如果工作台能讀到而交換機讀不到,就該懷疑端口本身。
2. 它被接受了嗎?
- 狀態為 unsupported / invalid / Mod_Inv / errdisable → 主機不認識這個身份資訊。這種狀態下激光器往往被主機禁用,所以對端的 Rx 會讀到 −40 dBm,儘管其實甚麼都沒壞。
- 解決辦法:在主機上放行第三方光模組,或對身份資訊進行編碼 → 廠商鎖定。
3. 發射器開了嗎?
- 端口在管理上是否已啟用?是否為測試關閉了激光器關斷特性(例如 UDLD、環路保護、「laser off until link」)?
- SFP 類:TX_DISABLE 引腳/位元清零(A2h 位元組 110),無 TX_FAULT。QSFP:位元組 86 的 Tx disable 清零。CMIS:模組狀態為 Ready,數據通路為 Activated (CMIS 問題)。
- 工作台檢查:CodingBox 的 DDM 顯示 Tx 功率——如果 Tx 已使能卻仍是 −40 dBm,模組已經損壞。
4. 對端有光嗎?
讀取兩端的 Rx 功率(DDM 電平):
| Rx 讀數 | 含義 | 下一步 |
|---|---|---|
| 兩端均 −40 dBm(地板值) | 兩個方向都沒有光到達 | 光纖斷裂、跳線未插、Tx/Rx 接反、BiDi 配對錯誤 |
| 僅一端 −40 dBm | 單方向無光 | 另一側 Tx 已損壞或被禁用;配對中的一根光纖斷了 |
| 低於靈敏度(例如 PIN 接收器上的 −25 dBm) | 有光,但太弱 | 連接器髒污、波段錯誤、超預算 → 第 6 步 |
| 高於過載點(> −3…0 dBm) | 光太強 | 短距鏈路上用了長距光模組 → 加衰減器 |
| 兩端均在窗口內 | 光是正常的 | 問題不在光學層 → 第 7 步 |
5. 兩端物理上匹配嗎?
- 同一光纖類型(單模對多模)、同一波長 / BiDi 配對,CWDM 模組插在正確的合波器端口上,APC 與 UPC 不能混用,MPO 極性和針腳正確,Tx→Rx 不接反 → 物理層不匹配。
6. 預算夠嗎?
- 檢查並清潔鏈路上的每一個連接器(檢查 → 清潔 → 複查)。
- 與安裝基線對比,或計算預算: 單位與換算、 CWDM 合波器/分波器與鏈路預算。
- 仍然偏低 → 對鏈路做 OTDR(鏈路抖動)。
7. 速率、FEC 和模式匹配嗎?
- 兩端處於相同的速率和 FEC(25G+/PAM4 強制要求 RS-FEC);DAC 上啟用了自動協商和鏈路訓練;兩端主機端口都配置了拆分;銅纜 SFP 的 SGMII 與 1000BASE-X → 速率與模式問題、 FEC 與鏈路訓練。
- 模組自身的速率代碼與預期速率一致(位元組 12 / 合規代碼)。
8. 模組被允許運行嗎?
- 功率等級與端口能力是否匹配;模組是否卡在 LowPwr;是否過溫 → 功率與散熱。
9. 通過替換法隔離故障
- 依次在兩端換上已知良好的模組。
- 環回測試:用一根短跳線把模組自己的 Tx 接到自己的 Rx(長距模組先加衰減)——環回下能通,就證明模組和端口沒問題,故障在線路或對端。
- 換跳線,再換端口。
10. 查看日誌
兩端的介面計數器和 syslog 通常會指明是哪一層出了問題:LOS、unsupported、 FEC uncorrectable、speed mismatch、power exceeds。將日誌資訊與 症狀索引對照。
在 CodingBox 中
兩次工作台讀取就能在一分鐘內解決上面大多數問題:Check transceiver 用於身份、波長、光纖類型/傳輸距離和速率代碼(第 2、5、7 步), DDM 用於 Tx/Rx 功率和旗標(第 3–4 步)。如果模組在工作台上是健康的,就不要再懷疑它,回頭去查線路。
上面的步驟對應的正是主機在模組插入時自身執行的流程;帶引腳、位元組和時序的主機側流程見主機做了甚麼。
正確解讀端口指示燈(琥珀色、閃爍、模式按鈕)並在物理上定位端口: 端口命名與指示燈。
當模組被證明良好、懷疑對象轉向線路時——按頻率排列的故障清單、儀表特徵和修復方法: 光纖線路故障;儀表本身: 測試與測量。