简介:《SDH网络结构和网络保护机理.doc》是一份围绕SDH同步数字体系核心原理编写的技术文档,适合通信工程专业学生、光传输运维人员及备考通信技术类认证的初学者。全文聚焦第五章内容,内容安排由浅入深;先说明核心层、汇聚层、接入层的三层架构,再系统拆解链形网与自愈环的工作机制,包括二纤单向/双向通道保护环、二纤/四纤复用段保护环的自愈过程,并对T型网、环带链、相切环、相交环、枢纽网等复杂拓扑以及PDH向SDH过渡策略做了归纳。文档共1个doc文件,压缩包约199KB,结构完整、目录清晰,便于按章节速查。目前已有174人浏览学习,可用于快速建立SDH网络保护与可靠性设计的知识框架,也可作为课程复习、入职培训或日常排障的参考资料。
1. SDH网络结构和保护机理:一张三十年前的网络蓝图为何今天仍值得逐行读
凌晨两点,光缆被施工队挖断。你心里想,SDH网络结构里早就配好了保护,业务会自动倒换到备用通道,应该没有影响。结果网管上告警刷屏,业务还是中断了。排查到最后发现设备没有坏,是1:1保护组里的备用通道被当普通业务通道占用,保护机制压根没机会生效。SDH网络结构和网络保护机理,讲的就是两件事:业务在SDH网里走哪条路——经过哪些网元、占用哪些时隙;这条路断了以后,靠什么机制切到备用路径,多长时间切完。这个话题适合传输运维、网络规划以及刚从数通转到传送网方向的人细读,因为保护机理的设计缺陷往往要在故障发生那一刻才真正暴露。
2. 从网元到拓扑:SDH网络结构的三层拼图
2.1 四种网元:TM、ADM、DXC、REG的分工与典型连接
SDH网络结构从物理形态上由四类网元拼出来。把网元角色记清楚,后面看保护组里谁做发端、谁做收端才不会乱。
| 网元 | 中文全称 | 在组网里的职责 | 典型位置 |
|---|---|---|---|
| TM | 终端复用器 | 把2M/155M等低速支路复用进STM-N线路信号,也能反向解复用 | 链形末端、环形的一个接入端点 |
| ADM | 分插复用器 | 让高速线路信号在本节点直接上下支路,其余时隙穿通继续走 | 环形节点、链形中间站 |
| DXC | 数字交叉连接 | 执行大容量时隙交叉调度,灵活改变业务方向 | 核心枢纽机房、多方向汇聚点 |
| REG | 再生中继器 | 对光信号做3R再生(再放大、再整形、再定时) | 长距离链路的中间站 |
实际组网里出现频率最高的是ADM。一个STM-4的ADM,两个光口分别接环的两个方向,支路侧接2M或155M业务板,整个环上的业务上下都靠它。TM通常放在网络的端点,把用户侧业务汇入传输环。REG只做光信号再生,不配置业务交叉,但有一个容易忽视的点:REG虽然在业务层面透明,在开销层面却是需要正确配置透传的,如果REG的开销处理方式弄错,K字节就会在这一跳被丢掉,保护倒换的协商链路随之断开,这个到第5章还会再提。
组网规模也可以从网元构成判断:一个接入环,通常是五六个ADM串成环,末端接TM;一个城域汇聚层,会出现ADM与DXC混合组网。如果网元类型里只有ADM和TM而没有DXC,那张网的业务方向基本固定,调度主要靠人工跳纤完成,这本身就说明网络结构处于比较初级的形态,后续扩容时DXC的缺位会成为瓶颈。
2.2 链形、环形、枢纽形:三种拓扑的选型场景
SDH组网拓扑不是随便画的,每种形态对应一类业务模型。链形用于业务方向明确、可靠性要求不算极端的场景,比如乡镇到县城的单向汇聚,中间经过两三个ADM。环形的价值在于给业务提供第二条物理路径,业务可以顺时针也可以逆时针走,是SDH网络保护最常见的物理基础。枢纽形(网状拓扑)出现在DXC互联的核心区域,多路径交叉,为SNCP这类子网级保护提供物理走线条件。
| 拓扑 | 优点 | 缺点 | 典型场景 |
|---|---|---|---|
| 链形 | 容量利用率高、投资省 | 中间节点失效会切断全链 | 末端接入、单向汇聚 |
| 环形 | 天然具备保护空间、倒换简单 | 全网共享容量、扩容需重新规划 | 城域汇聚、本地骨干 |
| 枢纽形 | 多路径调度灵活、可靠性高 | 交叉配置复杂、建设成本高 | 核心机房之间互联 |
选型时有一个很实际的判断:同一条业务,环形拓扑让保护变得自然,但环上所有节点共享环容量,扩容空间受限于环速率;链形拓扑容量利用率高,但任何一个中间站掉电或光板失效,业务都会直接中断,通常只能靠1+1线路保护兜底。枢纽形介于两者之间,容量与可靠性的平衡靠DXC的交叉设计实现。所以我做规划时第一件事永远是问“业务是集中型还是分散型”:集中型业务适合链加环的汇聚结构,分散型业务才值得上枢纽形或环带环结构。
2.3 时隙和复用:网络结构里的容量边界
讲到网络结构绕不开时隙。SDH帧采用STM-N结构,最小的常见业务颗粒是VC-12(承载2M业务),高速颗粒是VC-4(约155M)。一个STM-1包含63个VC-12或1个VC-4;一个STM-4包含4个VC-4,等效252个VC-12;STM-16就是16个VC-4。业务从支路板进入,经过映射、定位、复用,最后落到线路板的某个时隙里,这就是业务在SDH网络里的“路”。
时隙直接影响保护配置。保护组保护的不是“一根光纤”这种物理对象,而是光纤上承载的某个VC的端到端连通性。以SNCP为例,业务同时从工作通道和保护通道两个方向发送,宿端选收一路,配置时就要明确每个VC的工作时隙和保护时隙分别落在哪条路径上。时隙规划重叠,保护组创建会直接报错;时隙规划不连续,倒换时可能出现部分业务切过去、部分业务切不过去的现象。所有SDH网络结构问题,最终都能落到“哪个业务走了哪个时隙”这一层来验证。
节点数量、光纤连接关系和时隙规划共同构成网络结构的三大要素。一张合格的SDH网络结构图,应该能一眼看出每条业务的工作路径和保护路径,以及两条路径在物理上是否完全分离。如果业务的工作和保护走同一条管道,比如同缆但不同纤芯,光缆被挖断时两条路径一起失效,保护等于虚设。物理路由分离是网络结构设计里最容易被忽视的一环,拓扑图和纤芯台账必须放到一起看。
3. 保护机理的倒换逻辑:50ms承诺是怎么兑现的
3.1 线路保护1+1与1:1:备纤的两种用法
线路保护是SDH保护里最基础的一类,常见模式为1+1和1:1。1+1保护下,发端把同一路业务永久桥接到工作光纤和保护光纤上同时发送,收端对两路信号实时选收,只要还能从两路里收到一路,业务就不断。1:1保护下,发端只在工作光纤上发送业务,一旦检测到工作光纤失效,发端把业务桥接到保护光纤上,同时通过APS信令通知对端切换接收。1:1省下的资源可以让保护光纤在空闲时承载额外业务,代价是多一层协商、倒换逻辑更复杂。
| 项目 | 1+1 | 1:1 |
|---|---|---|
| 发端动作 | 永久桥接,业务双发 | 故障时切换发送 |
| 收端动作 | 二路选优 | 根据APS信令切换 |
| 是否需要APS协商 | 基本不需要,选收即完成 | 需要,K字节交互 |
| 保护光纤空闲时能否传额外业务 | 不能 | 可以 |
| 倒换速度 | 最快 | 略慢,但都满足50ms |
工程上怎么选?1+1适合核心骨干层、对中断时间极端敏感的业务,因为收端选收是物理层独立的本地动作,不依赖对端配合。1:1适合资源紧张、想用保护通道顺带传点低优先级数据的局点。但一定记住:额外业务没有保护等级,工作光纤故障时会被无条件抢占,倒换结束后还需要人工恢复。这个约束要提前跟业务方讲清楚,我见过不止一次因为额外业务被抢占、业务方半夜打电话投诉的场景。
3.2 SNCP与复用段保护:保护颗粒度和资源效率的取舍
通道层和复用段层各有一类保护方法。子网连接保护SNCP工作在通道层,保护对象是单个VC:源端把业务复制到工作通道和保护通道两条独立路径,宿端对两条路径同时做检测并选收。SNCP配置直观、颗粒度细、不需要全网协议协商,缺点是每个受保护的VC都占两份容量。
复用段保护工作在STM-N帧层面,把整个复用段内所有时隙当成一个整体来保护。常见形态是二纤双向复用段保护环(MS-SPRING),核心是靠K字节在环上所有节点之间协商倒换。MSP资源利用效率更高,保护容量可以在环上多个节点间共享,但配置和运维复杂度明显上升,且整个环共享同一个倒换域——任何一个节点的K字节处理异常,整环倒换都会受影响。
| 对比项 | SNCP | MSP / MS-SPRING |
|---|---|---|
| 工作层 | 通道层(VC) | 复用段层(STM-N帧) |
| 保护颗粒度 | 单VC,灵活 | 整个复用段,粗粒度 |
| 是否需要全网协商 | 宿端本地选收,基本不协商 | 需要K字节环上协商 |
| 配置复杂度 | 低 | 高 |
| 资源效率 | 每VC两份容量 | 保护容量共享 |
工程上的取舍逻辑:城域网汇聚层和接入层,SNCP用得最多,因为它配置简单、倒换确定性强;骨干层和容量紧张的环网,MS-SPRING更常见,因为它可以把一个方向的容量释放出来承载业务。有一种常见误解是“SNCP比MSP高级”,实际上二者是不同层级的工具:SNCP保护的是管道里的一桶水,MSP保护的是整条管道。
3.3 APS协议与K字节:保护倒换怎么协商
APS协议运行在SDH段开销的K1、K2字节上,这是理解保护机理协商过程的关键。K1字节携带倒换请求的类型和优先级,K2字节描述桥接状态和APS协议状态机。倒换请求不是只有“光断了”一种,而是有明确的优先级体系:锁定(Lockout)最高,往下依次是强制倒换(FS)、信号失效(SF)、信号劣化(SD)、人工倒换(MS)、等待恢复(WTR)。
这个优先级体系决定了故障时谁说了算。比如你手动下发了人工倒换,此时突然发生光缆中断,SF请求会抢占MS请求,设备自动进入信号失效倒换而不会理睬人工倒换的后续状态。反过来,如果已经执行了强制倒换,光缆中断也不能改变当前状态,因为FS的优先级高于SF。排障时先看保护组当前倒换原因字段是SF还是SD还是MS,就能判断是不是有更高级的请求盖住了你的操作。
另外注意,APS协议只有在1:1这类需要双方协商的保护方式里才是必须的,1+1的收端选收是本地动作,不需要复杂的协议交互。这是很多新手在网管上看“协议状态”字段时发懵的原因:1+1保护组的协议状态永远简单,1:1保护组则能看到K字节的收发计数。REG在APS协议里扮演透明转发角色,但REG或中间节点的光板如果配置了开销终结,K字节就会被吞掉,查倒换超时问题时REG的开销处理模式是必查项。
最后补充一个环网保护的细节。二纤单向通道保护环本质是SNCP在环网的应用,业务同时绕环的两个方向传,宿端在收端选收。二纤双向复用段保护环则不同,工作通道和保护通道分开,倒换时整个环上相关节点参与K字节协商。这两种环对应不同的保护哲学:通道保护环牺牲容量换简单,复用段保护环牺牲复杂度换容量。很多工程师习惯把二者混为一谈,排障时就会拿错定位方向。
4. 把保护机理落到网管:保护组配置与三个必调参数
4.1 保护组配置的最小步骤和角色分配
在网管上配置保护组,各家产品界面不同,逻辑是一致的:选保护类型、指定工作通道和保护通道、设置仲裁参数、下发两端网元。配置之前先确认两端光板类型和时隙表一致,否则保护组能创建但倒换时会因端口能力不匹配而失败。
常见做法是进入SDH设备管理视图,打开“保护管理”里的创建保护组向导,输入保护组名称和类型。线路保护就选1+1或1:1并指定工作光口、保护光口;子网连接保护就选SNCP,把工作路径和保护路径的VC分别拖入对应角色栏。随后设置恢复模式和WTR时间,最后下发。配置顺序和关键检查项如下:
| 操作步骤 | 关键点 | 常见错误 |
|---|---|---|
| 新建保护组 | 命名清晰,注明两端站点名称 | 名称无规则,事后无法辨识 |
| 指定工作通道 | 光口、VC-4编号、VC-12时隙范围一致 | 两端时隙不对称 |
| 指定保护通道 | 确认保护通道物理链路完好 | 保护通道被其他业务占用 |
| 设置恢复参数 | 恢复模式两端一致 | 一端返回式、一端非返回式 |
| 下发两端网元 | 确认两端都下发成功 | 只下发一端,另一端无感知 |
下发后必须核对运行状态。网管页面上有三个关键字段:当前工作角色(工作/保护)、当前倒换状态(正常/倒换中/锁定/等待恢复)、当前倒换原因(无/SF/SD/MS/EX)。如果状态不是“正常”,别急着做任何倒换操作,先查清楚状态来源。保护组下发是两端动作,不是单端动作,我遇到过只配了一端,导致倒换请求发出去对面没回应的局面。
4.2 WTR、恢复模式、额外业务:三个必调参数
保护组参数里最容易配错的是三个:恢复模式、WTR时间、额外业务。恢复模式决定故障恢复后业务要不要自动返回工作通道。返回式适合工作通道质量稳定的场景,因为它能把业务带回设计路径;非返回式适合保护通道质量更稳定的场景,省去回切动作。
WTR(等待恢复时间)是故障排除后、执行回切前的等待时长,常见范围5到12分钟。WTR设太短,工作通道光功率还在爬升期就回切,容易造成“回切-再倒换”振荡;设太长,业务长时间压在保护通道上,如果这段窗口内保护通道也出问题,就是双重故障,直接中断。我一般给默认业务设8分钟,再结合工作通道的历史光功率表现微调。
额外业务是1:1保护特有的一项开关。保护光纤空闲时可以承载低优先级业务,这叫额外业务,它没有保护等级,一旦触发倒换会被无条件抢占,而且倒换恢复后还需要人工恢复。额外业务的配置有个细节:它需要单独指定保护通道上的时隙和业务映射,而不是简单勾一个开关。配置前要确认保护通道上有空闲的VC时隙,且对端网元的交叉连接预留了对应资源。很多现场把额外业务和普通业务混在同一张时隙表里,倒换时额外业务的交叉连接失效,就会和现网业务形成冲突。对额外业务没有清晰台账和管理手段时,直接关闭这个开关,省得后续扯皮。
提示:WTR和恢复模式一旦在两端设置不一致,回切时会出现一端倒换、另一端等待的僵局,修改参数后务必两端同时下发。
4.3 从网管读保护状态的技巧
运维经验在于读状态,而不只是看告警。保护组状态是绿色的“正常”不代表一切稳妥,打开历史事件列表查有没有出现过SD(信号劣化)记录。SD意味着信号质量已经下降但未达到倒换门限,如果不处理,某次光缆稍微再衰减一点就会触发SF倒换。定期查看保护组的倒换计数也是建议动作,倒换计数的变化频率是这张网健康度的直接指标。
以命令行方式查询保护组状态时,常见的一种交互输出是:
# 查询保护组 A-B-1plus1 的运行状态(示意命令) show protection-group status A-B-1plus1 # 输出关键字段: # GroupState = Normal # ActiveRole = Working # SwitchReason = NONE # WTRRemain = 0s # SwitchCount = 3这段输出的含义:保护组状态正常,当前业务在工作通道上,没有正在进行中的倒换,WTR计时器也没有在跑。如果SwitchReason变成SF,说明当前正处在信号失效倒换中;如果看到WTRRemain在倒数,说明一次自动倒换刚刚结束,设备正在等WTR时间走完以便回切。SwitchCount等于3表示历史上发生过3次倒换,如果这个数每隔几天就涨一次,就需要查为什么倒换如此频繁。建议每次巡检把保护组状态截图存档形成基线数据,等网络出问题时翻出来对比,能省大量排查时间。
保护组的告警监视也需要单独设置。默认情况下SDH设备会对保护通道上的信号做性能监视,包括误码秒、严重误码秒等指标。这些指标不直接影响倒换,但能反映保护通道的健康度。建议把保护通道的ES、SES加入巡检清单,与业务通道同等对待——保护通道平时不用,一旦要用,必须保证它是完好的。
5. 保护倒换排查避坑:五类典型故障的现象、原因与处理
保护倒换的故障排查,核心是抓住一条主线:倒换请求是否产生、是否被正确传递、是否被执行。任何一步断掉,倒换就异常。下面五类故障按现象、原因、处理的顺序整理,每一条都是真实运维里反复出现的。
5.1 光缆断了保护没动作
现象:光缆中断,网管上报LOS(信号丢失),但业务还是中断,保护组没有发生倒换。
原因:最常见的是保护组虽然创建了,但工作通道和保护通道的交叉连接没有全部配置完整,尤其跨网元SNCP,宿端两个方向的VC没有配对。另一种可能是保护组处于锁定状态,或者保护通道被额外业务占用,保护通道不可用。
处理:在网管上打开保护组详情,逐项核对工作通道两端的交叉连接是否是Active状态。如果是SNCP,宿端只配了工作通道的交叉,另一路信号根本到不了选收板,保护等于虚设。用信号流跟踪功能沿业务路径走一遍,能快速定位是哪一段交叉断的。锁定状态的解法是找到保护组的Lockout开关并关闭。同时检查WTR状态,如果上一次倒换刚结束还没回切,此时新的故障可能被WTR状态压住,要等计时结束或手动清掉。
5.2 倒换时间超过50ms
现象:用误码仪监测业务VC,光纤中断后业务中断时间达数百毫秒,不满足50ms的倒换要求。
原因:对于复用段保护环,K字节协商需要环上所有节点参与,中间某个节点的APS协议状态异常,倒换请求就会在超时后才生效。另一种常见原因是REG或中间节点在开销处理上配置为终结模式,K字节没能原样透传到对端。
处理:先查K字节传递路径,重点看REG节点的开销处理模式。再查APS协议状态,确认两端网元的协议模式是线性MSP还是共享保护环,模式不匹配会出现协商超时。我踩过这个坑:一条两站之间的链路中间加了REG,光板默认配置把开销终结了,K字节被吞,倒换时间从50ms级别拖到600ms,改成透传后恢复。
5.3 恢复后业务闪断
现象:故障排除后保护组自动返回工作通道的瞬间,业务出现几十毫秒到几百毫秒的闪断。
原因:WTR设置过短,故障恢复后工作通道光功率仍在不稳定爬升期,回切后业务性能差,甚至引发再次倒换。也可能是两端网元WTR时间不一致,一端已经回切,另一端还没准备好。
处理:把WTR调长到至少5分钟以上,且确保两端一致。回切前检查工作通道的光功率和误码率,等完全稳定后再手动执行回切,或者直接等自动回切。回切动作尽量安排业务低峰期。另外,如果工作通道的光模块存在隐性劣化,回切后短时间内会再次触发倒换,要提前排查光模块收发光是否正常。
5.4 手动倒换失败
现象:在网管上对保护组下发人工倒换命令,系统报错,业务没有切换。
原因:保护组存在锁定状态,或者当前存在SF/SD等级别更高的倒换请求,人工倒换优先级不够。另一种情况是1:1带额外业务的保护组,保护通道被额外业务占用,系统出于保护机制拒绝倒换。
处理:先查保护组的锁定状态并解除,再看当前倒换原因列表里有没有更高级别的请求占用。如果是额外业务冲突,需要先关闭额外业务功能或手动清掉额外业务,再执行倒换。手动倒换失败不见得是配置错误,也可能是机制在按优先级工作——这不是故障,这属于保护机理的正常裁决。
5.5 保护通道劣化导致来回倒换
现象:保护组频繁出现倒换和回切,业务周期性闪断,倒换计数快速增长。
原因:保护通道本身光功率不足或误码超标,达到SD保护门限后系统倒换到保护通道,结果发现保护通道也不健康,又切回工作通道,两端来回拉扯。
处理:出现这种情况,第一动作是把恢复模式改为非返回式或调大WTR,人为减少振荡频率,然后去查保护通道的光路与误码。先查保护通道两端的收发光功率和误码性能,用仪表做环回测试定位劣化段落。如果是光连接器脏污,用光纤清洁笔处理后再测;如果是光板老化,需要更换。同时可以调高SD门限中的BER阈值参数,让设备对轻微劣化不那么敏感,但这是临时手段,门限调整要遵循一个原则:不能高到真实故障来临时触发不了倒换。保护通道长期不承载业务,光路性能问题平时发现不了,一倒换就暴露,这是SDH运维里的玄学——平时看着正常,关键时刻掉链子,所以必须有演练做兜底。
6. 用一次带业务的保护倒换演练验证网络保护可用性
最后说一个我坚持了很久的做法:每季度挑一条低优先级业务,在业务窗口内做一次真实的保护倒换演练。别直接拔光纤,光纤中断会引发大量告警和K字节风暴,演练要可控。先在网管上对目标保护组下发人工倒换命令,让业务切到保护通道,再用SDH分析仪接在业务VC的测试口上,记录倒换瞬间的中断时间和误码情况。
提示:演练前先确认保护组当前没有正在进行的自动倒换,否则WTR计时会影响演练结果的判定。
判断保护组是否真正可用的标准只有一条:倒换时间不超过50ms且无误码。达不到,就一定存在第5章里的某种隐性故障,演练正好暴露问题;达到了,才说明这条业务的工作通道和保护通道在物理层上是完整互通的。回切环节同样要测:撤销人工倒换,观察WTR计时是否触发、业务是否自动回到工作通道且无闪断。如果回切瞬间有误码,问题多半出在工作通道的光模块或光纤连接器,不是保护配置本身。
做这项工作有一条血泪经验:演练前务必用短信或工单通知业务方,哪怕业务优先级再低也要通知。我经历过一次演练倒换恰好撞上业务方做数据核对,被误认为事故。另外,每次演练保留保护组状态截图、误码仪截图和倒换计数存档,下次排障时这些就是最直接的基线参考。SDH网最值钱的不是设备,而是你对这张网保护机理的掌控程度。希望这些经验能帮到你,也祝你下次光缆真被挖断时,业务能一声不吭地切到备用通道上。
本文还有配套的精品资源,点击获取