设备旁挂做策略路由引流,这活儿在网络运维里属于看着简单、实际暗坑不少的一类。很多人第一次接触,以为就是在交换机上配条策略路由把流量丢给防火墙完事,结果真上了生产环境才发现,流量黑洞、环路、回程路径不对,各种问题接踵而来。这篇文章我就把自己的实操经验完整梳理一遍,从原理、配置到排障,把旁挂部署时策略路由引流的来龙去脉讲清楚。
1. 旁挂部署的思路拆解:为什么要把设备“挂”在边上
1.1 核心动机:绕过物理拓扑的限制
旁挂部署最大的动机很直接:不想让核心链路因为插入一台设备而中断或降级。如果设备串接在主干链路上,一旦设备升级、重启、出现硬件故障,整个网络就直接断掉。旁挂的方式让设备物理上接在交换机旁边,不改变原有数据通路的物理结构,流量是否经过旁挂设备完全由策略路由(PBR,Policy-Based Routing)控制。这样一来,现网设备挂了不影响主链路,主链路断了也不影响旁挂设备本身——虽然业务会断,但至少不会因为设备本身的问题导致连锁故障。
实际项目中,最常见的旁挂对象是防火墙、上网行为管理、负载均衡器或者流量探针。它们的作用各不相同,但共同点是它们需要在数据路径上“看”到流量,却不适合物理上穿在链路中间。Firewall做安全过滤,行为管理做审计,探针做流量分析,它们都是对流量做深度处理的设备,处理能力往往不如交换芯片快,串在主链路上反而会拖慢整个网络。放在旁边,用PBR选择性地把需要处理的流量引过去,才是性能和功能兼顾的做法。
1.2 和串接相比,旁挂到底值不值
我把两种部署方式的差异整理成一个简单的对比,方便你判断自己的场景更适合哪种:
| 对比维度 | 旁挂部署 | 串接部署 |
|---|---|---|
| 链路故障风险 | 旁挂设备故障不影响主链路 | 串接设备故障导致断网 |
| 设备上线变更 | 不需要动主链路,加条路由即可 | 必须割接,中断业务窗口 |
| 流量处理范围 | 通过策略选择,按需引流 | 经过即处理,全部覆盖 |
| 性能影响 | 只在引流的流量上增加处理开销 | 全流量过设备,性能要求极高 |
| 部署灵活性 | 高,随时可以调整引流策略 | 低,调整必须动物理拓扑 |
| 故障排查复杂度 | 相对复杂,涉及路由策略和回程设计 | 相对简单,路径固定 |
从表格能看出来,旁挂牺牲的是一些“确定性”——因为不是所有流量都经过设备,所以必须靠策略保证该引的流量一定被引到,还因为流量绕了一圈要回来,回程路径设计就特别重要。但这种牺牲换来的运维灵活性,在真实生产环境中价值非常大。很多时候,网络策略是逐步调整的,今天只引流办公网段,明天要增加服务器区域,如果串接,每次调整都要动物理链路;旁挂就只需要改几条策略。
1.3 什么场景下非用旁挂不可
以我实际接触过的项目为例,旁挂+策略路由最常见的应用场景有几个:
场景一:现有网络加装防火墙。公司原本网络已经跑得好好的,但等保合规要求上网流量必须经过防火墙过滤。这时候不可能把防火墙串到核心交换机上,因为切割链路就意味着业务中断。旁挂是最优解,核心交换机上配策略路由,把内网访问外网的流量下一跳指向防火墙,防火墙处理后再丢回核心交换机。整个过程对终端用户是透明的,不需要改终端的网关和IP。
场景二:上网行为管理设备。上网行为管理设备要审计员工访问了哪些网站、做了哪些操作,最理想的位置就是在出口。但出口链路上还有路由器和防火墙,再串一台行为管理进去,链路层级就太深了。旁挂方式在核心交换机上把用户上网流量引流给行为管理,审计完成后送回核心交换机,再由出口路由器转发出去。
场景三:链路负载均衡。公司有两条运营商线路,需要把流量按比例分配到两条线路上。在路由器或防火墙上做策略路由也可以实现,但如果负载均衡设备的老化能力更强、策略更灵活,就可以把负载均衡设备旁挂在核心交换机上,将特定流量引给它,由它决定从哪条出口线路走。
这三个场景的核心共通点是:设备需要看见流量、处理流量,但不能成为链路上的单点故障。旁挂天然满足这个需求,而策略路由则是让“看见”成为可能的手段。
2. 策略路由引流的原理拆解:流量是如何“绕路”的
2.1 普通路由和策略路由的本质差异
普通路由根据目的IP查路由表,下一跳由路由协议或静态路由决定。它在意的是“目的地怎么走”,不关心“从哪儿来的、是什么类型的流量”。策略路由不一样,它可以根据源IP、目的IP、协议类型、端口、报文长度、甚至应用类型来决定下一步怎么走。用大白话说,普通路由是“看地址选路”,策略路由是“看条件选路”。
在实际旁挂引流场景中,这个差异就体现在策略路由可以根据“这是内网PC访问外网的流量”这个条件,强制把流量转向旁挂设备。普通路由表里根本没有旁挂设备这一项——因为旁挂设备不是默认网关,也不是指往外网的路径上的必经节点,它就一个孤零零的接口IP,但策略路由可以指定“凡是这类流量,下一跳给我指向旁挂设备”。这就像你平时回家走大路,但今天需要先去趟超市买点东西(旁挂设备处理),你会刻意绕一下路,办完事再回大路继续走。普通路由就是你平时的路线,策略路由就是临时增加的“先去超市”这个规则。
2.2 旁挂引流的完整数据流设计
理解了策略路由的本质,我们再来看旁挂场景下,一个数据包完整的“绕路”过程。以最常见的“内网PC访问外网网页,经过旁挂防火墙过滤”为例,整个路径分四段:
第一段:PC发出访问网页的请求,目的IP是公网地址,默认网关指向核心交换机(或者汇聚交换机)上的网关接口。这时核心交换机收到这个报文,先查策略路由规则——注意,是策略路由优先于普通路由。策略路由匹配“源IP属于内网网段”这个条件,把这条流量的下一跳指向旁挂防火墙的内网接口IP。
第二段:核心交换机把报文从连接防火墙的物理接口送出去,源MAC变成核心交换机的MAC,目的MAC变成防火墙内网接口的MAC。报文到达防火墙,防火墙做安全过滤、NAT或者内容审计。这是旁挂设备的“工作时刻”,但它究竟是做NAT还是只做透明过滤,取决于你的规划。
第三段:防火墙处理完报文,要把报文“还”回核心交换机。这很关键——防火墙接口上一般需要写一条默认路由(0.0.0.0/0)指回核心交换机。因为防火墙不负责最终转发,它只是中间处理角色,处理完后报文要回到网络的主路径上去。如果没有这条回程路由,防火墙就不知道该把处理完的报文交给谁,流量就在这里卡死了。
第四段:核心交换机再次收到这个报文,这次再查策略路由规则——注意,必须跳过策略路由的再次匹配,否则流量就在核心交换机和防火墙之间来回弹,形成环路。如何跳过?这就要依靠策略路由中的“不匹配规则”或者网络设备的某种机制,比如报文从防火墙回来时带上的接口信息作为不匹配条件。这是配置中最重要的一个细节,后面实操部分我会详细演示。
整个路径走下来,用户端完全感知不到流量绕了一圈,只看到网页正常打开。因为源目的IP没有改变(如果是透明模式),只是物理上绕路经过了一台设备,逻辑上就像设备“旁路”看了一眼。
2.3 必须搞懂的两个关键设计原则
这里必须单独拎出来讲,因为这两个原则决定了你的引流方案能不能在复杂网络中稳定运行。
第一个原则:策略路由匹配必须精准,宁窄勿宽。很多初期配置出问题,都是因为引流范围写太宽,比如把整个VLAN的流量都引向防火墙,结果防火墙回程的时候又触发策略路由,形成转发环。就算不回环,流量全灌给旁挂设备,处理能力不够直接导致上网卡顿。所以引流范围要根据实际需求精准匹配,能只引一个网段就别引整个VLAN,能在防火墙上再过滤一层的绝不依赖交换机策略去兜底。
第二个原则:回程路径必须单独设计,不能依赖正向引流的“自动回程”。有不少人以为策略路由是双向的,流量过来经过防火墙,回去自然也会经过防火墙。实际上策略路由匹配的是入方向的流量,回程流量是另一个独立的方向,也需要单独判断。如果你只在去程做了引流,回程没有处理,那么防火墙看到的是有出无进的单向流量,状态检测会直接丢弃,业务还是不通。所以在设计时,去程、回程两条方向都要梳理清楚,哪些流量需要引,哪些不需要,每一跳该怎么走,最好画一张清晰的路径图。
3. 华为设备旁挂引流配置全记录
3.1 环境拓扑与设计思路
我用一套非常典型的华为设备组合来演示具体配置:核心交换机华为S5720(型号不重要,关键是软件版本支持Policy-Based Routing,通常VRP V200R010及以上都没问题),旁挂设备用华为USG防火墙(做安全过滤),出口是运营商网关。网络拓扑可以简化为下面这个结构:
内网终端(VLAN 10)→ 核心交换机(网关)→ 旁挂防火墙(USG)→ 核心交换机(再次路由)→ 出口路由器 → 公网
实际物理接线很简单:核心交换机的GigabitEthernet0/0/1接内网终端网段,GigabitEthernet0/0/2接出口路由器,GigabitEthernet0/0/3接防火墙的GigabitEthernet1/0/0。防火墙在拓扑上是“挂在交换机旁边”,不是串在核心交换机和出口路由器之间。
设计思路如下:
- 内网终端VLAN 10,网段192.168.10.0/24,网关在核心交换机上(Vlanif10的IP,192.168.10.1)。
- 核心交换机与防火墙之间用一个互联网段,比如192.168.100.0/30,核心交换机侧接口IP是192.168.100.1,防火墙侧接口IP是192.168.100.2。
- 引流目标:内网终端访问外网的流量需要经过防火墙过滤,服务器互访流量(比如VLAN 20的服务器区域)不需要经过防火墙,走正常路由。
- 防火墙处理完流量后,默认路由指回核心交换机(192.168.100.1),由核心交换机继续查正常路由,把报文发给出口路由器。
3.2 核心交换机上的配置步骤
第一步:配置VLAN和接口IP
创建VLAN并分配接口:
system-view vlan batch 10 20 100 interface vlanif 10 ip address 192.168.10.1 255.255.255.0 interface vlanif 20 ip address 192.168.20.1 255.255.255.0 interface vlanif 100 ip address 192.168.100.1 255.255.255.252把物理接口加入对应的VLAN:
interface gigabitethernet 0/0/1 port link-type access port default vlan 10 interface gigabitethernet 0/0/2 port link-type access port default vlan 100注意这里GigabitEthernet0/0/2接的是防火墙。VLAN 100用于核心交换机和防火墙之间的互联,VLAN 10和VLAN 20是业务网段。生产环境中互联网段用/30的子网比较规范,够用且不浪费IP。
第二步:配置ACL用于匹配引流流量
策略路由需要ACL来定义“哪些流量要被处理”。这里定义源为192.168.10.0/24的IP流量:
acl number 3000 rule 5 permit ip source 192.168.10.0 0.0.0.255这里只匹配了内网终端访问外网的流量。如果还希望服务器区域的部分流量引流,可以再加rule,但要特别注意别和防火墙的回程流量互相匹配。ACL匹配的是“从核心交换机进入的流量”(入方向接口上挂策略),也就是从内网方向来的。流量从防火墙回来时,从GigabitEthernet0/0/2口进入核心交换机,此时如果也在该接口挂了策略路由,就要小心了,所以一般只在面向终端的接口下挂策略。
实际上,更精确的处理是使用接口下应用策略路由的方式,在接内网的接口(Vlanif10所在三层接口或对应的物理二层口)上应用。不过华为多数场景推荐在三层接口(Vlanif)上应用策略,因为可以按网段区分策略。这里我们在Vlanif10下应用,意思是“凡是进入这个网关、目的为任意IP的流量,先查策略路由”。
第三步:配置策略路由并应用
策略路由的配置分两个环节,先定义流分类、流行为,再创建策略并应用:
traffic classifier vlan10_to_fw if-match acl 3000 traffic behavior to_fw redirect ip-nexthop 192.168.100.2 traffic policy pbr_vlan10 classifier vlan10_to_fw behavior to_fw interface vlanif 10 traffic-policy pbr_vlan10 inbound这段配置的含义是:来自192.168.10.0/24网段的流量在进入Vlanif10时,被策略路由强制下一跳指向192.168.100.2(防火墙)。这里用到的“traffic policy”就是一种策略路由的实现方式。华为低端设备支持“policy-based-route”关键字,例如下面这种写法:
interface vlanif 10 policy-based-route pbr_vlan10 inbound不过新版本VRP系统里,traffic-policy是更通用、功能更完整的方案,推荐使用。如果你手头的华为设备型号较老,可以在系统视图先定义策略路由:
policy-based-route pbr_vlan10 permit node 10 if-match acl 3000 apply next-hop 192.168.100.2然后在内网网关接口应用:
interface vlanif 10 ip policy-based-route pbr_vlan10两种方式二选一即可,看设备版本和习惯。如果设备版本兼容,优先建议traffic-policy方式,因为可扩展性更强,后续加策略不用重新绑定接口。
第四步:配置默认路由和回程路径
核心交换机上需要一条默认路由指向出口,保证流量在防火墙处理完返回后能继续往外走:
ip route-static 0.0.0.0 0.0.0.0 192.168.0.254这里的192.168.0.254是出口路由器的接口IP。同时,核心交换机要有去往防火墙互联网段的直连路由(配置完interface vlanif 100后自动产生),这个不用额外配。
最后,核心交换机的回程路径就清晰了:防火墙处理完流量后把报文还给核心交换机的Vlanif100接口,核心交换机再查路由表,发现目的地址是公网,匹配默认路由,从接出口路由器的物理口发出去。关键是要保证这台交换机上的流量不会再被策略路由拦截——我前面提到过,策略路由只在入方向接口上生效,流量从Vlanif100进,而Vlanif100没有应用策略,所以不会再被引流。这个细节,就是防止环路的第一道保险。
3.3 防火墙上的配置步骤
防火墙作为旁挂设备,有两个关键配置:接口IP和默认路由。
接口配置:
system-view interface gigabitethernet 1/0/0 ip address 192.168.100.2 255.255.255.252 service-manage ping permit默认路由指回核心交换机:
ip route-static 0.0.0.0 0.0.0.0 192.168.100.1这条默认路由的意义是:防火墙处理完流量之后,知道要把报文还给核心交换机。如果少了这条,防火墙收到核心交换机“丢”过来的待过滤报文,处理完成后不知道该送给谁,直接丢弃。这也是防火墙上最容易被忽略的一行配置。
另外,如果你是给上网行为管理设备做旁挂,同样要在行为管理上配置默认路由指回核心交换机,原理完全相同。设备只是“过路处理”的角色,最终的“路”还是核心交换机。
还需要配置安全策略。USG防火墙默认会拦截所有流量,所以至少要放行从内网到外网的会话:
security-policy rule name in_to_out source-zone trust destination-zone untrust action permit具体的安全策略设计取决于你的安全规划,但放行规则是必须的,否则内网流量到了防火墙就被拦,根本送不出去。当然,如果你就是要防火墙过滤所有上网流量,那策略会更严密,需要按业务需求设计白名单,但这属于安全策略层面,不是旁挂主题的核心,这里不展开。
3.4 配置后的验证方法
配置完成后,一定要做验证,不能配完就跑。我每次都会做至少三步验证:
第一步,测试内网PC到防火墙的连通性。在内网终端上ping防火墙的内网接口IP 192.168.100.2,如果能通,说明二层链路没问题。
第二步,在核心交换机上看策略路由是否生效。查看ACL匹配次数:
display acl 3000如果看到越来越多的匹配次数,说明策略路由确实在匹配流量,引流在生效。
第三步,在防火墙上看会话表:
display firewall session table如果有内网到外网的会话记录,说明流量确实经过防火墙,并且已经建立起状态检测的会话。如果会话表里有记录,但业务不通,问题多半出在回程路径或者安全策略上。
4. 常见问题与排查技巧实录
4.1 流量黑洞:引流后业务中断,设备上却看不到流量
这是我见过最多的情况。策略路由配置完全正确,ACL匹配次数也在增长,但业务就是不通。排查思路从两个方向展开:第一,在防火墙上抓包,看报文有没有真的到防火墙。可以用display firewall statistics或者直接抓包工具,确认设备“物理上”收到了报文。如果防火墙这里收到报文但业务不通,问题在防火墙上——大概率是安全策略挡住了流量,或者默认路由没指对。
第二,回程路径不通。因为回流报文不是简单从防火墙发回核心交换机,而是从目标服务器回应后,再反向到达防火墙,防火墙再转给核心交换机。这个过程涉及核心交换机的路由表。最有效的排查方法是查会话表:如果防火墙上有内网到外网的会话,但外网到内网方向没有会话,说明回程报文没有经过防火墙,问题就在回程路由上。这时重点检查防火墙默认路由是否正确指向核心交换机。
4.2 环路问题:核心交换机和防火墙之间流量“弹来弹去”
环路是旁挂配置中风险最高、最难排查的问题。典型表现是核心交换机的CPU使用率飙升,接口流量异常增大,但业务完全不通。
环路产生的根本原因是:从防火墙回程到核心交换机的报文,在核心交换机上又被策略路由匹配,再次转发给防火墙。比如你在核心交换机的Vlanif10下应用了策略路由,内网流量被引向防火墙,防火墙处理完返回核心交换机后,从Vlanif100进入,如果此时Vlanif100也应用了流向防火墙的策略路由,就会形成环。
避免环路有几个关键操作:
策略路由应用位置要收敛。只在内网终端网关接口(Vlanif10)上应用引流策略,Vlanif100(接防火墙的接口)绝对不要挂相同策略。这样防火墙回来的报文就不会二次被匹配。
ACL匹配范围要精准。不要把范围写得太宽,比如用acl 3000匹配了192.168.0.0/16,那从防火墙回来的内网流量也会被匹配,就成环了。匹配的是终端网段,就要写清楚终端网段。
利用防环机制。华为的策略路由有“redirect”后重定向的报文不再次匹配策略路由的机制吗?实际上在traffic-policy方式下重在vlanif接口上,报文是三层进来,二三层都会查一遍,所以还是要靠“入接口不匹配同一策略”来避免,防环还是靠设计而不是靠设备兜底。更保险的做法是在防火墙默认路由指回的下一跳(核心交换机)再接一个单独的回程区域,比如专门用一个VLAN来做回程,这样流量从专门回程VLAN进入核心交换机,更不容易被业务策略匹配到。
4.3 健康检查:旁挂设备挂了你怎么办
旁挂设备可能出现故障,或者被管理员误重启。如果核心交换机上的策略路由依然把流量指向旁挂设备,而旁挂设备已经不再工作,流量必然出问题。生产环境必须考虑这个高可用问题。
有一种方案是配置“策略路由的失效回退”功能。华为设备支持NQA(Network Quality Analysis)与策略路由联动:当NQA检测到旁挂设备不可达时,自动停止策略路由的引流,让流量走正常路由。配置思路:
nqa test-instance admin fw_check test-type icmp destination-address ipv4 192.168.100.2 frequency 5 probe-count 2 start now policy-based-route pbr_vlan10 permit node 10 if-match acl 3000 apply next-hop 192.168.100.2 apply next-hop 0.0.0.0在这种联动方式下,如果NQA检测到192.168.100.2不通,策略路由会让流量转给下一跳(比如出口路由器),而不是黑洞丢弃。具体配置命令因设备版本而异,但思路是统一的:一定要有Bypass机制。旁挂的优势就在于故障时可以绕过,不会完全断网,别自己把这条后路给堵了。
4.4 策略路由和链路负载均衡的坑
有一种我踩过的坑:核心交换机上同时配置了策略路由和链路负载均衡,引流策略和负载均衡策略相互冲突。策略路由把流量引给旁挂设备,但回程时又触发了负载均衡的分流规则,把流量从另外一条出口线路送出去。公网IP地址不一致,数据包从A线路出去,从B线路回来,防火墙状态检测发现会话状态不匹配,直接丢弃。
解决方法是:引流策略和负载均衡策略要错开生效范围。策略路由引流只针对特定业务,负载均衡策略只针对非引流的流量,两个方向的匹配条件严格互斥。配置完后,一定要在不同业务上分别做连通性测试,确认没有互相干扰。
4.5 常见问题速查表
为了方便排查,我把旁挂配置里最常遇到的五类问题整理成表格:
| 现象 | 可能原因 | 排查命令 | 解决方案 |
|---|---|---|---|
| 业务全断,接口灯正常 | 防火墙默认路由缺失 | display ip routing-table | 添加ip route-static 0.0.0.0 0.0.0.0 192.168.100.1 |
| 上网时通时不通 | 安全策略只放行了单向流量 | display firewall session table | 确认双向会话建立,补全安全放行策略 |
| CPU飙升,接口流量异常大 | 旁挂环路了 | display cpu-usage,观察接口流量 | 检查策略路由应用接口,移除可能二次匹配的策略 |
| 只有部分终端能上网 | ACL匹配范围不精准 | display acl 3000,查看匹配次数 | 修正ACL规则,覆盖所有需要引流的网段 |
| 旁挂设备重启后业务中断 | 没有Bypass机制 | 检查策略路由是否生效 | 配置NQA联动策略路由,实现故障自动回退 |
4.6 排查思路的整体框架
最后一个排查经验,是我这些年反复使用的一个方法论。不管是旁挂还是串接,流量不通就按“三查”思路走:查物理链路、查路由转发、查安全策略。
- 查物理链路:接口状态是不是UP,接口有没有收到错误包,VLAN配置是不是对得上。这条最快,很多人链路都没通,就开始查路由表,纯属浪费时间。
- 查路由转发:在核心交换机上用display ip routing-table查看目的网段的路由是否存在、下一跳是否正确,再用tracert追踪实际路径,确认报文走的是不是预期的旁挂路径。
- 查安全策略:如果路径没问题,那就是设备策略拦截了。防火墙安全策略、ACL规则、连接数限制,一项项排除。
这三查做完,90%的问题都能定位。剩下的10%大概率是设备硬件处理异常或者软件Bug,那就得抓包分析,但这已经属于高阶排障了。
5. 进阶技巧:公域到私域引流路径的设计思路延伸
写完核心实操,额外分享一个我在实际项目中常用的进阶思路。旁挂设备+策略路由,在边界场景中可以被用来做“公域流量到私域方向”的路径优化设计。这里的“公域”可以理解为外网来的流量,“私域”指内网服务器区。
举个例子:公司有对外提供Web服务,公网用户访问公司官网。请求先进出口路由器,目标地址是公网IP。此时如果这台Web服务器也被安全设备纳管,你就需要在核心交换机上把“从公网方向来的、目的为服务器区”的流量也通过策略路由引向旁挂防火墙。这个方向上的引流,和前面讲的内网到外网方向刚好对称,但有个最大的区别:源地址不是内网网段,而是任意公网地址。
ACL匹配就要反过来写,匹配目的地址:
acl number 3001 rule 5 permit ip destination 192.168.20.0 0.0.0.255策略路由引流的下一跳还是防火墙上,只不过这次,防火墙处理完报文以后,回程路径是送回核心交换机,再到服务器。服务器回公网用户的报文,也要经过防火墙(否则单向会话无法建立),所以服务器区域的Vlanif20接口同样需要配置去往防火墙的策略路由。这时候需要注意:服务器访问公网的流量(比如服务器要升级补丁)不一定要经过防火墙,所以策略要分方向:入方向的流量(公网来)引流,出方向的流量(服务器主动出去)走普通路由,避免不必要的性能开销。
公域到私域的引流设计,核心原则是“入站严格、出站放宽”。入站流量是外部不可信流量,全都要经过安全设备检查;出站如果是服务器主动发起的补丁或更新类流量,按业务需求决定要不要过滤。这个设计头疼的地方在于:Web服务有“请求-回包”两个方向,如果只引流入站,回包不经过防火墙,状态检测就会出问题。所以回包方向也必须引流,但没必要把服务器所有的主动出站流量都引过去。解决方式是把服务器接口的引流策略拆成两个ACL,一个匹配“已建立的会话回包”,一个匹配“从外部来的新连接”,前一个引流,后一个放行或视需求而定。
我实际遇到一个项目里,就是因为服务器主动升级补丁的流量没走防火墙,而防火墙的安全策略里又有一条“允许从untrust到trust”的规则,结果补丁下载流量直接从防火墙穿越了,安全审计时发现了异常流量。后面我们把规则改细,严格区分了新连接会话和回包,才把这个问题彻底解决。这个案例就是提醒你:旁挂引流不只是配策略的事儿,还牵扯到安全策略的整体设计,安全设备“看到”的流量和“没看到”的流量,边界必须清晰,否则安全策略就是形同虚设。
在生产环境中真正跑旁挂+策略路由方案时,我再强调三个容易被忽略的点:
第一,配置前先画好流量走向图。别急着敲命令。先在纸上画清楚,哪些流量从哪个接口进、从哪个接口出、经过哪些设备处理、回程怎么走。网络规划和写代码一个道理,设计阶段多花半小时,实施阶段少熬一个通宵。
第二,先模拟再上线。有条件的话,先在测试环境配一遍,或者用设备自带的策略模拟功能验证路径。没有测试环境,就在低峰期操作,准备好配置回滚方案。我见过太多人配置敲完一复制进生产环境就出事了,不是思路错,是命令细节敲错,比如下一跳IP写反、接口选错,这类低级错误要靠回滚方案兜底。
第三,监控和告警必须同步上线。旁挂设备本身不可达时,策略路由应该自动回退,但这个回退如果没有告警,管理员根本不知道。部署完成后,一定要给核心交换机、旁挂设备加监控,关键是旁挂设备接口连通性如果超过一定阈值无响应,要触发告警。否则等用户反馈“网络卡了”才发现是旁挂设备挂了,那就很被动了。
说实话,旁挂+策略路由这套方案,本身的技术含量不算高,但它的难点在于“细节严谨”。下一跳指向哪里、回程怎么走、策略应用在哪个接口、故障怎么回退,每一步想清楚,就是个稳定可靠的方案;每一步都想当然,每一处都是坑。希望这篇分享能帮你把该避开的坑都避开,配出既灵活又稳定的旁挂引流网络。