Cisco 300-415: Cisco SD-WAN Fabric 架构和平面 — 学习指南
属于 Cisco SD-WAN 300-415 ENSDWI — 学习指南. 使用经过验证的答案练习: Cisco 考试中心, 或参加限时模拟考试: ExamRoll.io.
概述
Cisco SD-WAN 是一个基于意图的架构,由不同的组件和平面构建而成,这些组件和平面分离了管理、编排、控制和数据功能。该架构可从几个分支机构扩展到数千个,且独立于底层传输,同时保持确定性的控制和安全性。本节将解释 vManage、vSmart、vBond 和 WAN Edge 的角色;连接它们的平面和协议;平台选择;地址和分段;叠加网络拓扑模式;多租户和分组概念;以及您必须考虑的关键设计权衡和故障模式。
架构组件和平面
- WAN Edge:位于分支机构、园区、托管中心或云边缘的数据平面路由器。它负责建立安全的数据隧道、执行策略、运行 BFD 以检测路径活性、与控制器交换 OMP 路由以及转发用户流量。
- vSmart Controller:控制平面的大脑。它构建并维护叠加网络拓拓扑,通过 OMP 分发路由和策略信息,并编排 WAN Edge 的连接和加密密钥分发,以便在边缘设备之间建立安全的 IPsec 对等连接。
- vBond Orchestrator:新设备接入的第一个联系点。它负责验证设备身份、协助 NAT 穿越,并协调每个 WAN Edge 与 vSmart 的连接。它与 vSmart 控制器保持持久连接,并且通常位于可达的公网 IP 空间,以便于通用上线流程。
- vManage:管理和编排平面 (NMS)。它提供意图输入、配置模板、镜像管理、遥测数据、Cloud OnRamp 自动化和 API。vManage 不参与转发控制平面。
平面和协议:
- 管理平面:vManage 使用安全通道 (基于 TLS 的 NETCONF/gRPC) 来监控和配置设备及控制器。
- 编排平面:vBond 使用 DTLS/TLS 来验证设备、共享控制器可达性信息以及穿透 NAT。在配置了控制器证书且未配置备用端口的情况下,vBond 在 UDP/TCP 12346 端口上侦听。
- 控制平面:vSmart 使用 OMP 与 WAN Edge 设备交换前缀、TLOC 和策略。控制连接默认为 DTLS;也支持 TLS,并且在有严格防火墙或合规性要求的环境中通常需要使用 TLS。
- 数据平面:WAN Edge 设备在 TLOC 之间构建 IPsec (或在适当情况下使用 GRE) 隧道以实现加密传输,每个隧道都进行 BFD 探测,以实现亚秒级故障检测和应用感知路由。
加入时的生命周期:
- WAN Edge 联系 vBond,进行身份验证,并接收控制器列表。
- WAN Edge 与 vSmart 建立 DTLS/TLS 控制会话 (并与 vManage 建立管理会话)。
- vSmart 分发加密密钥信息;然后 WAN Edge 根据策略和拓扑要求,与其他 WAN Edge 建立 IPsec 隧道。
对弹性的影响:
- vManage 丢失仅影响配置和可见性;数据转发继续。
- vBond 丢失影响新设备的上线;现有设备不受影响。
- 所有 vSmart 控制器丢失会隔离控制平面;数据隧道会保持,但路由/策略变更会停止,过时的控制状态可能会随时间推移而降低运维质量。
- 在底层或传输中断期间,由 BFD 驱动的路径故障切换和多个 TLOC 可提供数据平面的连续性。
身份、地址和分段
身份和地址是以叠加网络为中心的:
- 组织名称:一个整个架构范围的字符串,必须在所有设备和控制器上匹配;不匹配会阻止控制平面邻接关系的建立。
- 系统 IP:每个设备唯一的、类似环回接口的 32 位标识符,用于 TLOC 元组和控制平面寻址。它不与任何物理接口绑定。
- 站点 ID:用于对同一位置的设备进行分组的数字标识符。默认情况下,共享同一站点 ID 的设备之间不建立直接的数据隧道,以避免站点内部出现流量迂回 (hairpin) 和环路。
- 证书:设备和控制器使用 X.509 身份。硬件 WAN Edge 利用安全设备身份 (SUDI) 实现零接触部署;所有设备在加入架构之前都必须在 vManage 中注册并获得授权。
关键 VPN:
- VPN 0 (传输):承载底层传输连接以及朝向 MPLS、DIA、宽带或 LTE 的 TLOC 接口。NAT、DHCP、PPPoE 以及静态/默认路由在此终结。TLOC = {系统 IP, 颜色, 封装},其中颜色表征传输类型 (例如 mpls、biz-internet、public-internet),封装是 IPsec 或 GRE。
- VPN 512 (管理):带外设备管理和控制器可达性。在 IOS XE SD-WAN 上,这映射到一个管理 VRF;在 vEdge 上,它就是明确的 VPN 512。控制器和 WAN Edge 使用 TLS 安全的协议建立管理会话。
- 服务 VPN (1–511,512 除外):承载用户服务,可以运行 OSPF、EIGRP、BGP、静态路由或桥接。策略 (集中式和本地化) 用于引导 VPN 间和 VPN 内的流量、QoS 和安全。
有用的基础配置元素:
sdwan
system-ip 10.255.0.11
site-id 101
organization-name ACME-Global
需要注意的故障模式:
- 重复的系统 IP 或站点 ID 会造成控制异常或不希望的隧道抑制。
- 组织名称不匹配会阻止 OMP 邻接关系的建立。
- 证书过期或吊销会切断控制器或设备的信任关系。
- 在 VPN 512 中放置了错误的管理默认路由会使设备与控制器隔离;在 VPN 0 中放置了错误的传输默认路由会隔离 TLOC。
平台、部署模型与控制器设计
WAN Edge 平台:
- Cisco IOS XE SD-WAN:支持 ISR 4000 系列和 ASR 1000 系列平台(以及 Catalyst 8000 系列)。为了长期的功能迭代速度和统一的分支机构服务,优先选择 IOS XE SD-WAN。
- vEdge:在许多部署中仍支持早期的基于 Viptela 的硬件/虚拟平台;迁移规划应考虑功能差距和生命周期时间线。
- 虚拟 WAN Edge:运行在 hypervisor 和服务器上,包括 Cisco UCS 和 Cisco ENCS 5000 系列,以及公有云(AWS、Azure、GCP)中。使用 Cloud OnRamp 自动化 IaaS 部署;先决条件包括订阅云市场镜像(例如 AWS AMI)并在 vManage 中准备设备模板。
Underlay 独立性与传输多样性:
- 每个 TLOC 绑定到一个具有关联颜色的传输;策略可以根据应用、SLA 或站点角色来优选、均衡或排除传输。
- 在不受信任的 underlay 上,默认使用 IPsec;在无需加密或加密受限的私有 MPLS 上,可以使用 GRE。
- BFD 提供逐隧道的活性检测和 SLA 指标(丢失、延迟、抖动),以驱动应用感知路由。
控制器集群、扩展、高可用性与部署位置:
- vManage:部署为三节点或更大的集群以实现高可用性(HA)和弹性;与高吞吐量存储共同部署,用于遥测和镜像仓库。频繁备份。
- vSmart:跨故障域和地理区域部署多个控制器;所有 WAN Edge 与不止一个 vSmart 建立控制会话。vSmart 实例水平扩展;规划 N+1 容量以承受控制器故障。
- vBond:在公共地址空间中(或通过静态 NAT 和一致的端口映射)部署至少两个 orchestrator。vBond 维护与 vSmart 的永久会话,以及在引导(onboarding)期间与 WAN Edge 的临时会话。
- 部署位置:控制器可以托管在您的数据中心或公有云中。确保 vBond 从互联网具有确定的入站可达性,并为 WAN Edge 提供充足的出站带宽。如果中间设备强制要求 TLS 检查例外,则优先选择 TLS 控制会话而非 DTLS。
运维说明:
- 默认的控制平面传输是 DTLS;当穿越只允许基于 TCP 的加密控制的严格防火墙或合规域时,切换到 TLS。确保相应的端口端到端都被允许。
- 当一个 WAN Edge 加入时,它会与 vSmart 建立 DTLS/TLS 连接,并根据 OMP 可达性和策略与对等 Edge 建立 IPsec 隧道。在宽带链路上确保 NAT keepalive 和 UDP 穿透(pinhole),以避免隧道静默中断。
覆盖网络拓扑、多租户与设计权衡
拓扑模式通过集中式控制策略(路由和 TLOC 宣告)和本地化数据策略实现:
- 全互联 (Full mesh):所有站点间的延迟最低;弹性极佳;由于存在大量 IPsec/BFD 会话,控制和数据平面的扩展负载最高。
- 中心辐射型 (Hub-and-spoke):隧道数量较少,易于扩展;若无双中心设计,中心 (hub) 会成为带宽和弹性的瓶颈点;分支到分支 (spoke-to-spoke) 的路径延迟较高。
- 区域中心 (Regional hub):通过在区域内构建全互联并将跨区域流量通过中心回传,来平衡延迟和规模;需要精细的策略来防止流量迂回 (tromboning)。
- 双中心 (Dual hub) (主/主或主/备):提升弹性并可分担负载;增加了控制复杂度(ECMP、决胜机制、环路预防),并消耗更多中心资源。
多租户与分组:
- 真正多租户:服务提供商可以在控制器上启用多租户模式,以便在同一个控制器集群上托管多个逻辑组织,这些组织拥有隔离的控制平面、管理员和策略。
- 按租户或业务单元分段:使用服务 VPN 来强制实现流量隔离,在需要时进行路由泄露,并应用基于 VPN 的策略/QoS。
- 设备分组:使用 vManage 设备组、站点列表、VPN 列表、前缀/TLOC 列表,按功能、区域或角色来应用策略、升级和模板。
设计权衡:
- 延迟 vs 策略控制:全互联模式能最大限度降低延迟,但使策略执行和监控变得复杂;中心辐射型模式简化了控制,但增加了东西向流量的延迟。
- 弹性 vs 运维规模:更多的 TLOC、传输链路和中心能提高可用性和路径选择,但同时也增加了 IPsec/BFD 会话数量和控制规模。使用区域化和汇总来控制 OMP 和 FIB 的大小。
- 底层网络多样性 vs 成本:增加宽带和 LTE 可提高可达性和网络降级抵抗能力;但成本、NAT 行为和可变抖动可能会使 SLA 复杂化。使用基于 BFD 的 SLA 等级和应用感知路由来约束敏感流量。
- 集中式策略丰富性 vs 故障排查不透明性:复杂的匹配/动作链提供了精细的控制,但也可能使转发逻辑变得模糊不清。保持策略的模块化、版本化和良好的文档记录;在预生产环境中进行测试。
- 安全性 vs 性能:在所有传输链路上强制使用 IPsec 可增强机密性,但会带来 CPU 开销以及 MTU/分片问题。优先选择硬件加密加速和一致的 MSS/PMTUD 调优。
常见故障模式及缓解措施:
- 非对称策略导致隧道无法建立:对称地验证 TLOC 和控制策略;确认 OMP TLOC 路由。
- UDP 上的 NAT 针孔过期:优先使用 TLS 控制连接或配置 NAT keepalive;考虑为控制器配置静态 NAT。
- Site ID 误用导致站点内隧道崩溃:确保每个物理位置的 Site ID 唯一;使用 BFD color-restrict 策略来实现园区内互联意图,而不是强制合并站点。
- 中心因 Spoke 过多而资源枯竭:监控中心的 CPU/加密资源和 BFD 会话数;横向扩展中心或引入区域中心;使用 QoS 和 policer 保护控制流量。
实践问题场景
Apex 制造公司正在扩展到 AWS,同时在全球运营着 600 个分支机构,这些分支机构使用双传输链路(MPLS 和 DIA)。他们需要将 SD-WAN 扩展到 AWS,以最小延迟访问区域应用,通过使用 TLS 进行控制来保持合规性,并确保控制器的高可用性 (HA)。
- 将两个 vBond 编排器放置在公共 IP 地址空间,并将三个 vSmart 控制器部署在两个云中。
- 理由:vBond 必须可被公网访问以协助 NAT 穿透;多个 vSmart 实例提供控制平面的 HA 和地理邻近性。vBond 与 vSmart 保持永久会话,与 WAN Edge 保持临时会话,从而加速设备上线和重新连接。
- 将所有控制连接转换为 TLS,并在企业防火墙上允许 TCP 12346 端口。
- 理由:默认的 DTLS 可能会被严格的中间设备阻止。TLS 确保控制平面能够通过 TCP 代理和检测域,而不会牺牲加密性或完整性。
- 在一个中心云区域中将 vManage 部署为三节点集群,并进行每日备份。
- 理由:管理平面必须保持可用,以支持策略、镜像和遥测操作。集群化可以保留状态并扩展 API/GUI 访问;备份可以防止操作数据丢失。
- 使用 Cloud OnRamp for IaaS 在 AWS 中实例化虚拟 WAN Edge 路由器,每个 VPC 一个,部署在连接到 Transit Gateway 的子网中。
- 理由:Cloud OnRamp 自动化了 AMI 订阅、部署和证书注册。WAN Edge 设备终止 SD-WAN TLOC,并通过 OMP 宣告 VPC 路由,从而使用相同的策略集将云工作负载集成到 SD-WAN Fabric 中。
- 从保留的覆盖网络地址块中分配系统 IP,为每个云区域分配唯一的 Site ID(例如 9001–9010),并在整个 Fabric 中设置一致的组织名称。
- 理由:唯一的系统 IP 和 Site ID 可以防止隧道抑制和控制平面歧义。组织名称的一致性对于 OMP 邻接关系和证书信任是强制性的。
- 在 AWS Edge 上为 VPN 0 配置双传输链路(公共互联网,以及在可用时通过私有 color 使用 Direct Connect),并启用带有 SLA 等级的 BFD 以实现应用感知路由。
- 理由:传输链路多样性提高了可达性和网络降级抵抗能力。BFD 提供丢包/延迟/抖动指标,以根据 SLA 将应用流量引导至性能最佳的 TLOC。
- 仅将 VPN 512 暴露给管理子网,并通过显式静态路由和 ACL 限制到控制器的路由。
- 理由:最大限度地减少管理平面的攻击面,并避免可能导致设备孤立或过度暴露控制器服务的路由泄露。
- 实施区域中心拓扑,使用 AWS Edge 作为其各自区域的中心,每个大洲部署双本地中心用于故障转移,并为延迟敏感流量启用分支到分支的直接互联网路径。
- 理由:区域中心将流量本地化以减少延迟并控制扩展规模;双中心提供冗余。受控的分支到分支直接隧道为实时应用保留了低延迟,而不会使中心过载。
- 应用集中式控制策略,在区域中心汇总分支路由,将 TLOC 宣告限制在预期区域内,并使用服务 VPN 对生产、OT 和访客流量强制执行分段。
- 理由:路由汇总减少了 OMP 路由抖动和内存使用。范围受限的 TLOC 宣告可防止意外的跨区域隧道形成。基于 VPN 的分段通过仅在需要时进行显式路由泄露来维持合规性边界。
- 监控 BFD 和控制平面的健康状况;为 vSmart 或 vBond 的丢失设置告警,并预先配置 N+1 容量。
- 理由:及早发现控制功能退化可防止大范围的不稳定。N+1 确保 Fabric 在控制器发生故障时能够承受,而不会出现会话资源枯竭,从而保护控制平面的收敛和数据平面的弹性。
所有领域 · 控制器上线、证书和安全控制连接 →
练习这些题目 → · 在 ExamRoll.io 上限时练习 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通过考试 →