Cisco 300-415: Cisco SD-WAN 織物架構與層面 — 學習指南
屬於 Cisco SD-WAN 300-415 ENSDWI — 學習指南. 使用經過驗證的解答練習: Cisco 考試中心, 或參加限時模擬考試: ExamRoll.io.
總覽
Cisco SD-WAN 是一個以意圖為導向的織網 (fabric),由不同的元件和平面所建構,將管理、協調、控制和資料功能分開。此架構可從少數幾個分支機構擴展到數千個,且不受底層傳輸網路的影響,同時維持確定性的控制和安全性。本節將解釋 vManage、vSmart、vBond 和 WAN Edge 的角色;互連它們的各個平面和協定;平台選擇;定址和分段;疊加網路拓撲模式;多租戶和分組概念;以及您必須考慮的關鍵設計權衡和故障模式。
織網元件與平面
- WAN Edge:位於分支機構、園區、主機託管或雲端邊緣的資料平面路由器。它負責建立安全的資料通道、執行策略、運行 BFD 以偵測路徑的存活性、與控制器交換 OMP 路由,並轉發使用者流量。
- vSmart Controller:控制平面的大腦。它建立並維護疊加網路拓撲、透過 OMP 分發路由和策略資訊,並協調 WAN Edge 的連線和加密金鑰的分發,以便在邊緣設備之間建立安全的 IPsec 對等連線。
- vBond Orchestrator:新設備上線時的第一個接觸點。它會驗證設備身份、協助 NAT 穿透,並協調每個 WAN Edge 與 vSmart 的連線。它與 vSmart 控制器保持持續連線,並且通常位於可連線的公用 IP 空間中,以便進行通用上線程序。
- vManage:管理和協調平面 (NMS)。它提供意圖輸入、設定範本、映像檔管理、遙測、Cloud OnRamp 自動化和 API。vManage 不參與轉發控制平面。
平面與協定:
- 管理平面:vManage 使用安全通道 (NETCONF/gRPC over TLS) 來監控和設定設備與控制器。
- 協調平面:vBond 使用 DTLS/TLS 來驗證設備、分享控制器的可達性資訊,並穿透 NAT。在有控制器憑證且未設定備用連接埠的情況下,vBond 會在 UDP/TCP 12346 上監聽。
- 控制平面:vSmart 使用 OMP 與 WAN Edge 設備交換前綴 (prefixes)、TLOCs 和策略。控制連線預設使用 DTLS;也支援 TLS,這通常是為了穿過嚴格的防火牆或符合法規要求。
- 資料平面:WAN Edge 設備在 TLOCs 之間建立 IPsec (或在適當情況下使用 GRE) 通道以進行加密傳輸,並在每個通道上進行 BFD 探測,以實現次秒級的故障偵測和應用程式感知路由。
加入時的生命週期:
- WAN Edge 接觸 vBond,進行身份驗證,並接收控制器列表。
- WAN Edge 與 vSmart 建立 DTLS/TLS 控制會話(並與 vManage 建立管理會話)。
- vSmart 分發加密金鑰資訊;接著 WAN Edge 根據策略和拓撲的要求,與其他 WAN Edge 建立 IPsec 通道。
對彈性的影響:
- 失去 vManage 只會影響設定和可視性;資料轉發會繼續。
- 失去 vBond 會影響新設備的上線;現有設備不受影響。
- 失去所有 vSmart 控制器會隔離控制平面;資料通道會持續存在,但路由/策略變更會停止,且過時的控制狀態可能會隨著時間推移而降低運作效能。
- 由 BFD 驅動的路徑故障轉移和多個 TLOCs 在底層網路或傳輸中斷期間提供資料平面的連續性。
身份、定址與分段
身份和定址是以疊加網路為中心:
- Organization name:一個全織網範圍的字串,必須在所有設備和控制器上相符;不匹配會阻止控制平面建立鄰接關係。
- System IP:每個設備唯一的、類似 loopback 的 32 位元識別碼,用於 TLOC 元組和控制平面定址。它不與任何實體介面綁定。
- Site ID:一個數字識別碼,用於將同一地點的設備分組。預設情況下,共享相同站點 ID 的設備之間不會建立直接的資料通道,以避免在站點內部產生髮夾彎 (hairpins) 和迴圈。
- Certificates:設備和控制器使用 X.509 身份。硬體 WAN Edge 利用安全設備身份 (SUDI) 進行零接觸配置 (zero-touch provisioning);所有設備在加入織網之前都必須在 vManage 中註冊並獲得授權。
關鍵的 VPNs:
- VPN 0 (Transport):承載底層傳輸連線和朝向 MPLS、DIA、寬頻或 LTE 的 TLOC 介面。NAT、DHCP、PPPoE 以及靜態/預設路由在此終止。TLOC = {system IP, color, encapsulation},其中 color 用於描述傳輸類型(例如 mpls、biz-internet、public-internet),而 encapsulation 則是 IPsec 或 GRE。
- VPN 512 (Management):帶外設備管理和控制器可達性。在 IOS XE SD-WAN 上,這會對應到一個管理 VRF;在 vEdge 上,它明確地是 VPN 512。控制器和 WAN Edge 使用 TLS 安全協定建立管理會話。
- Service VPNs (1–511 except 512):承載使用者服務,可以運行 OSPF、EIGRP、BGP、靜態路由或橋接。策略(集中式和本地化)用於引導 VPN 間和 VPN 內的流量、QoS 和安全性。
有用的基礎設定元素:
sdwan
system-ip 10.255.0.11
site-id 101
organization-name ACME-Global
需要注意的故障模式:
- 重複的 system IP 或 site ID 會造成控制異常或不希望的通道抑制。
- Organization-name 不匹配會阻止 OMP 鄰接關係的建立。
- 憑證過期或被撤銷會切斷控制器或設備的信任關係。
- 在 VPN 512 中錯置管理預設路由會使設備與控制器失聯;在 VPN 0 中錯置傳輸預設路由會隔離 TLOCs。
平台、部署模型與控制器設計
WAN Edge 平台:
- Cisco IOS XE SD-WAN:支援 ISR 4000 系列與 ASR 1000 系列平台(以及 Catalyst 8000 家族)。為了長期的功能演進速度與統一的分支機構服務,建議優先選用 IOS XE SD-WAN。
- vEdge:許多部署中仍支援早期的 Viptela 硬體/虛擬平台;規劃遷移時應考量功能差距與生命週期時程。
- 虛擬 WAN Edge:執行於 hypervisor 與伺服器上,包括 Cisco UCS 和 Cisco ENCS 5000 系列,以及公有雲(AWS、Azure、GCP)。使用 Cloud OnRamp 來自動化 IaaS 部署;先決條件包括訂閱雲端市集映像檔(例如 AWS AMI)並在 vManage 中準備好設備範本。
Underlay 獨立性與傳輸多樣性:
- 每個 TLOC 都會綁定到一個帶有關聯顏色的傳輸;政策可以根據應用程式、SLA 或站點角色來偏好、平衡或排除特定傳輸。
- 在不受信任的 underlay 上,預設使用 IPsec;在私有 MPLS 上,若加密非必要或受限,則可使用 GRE。
- BFD 提供每個通道的存活性與 SLA 指標(掉包率、延遲、抖動),以驅動應用程式感知路由。
控制器叢集、擴展、高可用性與部署位置:
- vManage:部署為三節點或更大的叢集以實現 HA 與彈性;與高吞吐量的儲存設備部署在同一位置,以存放遙測資料與映像檔儲存庫。請頻繁備份。
- vSmart:跨故障域和地理區域部署多個控制器;所有 WAN Edge 都會與一個以上的 vSmart 建立控制連線。vSmart 執行個體可水平擴展;規劃 N+1 容量以承受控制器故障。
- vBond:在公有位址空間中(或透過靜態 NAT 與一致的連接埠映射)部署至少兩個 orchestrator。vBond 會與 vSmart 維持永久連線,並在 WAN Edge 上線引導期間與其建立暫時連線。
- 部署位置:控制器可託管在您的資料中心或公有雲中。確保 vBond 從網際網路有確定的入向連線能力,並為 WAN Edge 提供足夠的出向流量。如果中間設備強制要求 TLS 檢測例外,請優先選擇 TLS 控制連線而非 DTLS。
維運注意事項:
- 預設的控制平面傳輸為 DTLS;當穿越只允許基於 TCP 的加密控制的嚴格防火牆或合規域時,請切換到 TLS。確保相關的連接埠已全程開通。
- 當 WAN Edge 加入時,它會根據 OMP 的可達性與政策,與 vSmart 建立 DTLS/TLS 連線,並與對等 edge 建立 IPsec 通道。在寬頻線路上確保 NAT keepalive 與 UDP pinhole,以避免通道無聲中斷。
覆蓋拓撲、多租戶與設計權衡
拓撲模式是透過集中式控制策略 (路由與 TLOC 廣告) 和本地化資料策略來實現的:
- 全網狀 (Full mesh):所有站點間的延遲最低;具備絕佳的彈性;但由於大量的 IPsec/BFD 會話,控制與資料平面的擴展負載最高。
- 星狀 (Hub-and-spoke):通道數量較少,擴展簡單;若無雙中心設計,中心 (hub) 會成為頻寬與彈性的瓶頸;分支到分支 (spoke-to-spoke) 的路徑延遲較高。
- 區域中心 (Regional hub):透過將全網狀範圍限定在區域內,並經由中心回傳跨區流量,來平衡延遲與擴展性;需要謹慎的策略以防止流量繞行 (tromboning)。
- 雙中心 (Dual hub) (主動/主動或主動/備援):提升彈性並可分散負載;但會增加控制的複雜性 (ECMP、決勝機制 (tie-breaking)、迴圈預防),並消耗更多中心資源。
多租戶與分組:
- 真正的多租戶 (True multitenancy):服務供應商可以在控制器上啟用多租戶模式,以便在同一個控制器叢集上,為多個邏輯組織提供隔離的控制平面、管理員和策略。
- 依租戶或業務單位進行分割:使用服務 VPN 來強制執行流量隔離、在需要時進行路由洩漏 (route-leaking),以及設定個別 VPN 的策略/QoS。
- 裝置分組:使用 vManage 的裝置群組、站點列表、VPN 列表、前綴/TLOC 列表,來依功能、區域或角色指定策略、升級和範本的套用對象。
設計權衡:
- 延遲 vs. 策略控制:全網狀能將延遲降到最低,但使策略執行與觀察變得複雜;星狀拓撲簡化了控制,但增加了東西向流量的延遲。
- 彈性 vs. 維運規模:更多的 TLOC、傳輸線路和中心能增加可用性與路徑選擇,但同時也倍增了 IPsec/BFD 會話數量與控制規模。使用區域化和路由彙總來控制 OMP 和 FIB 的大小。
- 底層網路多樣性 vs. 成本:增加寬頻和 LTE 可改善連線能力與對抗網路效能劣化 (brownout) 的能力;但成本、NAT 行為和可變的抖動 (jitter) 可能會使 SLA 變得複雜。使用源自 BFD 的 SLA 等級和應用程式感知路由 (app-aware routing) 來限制敏感流量的路徑。
- 集中式策略豐富度 vs. 故障排除的不透明性:複雜的匹配/動作鏈提供了精細的控制,但也可能使轉送邏輯變得模糊不清。應保持策略的模組化、版本化和良好的文件記錄;並在預備環境 (staging fabric) 中進行測試。
- 安全性 vs. 效能:在所有傳輸線路上強制使用 IPsec 可增強機密性,但會帶來 CPU 開銷以及 MTU/分片考量。應優先選用硬體加密加速和一致的 MSS/PMTUD 調校。
常見的故障模式與緩解措施:
- 非對稱策略導致通道無法建立:對稱地驗證 TLOC 和控制策略;確認 OMP TLOC 路由。
- UDP 的 NAT 穿透孔 (pinhole) 過期:優先使用 TLS 控制連線,或設定 NAT keepalive;考慮為控制器設定靜態 NAT。
- 站點 ID 誤用導致站點內通道崩潰:確保每個實體位置都有唯一的站點 ID;使用 BFD 顏色限制策略來實現園區內意圖,而非強制合併站點。
- 中心資源耗盡 (Spoke-starved hubs):監控中心的 CPU/加密資源和 BFD 會話數量;擴展中心 (scale out) 或引入區域中心;使用 QoS 和流量管制器 (policer) 來保護控制流量。
實際問題情境
Apex 製造公司正在將業務擴展到 AWS,同時在全球營運 600 個分支機構,這些分支機構使用雙傳輸線路 (MPLS 和 DIA)。他們需要將 SD-WAN 延伸至 AWS,以最低延遲存取區域應用程式,透過使用 TLS 進行控制來維持合規性,並確保控制器的 HA (高可用性)。
- 將兩台 vBond orchestrator 放置在公有 IP 空間,並將三台 vSmart controller 部署在兩個雲端環境中。
- 理由:vBond 必須可從公網存取以協助 NAT 穿透;多個 vSmart 實例提供控制平面的 HA 和地理鄰近性。vBond 維護與 vSmart 的永久會話,以及與 WAN Edge 的暫時會話,從而加速新設備的啟用 (onboarding) 和重新連接。
- 將所有控制連線轉換為 TLS,並允許 TCP 12346 通過企業防火牆。
- 理由:預設的 DTLS 可能會被嚴格的中間設備 (middlebox) 阻擋。TLS 確保控制平面可以通過 TCP 代理和檢測域,而不會犧牲加密或完整性。
- 將 vManage 以三節點叢集的形式部署在一個中央雲端區域,並進行每日備份。
- 理由:管理平面必須保持可用,以進行策略、映像檔和遙測操作。叢集化可保存狀態並擴展 API/GUI 的存取能力;備份可保護免於營運資料的遺失。
- 使用 Cloud OnRamp for IaaS 在 AWS 中實例化虛擬 WAN Edge 路由器,每個 VPC 一個,部署在附加到 transit gateway 的子網路中。
- 理由:Cloud OnRamp 可自動化 AMI 訂閱、部署和憑證註冊。WAN Edge 裝置終止 SD-WAN TLOC,並透過 OMP 廣播 VPC 路由,從而將雲端工作負載以相同的策略集整合到 SD-WAN fabric 中。
- 從保留的覆蓋網路區塊中指派 system IP,為每個雲端區域指派唯一的站點 ID (例如 9001–9010),並在整個 fabric 中設定一致的組織名稱。
- 理由:唯一的 system IP 和站點 ID 可防止通道被抑制和控制平面的模糊性。組織名稱的一致性對於 OMP 鄰居關係的建立和憑證信任是強制性的。
- 在 AWS edge 上為 VPN 0 設定雙傳輸線路 (公用網際網路,以及在可用時,透過私有顏色 (private color) 的 Direct Connect),並啟用 BFD 與 SLA 等級以實現應用程式感知路由。
- 理由:傳輸線路的多樣性可改善連線能力和對抗網路效能劣化的能力。BFD 提供掉包/延遲/抖動的指標,以根據 SLA 將應用程式流量導向效能最佳的 TLOC。
- 僅將 VPN 512 開放給管理子網路,並透過明確的靜態路由和 ACL 限制到控制器的路由。
- 理由:將管理平面的攻擊面降到最低,並避免可能導致裝置孤立或過度暴露控制器服務的路由洩漏。
- 實作一個區域中心拓撲,使用 AWS edge 作為其各自區域的中心,每個大陸配置雙本地中心 (on-prem hub) 以進行故障轉移,並為延遲敏感的流量啟用分支到分支 (spoke-to-spoke) 的直接網際網路路徑。
- 理由:區域中心將流量本地化以減少延遲並控制擴展規模;雙中心提供備援。受控的分支到分支直接通道可在不使中心過載的情況下,為即時應用程式保持低延遲。
- 應用集中式控制策略,在區域中心彙總分支路由,將 TLOC 廣告限制在預期區域內,並使用服務 VPN 為生產、OT 和訪客流量強制執行分割。
- 理由:路由彙總可減少 OMP 路由的變動 (churn) 和記憶體使用量。限定範圍的 TLOC 廣告可防止意外的跨區域通道建立。基於 VPN 的分割可維持合規性邊界,僅在需要時才進行明確的路由洩漏。
- 監控 BFD 和控制平面的健康狀況;設定當 vSmart 或 vBond 遺失時的警報,並預先配置 N+1 的容量。
- 理由:及早偵測到控制功能的劣化可防止大範圍的不穩定。N+1 確保 fabric 在控制器故障時仍能維持運作而不會發生會話耗盡,從而保護控制平面的收斂和資料平面的彈性。
所有領域 · 控制器上線、憑證與安全控制連線 →
練習這些題目 → · 在 ExamRoll.io 上限時練習 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通過考試 →