Cisco 300-415: 服务质量和组播服务 — 学习指南
属于 Cisco SD-WAN 300-415 ENSDWI — 学习指南. 使用经过验证的答案练习: Cisco 考试中心, 或参加限时模拟考试: ExamRoll.io.
概述
Cisco SD-WAN 中的服务质量 (QoS) 和组播服务旨在跨多种传输网络保障应用体验,同时实现实时流量和组播流量的可扩展、策略驱动的分发。QoS 确保按应用和按覆盖网络隧道分配优先级、进行流量整形和公平使用带宽;组播则允许为跨站点的接收者进行高效、策略控制的流复制。两者共同将意图(例如,语音/视频必须得到丢包和抖动保护;业务关键型应用必须满足 SLA)转化为一致的数据平面行为,该行为由 SD-WAN 控制平面 (vSmart) 协调,并在 WAN Edge 设备上强制执行。
QoS 架构、队列、调度、整形、策略限制和带宽分配
Cisco SD-WAN 中的 QoS 是分层且传输感知的:
- 分类:通过字段 (L3/L4)、DSCP、应用签名 (IOS XE SD-WAN 上的 NBAR2) 或 VPN 和前缀上下文来识别流量。
- 标记:从服务端设置或保留 DSCP,根据 WAN 约束按需重写,并通过 QoS map 映射到出口队列。
- 队列和调度:出口接口实现多个硬件/软件队列,包括一个用于实时流量的严格优先级低延迟队列 (LLQ),以及用于其他类别的加权调度器 (WFQ/WRR/CBWFQ)。
- 整形:将出口流量平滑至配置速率(按接口、按子接口或按隧道),以避免触发运营商的策略限制器 (policer) 并吸收突发流量。
- 策略限制 (Policing):对入口或出口的不合规流量进行速率限制,并可选择性地重标记或丢弃;应谨慎使用以避免应用性能劣化 (brownouts)。
- 带宽分配:为每个类别预留最小带宽(保证),并在适当情况下限制最大值;确保 LLQ 有一个严格、明确的上限,以防止其他队列饿死。
设计指南和权衡:
- 将整形速率设置为低于 ISP 有效策略限制器的安全值。对于可变速率的互联网线路,标称带宽的 90–95% 是一个实际的起点;根据负载下的丢包和延迟情况进行调整。
- 队列深度(缓冲)必须在延迟和丢包之间取得平衡。大小约为带宽延迟积的一部分;太小会导致尾部丢弃;太大会增加较低优先级类别的延迟。
- 仅对短时、恒定速率的语音/视频控制流使用 LLQ;不要将大比特率的视频流放入 LLQ——应将其分配给具有明确带宽上限的高优先级加权队列。
- 在出口方向,优先使用整形而非策略限制。对有明确速率合同或不受信任的入口流量应用策略限制器。
- 在承载多个覆盖网络的共享物理链路上,启用 per-tunnel QoS (PTQ),以便每个基于 BFD 的安全隧道都能获得自己的调度器/整形器,从而防止单个繁忙的覆盖网络独占链路。
- 特定于传输的策略 (color/TLOC-感知) 允许为每个底层网络配置不同的 QoS map、整形器和类别保证(例如,在互联网链路上比在 MPLS 上进行更严格的整形并使用简化的 DSCP 集合)。
Per-tunnel QoS 和传输特定细节:
- PTQ 为每个 IPsec/DTLS/TLS 隧道虚拟化出口调度,因此保证和上限是按路径而不是仅按接口应用的。当一个 Edge 设备通过同一接口建立多个隧道时(例如,连接到双 vSmart/vBond 区域或多个远端对等体),这一点至关重要。
- 为每种 color (biz-internet, mpls, lte) 分配不同的 QoS map,以遵循运营商的 DSCP 白名单并防止意外的重标记(例如,在宽带链路上将 AF 类别的流量降级为默认类别)。
使用 DSCP、QoS Map 和拥塞管理进行分类和标记
可信分类始于服务 VPN 边缘:
- 信任边界:如果 LAN 接入域不支持 QoS,则在 WAN Edge 上使用 L7 应用 ID 或 L3/L4 元组进行分类和标记。如果 LAN 支持 QoS,则审计并保留 DSCP,同时将其规范化到 WAN QoS map 中。
- DSCP 策略:EF 用于交互式语音,AF41/42 用于视频,AF31/AF21 用于关键数据,CS3/AF 类别用于信令,CS0/DF 用于尽力而为,CS1 (或 LE) 用于清道夫流量。与运营商接受的值保持一致。
- QoS map:将 DSCP 映射到队列,并可选择在出口重写;维持一对一或多对一的映射,并遵守底层网络的限制。
运维中有用的检查简例:
show sdwan app-route stats sla-class VOICE
show policy qos-queue (vEdge)
show policy-map interface <wan-intf> (IOS XE SD-WAN)
拥塞管理和队列大小调整:
- 从一个为 EF 设置的小型、有上限的 LLQ 开始(例如,整形速率的 10%),并在 LLQ 内部强制执行策略限制,以防止被错误标记的流量超占。
- 使用与业务优先级一致的 WRR/CBWFQ 权重分配剩余带宽(例如,30% 关键数据,20% 视频,35% 尽力而为,5% 清道夫)。
- 考虑在平台支持的情况下为大流量类别启用早期丢弃 (WRED),以避免全局同步;不要在 LLQ 或小型控制队列上启用早期丢弃。
需要注意的故障模式:
- 运营商重标记导致 DSCP 值被压缩,将实时流量放入尽力而为队列;其后果是在高峰期出现抖动和丢包。通过抓包和运营商的 QoS 配置文件进行验证。
- 整形器大小设置不当会导致持续的尾部丢弃;如果 LLQ 未设置上限或视频流量泛滥 LLQ,则会发生 LLQ 饿死。
- 共享接口上缺少 PTQ 会导致“吵闹邻居”覆盖网络消耗带宽,从而降低关键隧道的性能。
应用程序优先级、业务意图和 SLA 强制执行
Cisco SD-WAN 通过 vSmart 控制器上的集中式策略来表达应用程序意图,vSmart 控制器负责管理覆盖网络的控制平面,并将策略分发给 WAN Edge 设备。Application-Aware Routing (AAR) 使用 BFD,根据每条传输链路和每个隧道测得的丢包、延迟和抖动来引导流量。对于 SaaS 优化,Cloud OnRamp 除了使用指向网关站点的 BFD 指标外,还可以结合基于 HTTP 的到应用程序的丢包和延迟指标。
最佳实践:
- 根据业务关键性定义应用程序列表和 SLA 等级:
- VOICE:EF,目标单向延迟 <150 毫秒,抖动 <30 毫秒,丢包率 <1%;仅在满足这些阈值的路径上引导流量。
- VIDEO:AF4x,抖动/丢包要求比语音稍宽松;优先选择高带宽、低丢包的路径。
- CRITICAL DATA:AF3x/AF2x;根据应用程序的要求限制丢包和延迟。
- 使用集中式策略进行应用感知路由 (AAR),优先选择满足各等级 SLA 的路径;当性能下降时,回退到备用路径。
- 将 AAR 与每条传输链路的 QoS 相结合:所选路径必须为该等级预留资源;否则,流量即使满足路径 SLA,也可能在出口处被排队或丢弃。
- 对于通过网关站点访问的 SaaS,需要同时验证:
- 到 SaaS 端点的 HTTP 丢包/延迟。
- 到网关站点的 BFD 丢包/延迟。
- 强制实施端到端的 DSCP 保留;在出口处,仅在底层网络要求时才进行重写,并在远端信任标记时恢复标记。
运维检查:
show sdwan app-route statistics
show sdwan bfd sessions
show application traffic-flow (vManage analytics)
常见陷阱:
- 过严的 SLA 阈值会导致路径抖动;应引入迟滞和保持计时器。
- 所选路径上缺少等级带宽会导致自我拥塞;应将 AAR 的选择与每条传输链路的 QoS 容量对齐。
- 由于加密负载或缺少 NBAR 签名而导致的分类错误(例如,语音被识别为尽力而为);应使用 DSCP 信任或显式的 L4 匹配作为后备方案。
组播基础与 Overlay 组播设计
SD-WAN 上的组播将局域网组播控制平面与底层网络的限制解耦:
- 基础知识:
- 接收方通过 IGMPv2/v3 向第一跳局域网路由器(在服务 VPN 中即为 WAN Edge)发出兴趣信号。
- 建议在服务 VPN 中使用 PIM 稀疏模式 (PIM Sparse Mode);汇聚点 (RP) 负责协调初始的加入请求。
- Overlay 控制平面:
- WAN Edge 路由器通过 OMP 向 vSmart 控制器发起组播服务路由。
- vSmart 控制器扮演组播复制器/RP通告的角色,通过 Overlay 传播 RP 信息,并根据原始 PIM 加入消息中的指定,将所请求组的加入请求转发至源或 PIM-RP。
- vSmart 选择一个或多个 WAN Edge 作为数据平面复制器。源端 Edge 向复制器发送单个副本,然后由复制器复制到接收端 Edge,从而最大限度地减少受限链路上的带宽使用。
- 数据平面:
- 复制通过 Overlay 隧道以单播加密数据包的形式进行;服务 VPN 边界得以保留(组播是基于每个 VPN/VRF 的)。
- VPN 间的组播不是自动的;如果需要,需使用明确的服务链或应用层网关。
设计考量与权衡:
- 将 RP 在逻辑上放置在靠近源或中心数据中心的位置。在 SD-WAN Overlay 中,依赖 vSmart 向接收方通告 RP,以确保一致的加入过程。
- 仅在需要的 VPN 中启用组播;对接收方控制流量 (IGMP) 进行速率限制以保护 CPU。
- 在低带宽链路上,将复制任务集中在具有充足容量的中心站点/复制器上,以避免在接入电路上进行 N×流的复制。
- 验证 MTU 以避免高比特率流产生分片;考虑将视频类别与控制平面队列分开进行整形。
故障模式:
- 局域网上缺少 IGMP 查询器会导致组成员老化和流丢失;确保 WAN Edge 或某个局域网交换机充当查询器。
- RP 不匹配或集中策略中的过滤会破坏加入过程;确认 RP 在整个 Overlay 中的可达性。
- 过多的小包组播控制流量可能被误认为 DDoS 攻击;对控制队列进行速率限制和监控。
- 服务 VPN 边界指定错误会导致无法交付;除非经过专门设计,否则组播不会跨越 VPN。
故障排除要点:
show ip igmp groups
show ip pim neighbor / rp mapping
show sdwan omp services
show sdwan multicast status
show interface | include drops
将队列丢包与应用 KPI 相关联;对于组播,确保在 Edge 上能看到 IGMP 加入请求,OMP 服务路由存在,并且所选的复制器可以通过健康的隧道访问。
实际问题场景
NorthRiver Health 运营着 120 家诊所,每家诊所都有双传输链路(MPLS 和互联网)。用户抱怨语音断断续续、远程医疗视频出现像素化以及等候室的 IPTV 组播时断时续。
方法:
- 建立信任边界并对流量进行分类
- 理由:准确的分类是实现优先级的先决条件。保留来自合规局域网域的 DSCP 值;如果缺少 DSCP,则按应用 (NBAR2) 和 L4 元组进行分类,将语音映射到 EF,视频映射到 AF41,关键的 EMR 映射到 AF31。
- 创建针对特定传输链路的 QoS 映射和整形器
- 理由:MPLS 遵循 AF/EF,而互联网通常不遵循。配置 per-color QoS 映射:在 MPLS 上使用完整的类别集;在互联网上使用合并的类别,但保留 EF 和 AF4。将 MPLS 整形为 CIR 的 95%,将互联网整形为实测的可持续吞吐量,以避免运营商的策略限制器(policer)。
- 在共享的 WAN 接口上启用 per-tunnel QoS
- 理由:多个 Overlay 共享同一物理链路。PTQ 通过分配 per-tunnel 调度器和最小带宽,防止繁忙的站点到云的隧道饿死(starving)站点到数据中心的语音/视频隧道。
- 为语音保留并限制 LLQ;为视频和关键数据加权
- 理由:语音要求有界的延迟/抖动;将 LLQ 限制在 10% 以防止饿死其他队列。为 AF4 视频分配 25–30% 的带宽并设置严格的最大值。为 AF3 EMR 流量分配 25%,其余分配给尽力而为(best effort)和清道夫(scavenger)流量。
- 在 vSmart 上使用 SLA 等级实施集中的 AAR 策略
- 理由:vSmart 分发集中策略,该策略利用 BFD 的丢包/延迟/抖动数据,将语音/视频/EMR 流量放置在满足 SLA 目标的路径上。添加迟滞(hysteresis)以防止路径抖动(flaps)。对于通过网关访问的 SaaS EHR 模块,需包括到 SaaS 的 HTTP 丢包/延迟以及到网关站点的 BFD 测量。
- 通过 vSmart 复制器选择来部署 Overlay 组播
- 理由:高效的 IPTV 分发需要受控的复制。在 IPTV VPN 中启用组播,配置 PIM-SM 和 RP,并让 vSmart 通告 RP 并选择一个数据中心 Edge 作为复制器,以保护低速诊所线路免受 N 路复制的影响。
- 通过遥测进行验证和迭代
- 理由:在负载下确认行为。使用:
show sdwan app-route statistics来验证 SLA 路径选择。show policy qos-queue/show policy-map interface来评估队列利用率和丢包情况。show ip igmp groups和show sdwan omp services来查看组播加入和业务路由。 调整整形速率和队列权重,以消除语音/视频队列的尾部丢包,同时为关键数据保持可接受的延迟。
- 防护措施与异常处理
- 理由:防止复发并检测性能退化。在不受信任的局域网段上应用入口策略限制器(policer)以抑制错误标记的流量,对 IGMP 进行速率限制以保护控制平面 CPU,并针对 AAR SLA 违规和队列丢包计数器设置告警,以触发主动修复。
这一系列步骤确保 NorthRiver Health 将业务意图转化为一致的、传输感知的 QoS 和可靠的组播交付。语音获得严格、有界的处理;视频和 EMR 获得优先、加权的带宽;路径根据实时的 SLA 测量进行选择;组播被高效复制,而不会压垮分支机构的链路。
← 安全、分段和服务链 · 所有领域 · 云、SaaS 和多云集成 →
练习这些题目 → · 在 ExamRoll.io 上限时练习 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通过考试 →