Microsoft AZ-305: モニタリング、コスト最適化、運用 — 学習ガイド
こちらの一部です: Microsoft Azure Solutions Architect Expert AZ-305 — 学習ガイド. 検証済みの解答で練習: Microsoft試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.
概要
堅牢な Azure の監視・運用設計は、単一のテレメトリファブリック、アクションにつながるアラート、統制されたコスト、そしてフリート全体でのコンプライアンスレポートを確立します。このソリューションは、Azure Monitor のメトリックとログ、Log Analytics と Kusto Query Language (KQL)、アプリケーションテレメトリのための Application Insights、そして Azure Policy、Azure Resource Graph、Advisor を通じた運用ガバナンスに及びます。コスト管理は Azure Cost Management によって強化され、プラットフォームの信頼性と変更の認識は Azure Service Health に依存します。Azure Automation は、反復可能な修復と更新のオーケストレーションによって、このループを完結させます。Workbooks は、これらのサービス全体のインサイトを統合し、運用の可視性を提供します。
Azure Monitor、Application Insights、Workbooks によるオブザーバビリティ
Azure Monitor は、プラットフォームとワークロード全体のテレメトリを収集し、時系列のメトリックとログデータを保存します。メトリックは軽量でほぼリアルタイムの値であり、しきい値や SLO の追跡(例:CPU、HTTP 5xx レート)に適しています。ログは、構造化されクエリ可能なテレメトリをキャプチャし、相関分析や根本原因分析をサポートします。迅速な兆候検出のためにはメトリックアラートを、KQL を使用したよりリッチな条件ベースの検出のためにはログアラートを設計します。
アクション グループは、検出と応答を分離します。メール/SMS/音声、プッシュ通知、セキュア Webhook、ITSM コネクタ、Azure Functions、Logic Apps、Automation Runbook を関連付けます。本番環境と非本番環境で別々のアクション グループを使用し、計画メンテナンス中は抑制スケジュールを適用します。アラートは、一貫したペイロードでインシデント管理システムにルーティングし、リソースのコンテキストと Runbook のリンクを含めます。
完全な可視性を実現するためには、診断設定が必須です。リソース、リソース グループ、サブスクリプションの各スコープで有効にし、メトリックとリソースログ(例:Activity、Administrative、Policy、Security、NetworkSecurityGroupFlowEvent)を、クエリ用の Log Analytics、コールドリテンション用のストレージ、SIEM へのストリーミング用の Event Hubs にエクスポートします。デプロイやポリシー評価に関するレポートを作成し、月次の変更レポートを構築できるように、常にアクティビティログにサブスクリプションレベルの診断設定を構成してください。
Application Insights は、アプリケーションの深いオブザーバビリティを追加します。SDK または OpenTelemetry を使用して、分散トレース、依存関係、リクエスト、例外、カスタムイベントをインストルメント化します。コードの変更を最小限に抑えるため、サポートされている場合は Azure Monitor エージェントを介して App Services、Functions、AKS、VM/VMSS で自動インストルメンテーションを使用します。可用性テストは、複数のリージョンからのユーザートラフィックをシミュレートします。頻度、テスト場所、SSL/HTTP チェック、成功基準を構成します。スマート検出は、組み込みの分析を使用して、急な障害の急増やパフォーマンスの低下などの異常なパターンを警告します。サンプリングは、統計的な忠実度を維持しながらインジェストとコストを制御します。動的なトラフィックにはアダプティブサンプリングを、決定論的な分析には固定レートサンプリングを適用し、コンプライアンスが完全なキャプチャを要求する重要なトランザクションはサンプリングから除外します。
Azure Monitor Workbooks は、メトリック、ログ、コストのシグナルを 1 つのアーティファクトに統合する、インタラクティブでパラメータ化されたダッシュボードを提供します。サブスクリプション、リージョン、環境、時間範囲のパラメータを使用して、ランディングゾーン間での再利用性を可能にします。視覚化と説明文を組み合わせて、標準化された運用プレイブックやページ上の運用手順書を作成します。Workbook はリソースグループに保存し、RBAC を適用してアクセスを制御し、Infrastructure-as-Code デプロイメントのために JSON をテンプレート化します。
大規模な Log Analytics と KQL
Log Analytics ワークスペースは、Azure Monitor Logs の中央集約ポイントです。データ所在地要件に応じてリージョンごとに一元化されたワークスペースを選択するか、厳格なデータ主権や RBAC のセグメンテーションが必要な場合はランディングゾーンごとに 1 つのフェデレーション設計を選択します。大企業の場合は、ハブ(共有ワークスペース)と、機密性の高いまたは大量のデータドメイン用の選択的なスポークワークスペースを優先します。テーブルプランをデータの価値に合わせます。価値の高いセキュリティおよび運用データには Analytics テーブルを、検索専用アクセスで冗長な低価値ログには Basic Logs を、検索ジョブで取得する長期的な低コスト保持には Archive を使用します。
データ収集ルール (DCR) は、Azure Monitor エージェント (AMA) が収集するものを定義します。これには、syslog/event logs、パフォーマンスカウンター、Windows イベントチャネル、カスタムテキストログが含まれます。OS の種類と役割ごとに個別の DCR を使用し、VMSS、スケールセット、ハイブリッド用の Azure Arc を介してスコープを管理します。ガバナンスと一貫性のために、レガシーなインジェスト API よりも DCR ベースのカスタムテーブルを優先します。
保持期間は、調査期間とコストのバランスを取る必要があります。日々の運用で使用されるホットデータ(例:30~90日)にはテーブルごとの保持期間を適用し、コンプライアンスや脅威ハンティングのためにロングテールデータ(例:6~24ヶ月)をアーカイブします。インジェスト量、ノイズの多い上位テーブルを監視し、DCR でサンプリングやフィルタリングを適用して冗長なログの収集を避けます。予測可能な場合は、コミットメントレベルを使用してインジェストコストを最適化します。
KQL は運用の共通言語です。フィルター (where)、変換 (extend, project)、時間ビニング (bin/1m)、集計 (summarize by)、結合 (inner/leftouter)、レンダリング (render timechart) をマスターします。スロットリング制御付きのログアラート用のスケジュールされたクエリ、高カーディナリティのアラート用の split-by ディメンション、ベースライン化されたアラート用の動的しきい値を構築します。マテリアライズドビューとクエリパフォーマンスのチューニング(例:未使用の列を早期に project-away する、時間ウィンドウの絞り込み)により、コスト効率の高いクエリを保証します。ARM のデプロイメントレポートについては、AzureActivity または Log Analytics にエクスポートされた Azure Resource Graph の変更履歴をクエリし、ガバナンス分析のために Policy イベントと相関させます。
コスト、正常性、Advisor、Resource Graph、および Policy コンプライアンス
Azure Cost Management は、プロアクティブなガバナンスを可能にします。サブスクリプション、リソースグループ、または管理グループをスコープとする予算は、累積的なしきい値 (例: 50%、80%、100%) でアラートをトリガーします。予算アラートをアクション グループにリンクして、重要でないリソースにタグを付けたり、スケールダウンしたり、さらには隔離したりする Logic Apps や Functions を実行します。コスト分析を使用して、償却ビューを構築し、タグ (コストセンター、所有者) でグループ化し、サービスまたはリージョンごとの異常を特定します。予約と Savings Plan の推奨事項は、VM、SQL、Cosmos DB などのコミットメントの機会を提示します。購入スコープ (単一サブスクリプションまたは共有)、期間 (1 年または 3 年)、およびカバレッジの一致 (インスタンス サイズの柔軟性、Azure Hybrid Benefit) を評価します。
Azure Advisor は、サブスクリプションとリソースを継続的に評価し、コスト (適切なサイズ設定、アイドル状態のリソース、予約)、セキュリティ (Defender for Cloud 経由)、信頼性 (ゾーン冗長、バックアップ/復元体制)、パフォーマンス (スケーリング、SKU ガイダンス)、およびオペレーショナル エクセレンス (タグの正常性、ポリシーの採用) にわたる優先順位付けされた推奨事項を生成します。Advisor スコアを追跡して、体制を定量化し、エンジニアリングのバックログを推進します。
Azure Service Health は、プラットフォームの状態を運用レベルで把握できるようにします。サービスの問題ではライブインシデントを把握し、計画メンテナンスでは今後のプラットフォームの変更を伝え、正常性に関するアドバイザリには非推奨事項やベストプラクティスが含まれます。サブスクリプション、リージョン、サービスでフィルタリングし、アクション グループを使用してサービス正常性アラートを構成します。Service Health を Resource Health と組み合わせることで、プラットフォームの障害とワークロードの問題を区別し、正確なインシデントのトリアージを行います。
Azure Resource Graph は、KQL に似た構文を使用した低待機時間かつ大規模なクエリにより、テナント全体のインベントリとコンプライアンス分析を提供します。何千ものサブスクリプションにまたがってクエリを実行し、リソースのドリフト、タグ付けされていない資産、安全でない構成、またはサポートされていない SKU を列挙します。Resource Graph の結果を Policy コンプライアンスリソースと結合して、例外や最終評価時刻を含む管理グループのロールアップを作成します。変更追跡 (利用可能な場合) を使用して、フォレンジック分析のためにプロパティの差分をキャプチャします。
Azure Policy は、ガードレールを適用し、コンプライアンスを測定します。管理グループ、サブスクリプション、またはリソースグループのスコープでポリシーとイニシアチブを割り当てます。コンプライアンスの状態 (準拠、非準拠、競合、エラー、除外) を理解します。コンプライアンスメトリクスを歪めることなくリスクの受容をモデル化するために、正当な理由と有効期限付きの免除を使用し、必要最小限のスコープのみを除外します。deployIfNotExists および modify 効果については、最小権限のアクセス許可を持つマネージド ID によってサポートされる修復タスクを構成します。コンプライアンスダッシュボードと Activity Log で修復ジョブの状態、失敗、操作を監視し、永続的な非準拠に対してアラートを設定します。Policy の評価を Resource Graph および Workbooks と組み合わせて、エグゼクティブレベルのガバナンスダッシュボードを作成します。
自動化とパッチ管理
Azure Automationは、反復可能なタスクをオーケストレーションします。PowerShellまたはPythonでランブックを作成し、スケジュール、Webhook、イベントベースのトリガー、またはアラートによってトリガーします。Hybrid Runbook Workerを使用して、プライベートネットワークや他のクラウド内のリソースの近くで自動化を実行し、Azure Arcによって管理します。標準化されたモジュールとエラー処理を実装し、シークレットはKey Vaultに保存します。
Update Managementは、OSの最新性を保証します。組織は、Azure Automation Update Management(レガシー)またはAzure Update Managerを使用して、評価、承認、メンテナンス期間、動的グループを含む大規模なパッチオーケストレーションを行うことができます。アラートを統合して、失敗したデプロイを検出し、サブスクリプション、OS、および重要度ごとのコンプライアンスレポートを生成します。構成ドリフトに対しては、Azure Automation State Configuration (DSC) が宣言的な構成を適用し、コンプライアンスを追跡し、逸脱を修正します。構成をコードとしてモデル化し、バージョン管理を行い、環境を通じてステージングします。
アラートを統合して、自動修復シナリオのためにランブックをトリガーします。例えば、CPU飽和時のスケールアウト、ハートビート喪失時の障害サービスの再起動、Policyによって検出された非準拠リソースの隔離などです。ITSMコネクタを介したインシデント作成でループを閉じ、ランブックに埋め込まれたLog Analyticsクエリを通じて、修復前後の証跡を含めます。
実践的な問題シナリオ
Tailwind Tradersは、6つのサブスクリプションにまたがり、AKS、App Service、Azure SQL Database上で多地域eコマースプラットフォームを運営しています。リーダーシップは、99.9%のサービス可用性、月次のデプロイ変更レポート、コミットメントによる20%のコスト削減、およびタグ付けとネットワークポリシーに関する監査可能なコンプライアンスを義務付けています。
- 一元的なテレメトリの確立
- データ所在地とRBACの要件を満たすために、2つのLog Analyticsワークスペース(米国、EU)を作成します。サブスクリプション、リソースグループ、およびすべての重要なリソースで診断設定を構成し、メトリクス/リソースログとActivity Logをリージョンのワークスペースに送信します。選択理由:リージョンごとのデュアルワークスペースモデルは、国境を越えたデータ移動なしに、主権、パフォーマンス、および一元的な分析のバランスを取るため。
- アプリケーションのインストルメンテーション
- サポートされている場合はApp ServiceとAKSサイドカーに自動インストルメンテーションでApplication Insightsを有効にし、Goで書かれたサービスにはOpenTelemetryを使用します。アダプティブサンプリングと分散トレースを構成します。選択理由:最小限のコード変更と制御されたインジェストコストで、リクエスト、依存関係、および例外の詳細な可視性を得るため。
- 実用的なアラート
- SLOの兆候(p95レイテンシ、5xxレート、キューの深さ)に対するメトリックアラートと、エラーの急増やカスタムKQL検出に対するログアラートを実装します。役割ベースのアクショングループにルーティングします:運用オンコール(PagerDuty + メール)、SRE自動化(Logic App)、およびリーダーシップ(メールダイジェスト)。これにより、検出と対応を分離し、目的に合わせた信頼性の高いインシデントルーティングを可能にします。
- 可用性とユーザーエクスペリエンス
- ストアフロントとチェックアウトAPIに対して、厳格なSSLとコンテンツアサーションを備えた多地域のApplication Insights可用性テストを構成します。選択理由:内部メトリクスとは独立した、外部の顧客に影響を与える問題を検出するため。
- 運用ダッシュボード
- パラメータ(サブスクリプション、リージョン、環境)を持つAzure Monitor Workbooksを構築し、メトリクス、KQLチャート、およびトレースやログへのドリルスルーリンクを組み合わせます。ワークブックJSONのIaCデプロイを採用します。Workbooksは、NOCとSREのための共有されたインタラクティブなページ上のランブックを提供します。
- コストガバナンス
- サブスクリプションごと、および部門タグごとに予算を設定し、50/80/100%でアラートを発行し、Logic Appをトリガーしてオーナーに通知し、ITSMチケットを開きます。Cost Analysisの償却ビューを使用し、予約と節約プランの推奨を有効にします。安定したSQL MIワークロードには3年間の予約を、変動の激しいコンピューティングには節約プランを購入します。これにより、自動化されたガードレールにより、20%のコスト目標を直接達成します。
- AdvisorとService Health
- Azure Advisorを週次でレビューし、適切なサイズ設定とゾーン冗長性のためのバックログ項目を作成します。使用中のリージョンとサービスに対してService Healthアラートを構成し、オンコールのアクショングループに流します。これらは、継続的な改善とプラットフォームインシデントの迅速な認識を保証します。
- コンプライアンスとフリートレポート
- 必要なタグを強制し、NIC上のパブリックIPを禁止し、診断設定を要求するAzure Policyイニシアチブを割り当てます。承認された例外には有効期限付きの除外を使用します。マネージドIDで修復タスクを構成します。Azure Resource Graphを使用して、すべてのサブスクリプションにわたるポリシーコンプライアンスとタグ付けされていないアセットをクエリし、結果をWorkbooksに表示して監査に利用します。これにより、測定可能なコンプライアンスを備えた、監査可能な自動化されたガバナンスを構築します。
- デプロイ変更レポート
- Log AnalyticsでAzureActivityをクエリしてARMデプロイを検索し、ポリシー評価ログと相関させて月次レポートを作成し、Logic App経由でメール送信します。これにより、カスタムエージェントなしで、デプロイイベントの信頼できる情報源としてActivity Logを活用します。
- 自動修復とパッチ適用
- ハートビートアラートが発火した際にAKS APIを介して不健康なポッドを再起動するため、またKey VaultからシークレットをローテーションするためにAzure Automationランブックを使用します。メンテナンス期間と動的グループを持つAzure Update Managerを有効にして、パッチコンプライアンスを確保します。Hybrid Runbook Workerは、ネットワークにバインドされたタスクを安全に実行します。これにより、検出から解決までのループを閉じ、フリートを最新の状態に保ちます。
選択された各サービスは、カスタム開発を最小限に抑え、サブスクリプション全体でスケールし、ガバナンス、コスト、信頼性の目標に沿っており、同時に明確な運用上のオーナーシップを維持します。
← インテグレーションとメッセージングアーキテクチャ · すべてのドメイン · 移行とモダナイゼーション →
これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
試験に合格する →