Amazon MLS-C01: セキュリティ、プライバシーとコンプライアンス — 学習ガイド
こちらの一部です: AWS Machine Learning Specialty MLS-C01 — 学習ガイド. 検証済みの解答で練習: Amazon試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.
データとモデルの暗号化:階層的な制御と一般的な落とし穴
保管中および転送中のデータの暗号化は、MLパイプラインにおける最初の防衛線です。S3のオブジェクトについては、監査性と詳細なキー制御が必要な場合は、KMSによるサーバーサイド暗号化(SSE-KMS)を推奨します。リクエストごとのKMSロギングが不要なバケットでは、SSE-S3でも問題ありません。SageMakerのモデルアーティファクト、トレーニングおよびホスティングインスタンスにアタッチされたEBSボリューム、EFS/FSxボリュームも暗号化する必要があります。SageMakerは、モデルアーティファクトとボリュームの暗号化にカスタマー管理型のCMKを使用するよう設定できます。大規模なデータセットやアカウント間での共有には、KMSの呼び出しが繰り返し発生するのを避けるため、エンベロープ暗号化(KMSでデータキーを生成し、AWS Encryption SDKやクライアントサイドのライブラリを使用)を利用します。転送中の保護には、すべてのS3およびサービスエンドポイントでTLSが必要です。プライベートネットワーキングを使用する場合でも、PrivateLinkとVPCエンドポイントは通信経路上でTLSを使用します。よくある落とし穴は、CMKのキーポリシーの更新を忘れることです。SageMakerのサービスプリンシパルと実行ロールに復号/生成の権限を付与する必要があり、IAMだけでは不十分です。決定基準:運用オーバーヘッドを低く抑えたい場合はAWSマネージドCMKを選択します。キーローテーションポリシー、アカウント間の制御、またはキー管理者の分離が必要な場合は、カスタマー管理型のCMKを選択します。パフォーマンスとコストを考慮しましょう。エンベロープ暗号化は、高スループットのワークロードにおけるKMS APIの使用量を削減します。
キー管理、CMKの設計、および運用管理
MLワークロード向けのKMS戦略を設計する際は、セキュリティ、アクセス境界、および運用のバランスを取ります。きめ細かなポリシー制御、グラント、アカウントをまたいだ利用、およびCloudTrailでのGenerateDataKey/Decryptオペレーションの監査証跡が必要な場合は、カスタマー管理型のCMKを使用します。HSMに裏付けられたキーやFIPS要件には、CloudHSMをバックエンドとするKMSカスタムキーストアを検討してください。キーポリシーが権威を持ちます。これをIAMポリシーで補完し、kms:ViaService条件を使用して、特定のAWSサービス(例:sagemaker.amazonaws.comやs3.amazonaws.com経由で呼び出された場合にのみ復号を許可する)に利用を限定します。トレーニングジョブで使用される一時的なロールに復号/暗号化を委任する短期的な権限として、KMSグラントを使用します。適切な場合は対称CMKの自動キーローテーションを有効にし、地理的に冗長なモデルのレプリケーションのためにマルチリージョンキーを作成します。一般的な落とし穴には、IAMポリシーのみに依存すること(CMKのキーポリシーを更新せずに)、そしてマネージドサービスがCMKを使用できるようにサービスプリンシパル(sagemaker.amazonaws.comやelasticblockstore.amazonaws.comなど)を含めるのを忘れることがあります。決定基準は、管理上の分離(ビジネスユニットや機密性クラスごとに異なるCMKを使用)と、KMSのクォータや運用上の複雑さを比較検討する必要があります。最小権限の原則を適用し、CloudTrailでGenerateDataKeyイベントを監査してください。
SageMakerとS3のためのプライベートネットワーキングとVPCエンドポイント
データやイメージをパブリックインターネットから隔離するには、SageMaker Studio、ノートブックインスタンス、トレーニング/ホスティングジョブをVPC内に配置し、VPCエンドポイントを使用します。S3ゲートウェイエンドポイントを使用すると、サブネットからバケットオブジェクトへ直接プライベートにアクセスできます。制限的なエンドポイントポリシーをアタッチして、特定のバケットやプレフィックスへのアクセスを限定します。SageMaker API、ランタイム呼び出し、およびECRにはインターフェイスエンドポイント(PrivateLink)が必要です。必要に応じて、com.amazonaws.
IAM、プライベートイメージアクセス、監査ログ、およびデータ漏洩対策
最小権限のIAMロールが中心となります。SageMaker実行ロールには、ジョブに必要なS3、ECR、KMS、CloudWatchの権限のみを付与する必要があり、多くの場合、リソースARNにスコープを限定し、aws:SourceArn/aws:SourceAccount/aws:SourceVpc条件で制約します。プライベートコンテナイメージについては、プライベートECRリポジトリでホストし、リポジトリポリシーで特定のIAMプリンシパルまたは組織アカウントにpullを制限します。イメージをイミュータブル(変更不可)としてマークし、イメージスキャンを有効にします。監査ログは包括的です。機密性の高いバケットでのGetObject/PutObjectに対してCloudTrailの管理イベントとS3データイベントを有効にし、ログを専用の暗号化されたクロスアカウントのログ記録用バケットに転送し、CloudWatch LogsとVPCフローログを有効にして、異常な下り(egress)通信を検出します。Amazon Macieを使用してS3内のPII(個人を特定できる情報)を検出し、GuardDutyを使用して通常とは異なるデータアクセスパターンを検出します。データ漏洩を防ぐには、承認されたVPCエンドポイントまたはVPC CIDR以外からのリクエストをDenyするS3バケットポリシー、下り(egress)フィルタリングのためのセキュリティグループ/NACLやAWS Network Firewallなどのネットワーク制御、そして影響範囲(blast radius)を縮小するためのIAMアクセス許可境界/SCPを組み合わせます。よくある落とし穴には、VpcConfigだけで全ての下り(outbound)通信が防げると想定してしまうこと(NAT/インターネットゲートウェイとエンドポイントを制御する必要があります)、そしてモデルアーティファクトを必要とする実際のランタイムプリンシパルにKMSの復号権限を付与し忘れることなどがあります。
実践的な問題:ユースケースシナリオ
シナリオ: MetroDeliveryは、S3にアーティファクトとして保存された都市ごとのXGBoostモデルを運用し、SageMaker Studioでモデルをトレーニングしています。要件として、トレーニングと推論がパブリックインターネットを経由しないこと、モデルアーティファクトが顧客管理のキーで暗号化されること、コンテナイメージがプライベートにホストされることが求められています。
課題: トレーニングとホスティングにおけるエンドツーエンドの暗号化とプライベートネットワーキングを確保し、承認されたロールにイメージのpullを制限し、不正なデータ移動を検出・防止すること。
推奨アプローチ:
- KMSで顧客管理の対称CMKを作成し、キーポリシーでMetroDeliveryの管理者、sagemaker.amazonaws.com、およびSageMaker実行ロールにDecrypt/GenerateDataKey権限を付与し、自動ローテーションを有効にします。
- そのCMKを使用してS3バケットをSSE-KMSで暗号化します。S3バケットポリシーを使用してパブリックアクセスをブロックし、PutObject/GetObjectに対してaws:SourceVpcまたはaws:ViaAWSService条件を要求します。
- VPCを設定します。NATなしのプライベートサブネットをデプロイし、モデルバケットのプレフィックスに限定されたエンドポイントポリシーを持つS3用のゲートウェイVPCエンドポイントを作成し、sagemaker、sagemaker-runtime、ecr.api、ecr.dkr、sts、およびcloudwatchlogs用のインターフェイスエンドポイントをデプロイします。
- プライベートECRでイメージをホストし、リポジトリポリシーでプリンシパルをSageMaker実行ロールに制限します。イメージのイミュータビリティ(変更不可性)とスキャンを有効にします。CloudTrail(管理イベント + S3データイベント)、機密データ検出のためのMacie、および異常アクティビティのためのGuardDutyを有効にします。ログは暗号化されたクロスアカウントの監査用バケットに送信します。
理論的根拠: 顧客管理のCMKを使用することで、モデルアーティファクトに対する制御と監査性が提供されます。VPCエンドポイントと制限的なエンドポイント/リポジトリポリシーにより、トラフィックはAWSネットワーク上に留まり、パブリックな下り通信が防止されます。ログ記録とデータ分類サービスを組み合わせることで、データ漏洩を検出し抑止し、最小権限のIAMによって攻撃範囲が限定されます。
← デプロイ、推論とサービング(MLの実装と運用) · すべてのドメイン · MLOps、モニタリング、ラベリングとモデルガバナンス →
これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
試験に合格する →