Amazon AIF-C01: AIのセキュリティとプライバシー — 学習ガイド

こちらの一部です: AWS AI Practitioner AIF-C01 — 学習ガイド. 検証済みの解答で練習: Amazon試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.

データ保護とアクセス制御

トレーニングデータと推論データの保護は、最小権限のアクセスから始まります。Amazon SageMaker、AWS Lambda、Amazon Bedrock には、きめ細かなポリシーとリソースレベルの制限を持つ IAM ロールを使用します。認証情報は AWS Secrets Manager に保存し、コードにシークレットを埋め込むことは避けてください。Amazon Macie と AWS Glue Data Catalog を使用してデータを分類し、承認されたデータセット(およびその承認されたサブセット)のみがトレーニングパイプラインに入るようにします。機密性の高い属性については、保存やインデックス作成の前に Comprehend の PII 検出と墨消しまたはトークン化を適用します。下流のワークフローで連携が必要な場合は、PII を可逆的なトークンに置き換えることを検討してください。S3 バケットポリシーを適用し、パブリックアクセスをブロックし、機密情報を含むオブジェクトには SSE-KMS 暗号化を要求します。KMS キーポリシーとキーのローテーションを使用して、誰がトレーニングアーティファクトやモデルのチェックポイントを復号できるかを制御します。実務者が陥りやすい罠には、広範な SageMaker 実行ロールを付与すること、S3 プレフィックスへのアクセス制限を忘れること、KMS キーや IAM 認証情報をローテーションしないことなどがあります。意思決定の基準では、データの機密性、入力を墨消しまたは合成する能力、そしてモデルが生の PII に直接アクセスすることが厳密に必要かどうかを比較検討する必要があります。モデルの有用性のために PII を保持する必要がある場合は、オープンなストレージではなく、管理された監査証跡を持つ分離された処理を選択することが望ましいです。

プライベート接続、暗号化、キー管理

ネットワークの分離と暗号化制御は、本番環境の ML にとって基本です。VPC エンドポイントと AWS PrivateLink を使用して、SageMaker のトレーニングとホスティングを VPC 内にデプロイし、データがパブリックインターネットを経由しないようにします。S3、Secrets Manager、Bedrock(サポートされている場合)に対して VPC インターフェイスエンドポイントを設定し、エンドポイントポリシーを適用して、承認されたプリンシパルとプレフィックスにトラフィックを制限します。転送中のすべてのデータを TLS で暗号化し、保管中のデータは SSE-KMS(S3)とトレーニングインスタンス用の EBS 暗号化で暗号化します。キーの一元管理には AWS KMS を使用します。ディザスタリカバリやクロスリージョンでの運用にはマルチリージョンキーを検討し、KMS キーポリシーを使用して復号(Decrypt)権限を制限します。規制の厳しいワークロードには、AWS Nitro Enclaves を使用して、ホストメモリを公開することなく、暗号化操作とモデルアーティファクトの構成証明を分離します。よくある罠には、エンドポイントポリシーを使用する際に S3 のパブリックアクセスをブロックし忘れること、EC2 メタデータを過度に寛容なままにすること、明示的なアクセスコントロールなしで顧客の KMS キーを使用することなどがあります。AWS 側での復号を防ぐ必要がある場合はクライアント側の暗号化を選択し、きめ細かなアクセス監査性と AWS サービスとの統合が必要な場合は SSE-KMS を選択します。

ロギング、監査、ガバナンス、説明可能性

エンドツーエンドの可観測性を維持します。SageMaker、Bedrock、KMS、S3 にわたる API レベルの監査のために CloudTrail を有効にし、ログを CloudWatch と、保持およびコンプライアンスのための一元化された不変のアーカイブにストリーミングします。AWS Config を使用してリソース設定を記録し、ドリフトを検出します。ML 固有の来歴とガバナンスには、SageMaker Model Registry と SageMaker Experiments を使用して、モデルのメタデータ、バージョニング、来歴、デプロイ履歴をキャプチャします。SageMaker Model Monitor を統合して、コンセプトドリフト、データスキュー、予測品質の低下を検出します。バイアス検出と説明可能性のためには、SageMaker Clarify を使用してパイプラインを計装し、データセットのバイアス指標、SHAP や統合勾配法による特徴量のアトリビューションを取得し、トレーニングデータ、評価メトリクス、既知の制限を文書化したモデルカードを作成します。実務者が陥りやすい罠には、PII を平文で CloudWatch にロギングすること、モデルのバージョンと推論メトリクスを関連付けないこと、ドリフトに対する自動アラートがないことなどがあります。意思決定の基準では、保持期間とコストのバランスを取り、説明可能性のアウトプットが人間が判読可能であり、監査可能性や、該当する場合には臨床医/規制当局によるレビューのためにモデルのメタデータと共に保存されることを要求する必要があります。

プライバシーを保護するトレーニング、RAG、エンベディング、およびBedrockのセキュリティに関する考慮事項

モデルが機密性の高いコーパスを扱ったり、ユーザー固有のコンテンツを提供したりする場合は、プライバシー保護技術を適用します。トレーニング中に差分プライバシー (DP) メカニズムを導入すると、個々の貢献度を制限できます。また、連合学習パターンでは、モデルの更新を共有しつつ、生のレコードをオンプレミスに保持できます。検索拡張生成 (RAG) では、生のPIIをベクトルストアにインデックス化することを避け、PIIの墨消しで前処理を行うか、ポインタを保存して検索時にオンザフライで墨消しを適用します。エンベディングは機密情報を漏洩する可能性があるため、ベクトルストアを他のデータベースと同様に扱います。つまり、保管時の暗号化 (S3/EBS)、IAMとVPCによるアクセス制限を行い、キーのトークン化やクエリ時フィルターの使用を検討します。Bedrockは、有害な入出力を検出・ブロックするためのガードレールとモデレーションツールを提供し、IAMおよびVPCコントロールと統合されています。ガードレールは多層防御の一環として強制しますが、唯一のコントロールとして依存してはいけません。よくある落とし穴には、オープンなエンドポイント経由でベクトルDBを公開すること、RAGインデックスの更新を怠り、古くなったり偏ったりした出力を引き起こすこと、プロンプトチューニングでハルシネーションがなくなると想定することなどがあります。Bedrockでの同期的なファインチューニングと、ランタイムでのプロンプトエンジニアリングのどちらを選択するかは、レイテンシー、データレジデンシー、モデルガバナンスの要件に基づいて決定します。

実践的な問題:ユースケースシナリオ

シナリオ:ストリーミングプロバイダーであるHorizon Mediaは、アシスタント機能のためにSageMakerベースのAIパイプラインとAmazon Bedrockを運用しています。視聴ログとパーソナライゼーションデータはeu‑west‑1の暗号化されたS3バケットに保存され、日々のコンテンツメタデータはRAGのためにOpenSearchベクトルストアにインデックス化されています。

課題:エンベディングへのPII漏洩を防ぎ、リージョンに限定したデータ処理を保証し、監査可能なモデルリネージとドリフトアラートを提供しながら、パーソナライズされた推奨事項とBedrockを利用した会話型アシスタントを提供する必要があります。

推奨アプローチ:

  1. AWS PrivateLinkとVPCインターフェイスエンドポイントを使用してVPC内でSageMakerトレーニングとBedrockアクセスを設定し、S3エンドポイントポリシーを適用してバケットプレフィックスを制限します。
  2. Amazon MacieとComprehend PIIを使用して、エンベディングの前にPIIを検出・墨消しします。墨消しされたテキストまたは可逆的なトークンのみを、SSE-KMSで暗号化してベクトルストアに保存します。
  3. SageMaker Model Registryにモデルとアーティファクトを登録し、SageMaker Experimentsで実験を追跡します。データと予測のドリフトにはModel Monitorを、監査ログにはCloudTrail/CloudWatchを有効にします。
  4. コンテンツモデレーションのためにBedrockのガードレールを適用し、リージョンレジデンシーのためにIAMとKMSのキーポリシーを強制し、非常に機密性の高いサンプルでのトレーニングには差分プライバシーや合成データの使用を検討します。

根拠:ネットワークの分離、一元化されたキー管理、エンベディング前のPII墨消し、そして包括的なリネージとモニタリングは、本番MLシステムにおける情報漏洩を最小限に抑え、データレジデンシー要件を満たし、監査可能なガバナンスを維持するための、実践者のベストプラクティスに沿ったものです。


責任あるAIとガバナンス · すべてのドメイン · MLデータエンジニアリング

これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

試験に合格する →

Amazonを閲覧 →

Related guides

オールインワンアクセス

1つのサブスクリプション。すべての試験。

すべてのプランで、無制限の回答検索、模擬試験、AI解説、および完全なリソースライブラリが利用可能 — 20以上の言語に対応。

月額
24.87
Just €0.83/day
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

ベストバリュー
12ヶ月
179.87
Just €0.49/daySave 40%
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

✓ 無料プランが含まれています · ✓ いつでもキャンセル可能 · ✓ すべてのプランで製品の全機能が利用可能