Amazon AIF-C01: MLデータエンジニアリング — 学習ガイド
こちらの一部です: AWS AI Practitioner AIF-C01 — 学習ガイド. 検証済みの解答で練習: Amazon試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.
データ収集、ラベリング、バージョニング、ガバナンス
代表性があり、監査可能なデータセットを収集することは、すべてのMLの基礎となるステップです。Amazon S3を中心的な高耐久性ストアとして使用し、S3バージョニングとオブジェクトロックを有効にして、生の入力を保持し、来歴をキャプチャします。構造化された取り込みとカタログ化のために、AWS Glueデータカタログにデータセットを登録し、Lake Formationを使用してきめ細かなアクセス制御を適用します。人手によるラベリングが必要な場合、Amazon SageMaker Ground Truthは、ラベラー間の一致度と信頼度のメタデータを作成しながらラベリングコストを削減する、組み込みのワークフロー、アノテーションUI、およびアクティブラーニングループを提供します。よくある落とし穴には、偏った、または代表性のないサンプルの収集、リネージとラベリングルールの記録の失敗、不十分なラベル品質チェックなどがあります。これらは、ラベリング監査の保存、サブセットのブラインド再ラベリング、ラベル統合ヒューリスティックの使用によって軽減します。プライバシーとコンプライアンスに関する決定がアーキテクチャを決定します。KMSで管理されたCMKによるS3サーバーサイド暗号化を使用し、IAMポリシーとVPCエンドポイント(AWS PrivateLink)でアクセスを制限し、モデルトレーニングのためにデータを共有する前にAmazon ComprehendでPIIの検出と墨塗りを行います。長期間実行されるプログラムでは、データセットのスナップショットをキャプチャし、データセットIDでタグ付けし、Amazon SageMaker ExperimentsやDVCのような外部ツールで実験を追跡することで、再現可能なトレーニングと規制報告を可能にします。
前処理、特徴量エンジニアリング、EDA
変換と特徴量が、モデルの汎化能力を決定します。AWS GlueまたはAmazon SageMaker Data Wranglerを使用してデータのプロファイリング、クレンジング、正規化を行い、Amazon QuickSightまたはAmazon SageMaker StudioでホストされたJupyterノートブックで反復的な探索的データ分析(EDA)を実行します。本番環境の特徴量管理には、Amazon SageMaker Feature Storeを採用して、オフラインとオンラインの特徴量計算の一貫性を確保し、トレーニング/サービングスキューを回避します。生の特徴量と派生した特徴量を別々に保存し、特徴量作成ロジックを記録します。時系列およびストリーミングパイプラインでは、Amazon KinesisまたはAWS GlueストリーミングETLを活用して、低レイテンシーで特徴量を更新する必要があります。典型的な落とし穴には、将来の情報がトレーニングに漏洩するデータリーケージ、欠損値の不適切な処理、オフラインのトレーニング特徴量とオンラインのサービング特徴量の不一致などがあります。パイプラインを設計する際の決定基準は、鮮度とコストの兼ね合いにかかっています。大規模な履歴の再計算にはバッチETLを、ほぼリアルタイムのパーソナライゼーションにはストリーミングを、低レイテンシーのオンライン特徴量が必要な場合はハイブリッドアーキテクチャを選択します。GlueまたはSageMaker Processingジョブの一部として検証チェックとスキーマ強制を自動化し、スキーマドリフトを早期に検出します。
埋め込み、拡張、合成データ、および基盤モデル用データセット
埋め込み(Embeddings)は、テキスト、画像、またはマルチモーダルな入力を、意味的な関係を捉えた密なベクトルに変換します。これらはセマンティック検索、検索拡張生成、クラスタリングを強化します。Amazon BedrockまたはSageMakerでホストされたエンコーダーで埋め込みを生成し、Amazon OpenSearch Service (k-NN)、Amazon Kendra、またはマネージドベクトルストアにベクトルを保存し、コンテキストを検索して基盤モデルを条件付けする、検索拡張生成(RAG)パターンを構築します。実例が乏しい場合、データ拡張と合成データ生成が実用的です。SageMakerの生成モデルを使用して、言い換え、画像変換(AlbumentationsまたはSageMaker Processing経由)、またはプライバシーを保護する合成レコードを作成します。合成データへの過度の依存には注意してください。忠実度が低いと、分布シフトを引き起こし、モデルがアーティファクトに過学習する可能性があります。FMトレーニングデータセットについては、高品質な模範例をキュレートし、プロンプトテンプレートでフォーマットを正規化し、S3ですべてのデータセットスナップショットをバージョニングします。サードパーティのFMでプライベートデータを使用する場合、プライベートなファインチューニングパス(VPCにコンピューティングを持ち込む)を優先するか、ソースドキュメントを安全なベクトルストアに保持しつつ、機密性のないコンテキストのみをFMに送信する検索専用パイプラインをデプロイします。漏洩を防ぐために、墨塗りやトークンレベルのマスキングを適用します。プロンプトエンジニアリングと指示テンプレート(システムプロンプト)は、モデルの応答を形成するために不可欠です。求められる決定論と創造性に応じて、temperature、top_k、またはtop_pを調整します。
評価、デプロイ、モニタリング、ライフサイクル管理
評価は、ビジネス目標に沿ったメトリクスを使用して明示的に行う必要があります。回帰タスクではRMSEやMAE、二値分類では適合率/再現率/F1スコアやROC AUC、要約ではROUGEの亜種を評価します。評価フェーズでは検証と交差検証を実施し、最終的な受け入れのためにブラインドテストセットを確保しておきます。デプロイには、Amazon SageMakerエンドポイント(リアルタイムまたはサーバーレス推論)を使用するか、マネージドFMサービングのためにAmazon Bedrockを使用します。レイテンシーを最適化するには、より小さな蒸留モデルを選択したり、マルチモデルエンドポイントを有効にしたり、予測不能なトラフィックに対してSageMaker Serverless Inferenceを使用したりします。本番環境ではAmazon SageMaker Model Monitorでパフォーマンスとデータドリフトを監視し、メトリクスの低下に対してアラートを設定します。リスクを限定するために、カナリアデプロイメントやブルー/グリーンデプロイメントを採用します。モデル使用のためのアクセス制御は、IAMロールポリシー、リソースレベルの権限、およびネットワーク分離を使用して強制されます。実践者が陥りやすい罠には、不均衡なクラスに対して正解率(accuracy)などの誤ったメトリクスを選択すること、コンセプトドリフトを無視すること、監査可能性のためにトレーニングデータと推論ログを計装しないことなどがあります。SageMaker Pipelinesを用いたMLのためのCI/CDを使用して、再トレーニングの頻度を標準化し、データセットとモデルのバージョニングの一貫性を保ち、コンプライアンスのための防御可能な監査証跡を維持します。
実践的な問題:ユースケースシナリオ
シナリオ:オンライン食料品チェーンのBrightCart社は、オンプレミスの在庫システムをAWSに移行し、顧客からの質問に答え、リアルタイムの在庫場所を返すと同時に、コンプライアンスルールに従って顧客データと在庫データを保護する生成AIチャットボットを求めています。同社のAWS AI環境には、データセット用のS3、トランザクション在庫用のAmazon RDS、開発用のSageMaker Studio、基盤モデルアクセスのためのBedrock、およびVPCネットワーキングが含まれています。
課題:現在の在庫を取得し、機密データの漏洩やハルシネーションの発生を回避する、プライベートで低レイテンシーなRAG対応チャットボットを構築する。
推奨アプローチ:
- プライベートVPCをプロビジョニングし、BedrockとSageMaker用のAWS PrivateLinkエンドポイントを設定します。正規の製品ドキュメントと在庫スナップショットをサーバーサイド暗号化(KMS)を有効にしたS3に保存し、S3のバージョニングを有効にします。
- プライベートサブネット内でBedrockエンコーダーまたはSageMakerモデルを使用して製品ドキュメントから継続的に埋め込みを計算し、高速な最近傍検索のためにk-NNを使用してAmazon OpenSearch Serviceにベクトルを保存します。リアルタイムの在庫はAmazon RDSに保持し、取得のための安全なランタイムコネクタを提供します。
- 検索拡張パイプラインを実装します。アプリケーションはまずコンテキストを得るためにOpenSearchにクエリを発行し、次に取得したコンテキストと明示的な安全指示を含むシステムプロンプトテンプレートを使用してBedrockを呼び出します。入力検証によってユーザー入力をサニタイズし、Amazon Comprehendを使用してPIIを検出し、検索前に墨塗りします。
- Application Load Balancerの背後にチャットボットをデプロイし、VPC内のAPIゲートウェイを介してBedrock経由でFMを提供します。アクセスを制限した上でCloudWatchへのロギングを有効にし、SageMaker Model Monitorと定期的な人手による監査でモデルの応答とドリフトを監視します。
論理的根拠:このアプローチは、RAGパターンを使用して機密データの漏洩を最小限に抑え、コンプライアンスのためにプライベートネットワーキングとKMSを活用し、正確性のためにリアルタイム在庫をモデルのコンテキストから分離し、ハルシネーションを制御して継続的な信頼性を確保するためにモニタリングとヒューマンインザループのチェックを適用します。
← AIのセキュリティとプライバシー · すべてのドメイン · モデルの学習、評価、最適化 →
これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
試験に合格する →