Amazon MLA-C01: コンピュータービジョン、NLP、特化型 ML — 学習ガイド

こちらの一部です: AWS Machine Learning Engineer Associate MLA-C01 — 学習ガイド. 検証済みの解答で練習: Amazon試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.

中核となる概念

AWSにおけるコンピュータビジョンとNLPソリューションは、データインジェストとセキュリティ、特徴量とラベルの準備、モデルのライフサイクル(トレーニング、レジストリ、デプロイ、モニタリング)という3つの階層的な関心事に集約されます。画像分類と物体検出では、トレーニングワークフローは、厳格な暗号化とネットワーク制御を備えたAmazon S3でのラベル付きアセットの保存、物体検出のためのPascal VOC / COCOなどのアノテーション形式、高スループットなトレーニングのためのRecordIOまたはTFRecordを中心に行われます。テキスト分類と固有表現抽出(NER)では、入力は一般的にトークン化されたシーケンス(トランスフォーマーモデル向けのWordPiece/BPE)またはラベル付きの行区切りJSONです。前処理では、Rekognition Textractの出力や人間がラベル付けしたスパンを使用する際に、NERのラベルアライメントの一貫性を保つために、トークンと文字のオフセットを維持する必要があります。表形式の不正検知モデルにおける特徴量エンジニアリングは、時間枠での集計、カテゴリカル変数のカーディナリティ削減、トレーニングとサービング間での一貫したエンコーディングに焦点を当てます。一元化された変換(Feature StoreまたはData Wranglerのフロー)を使用することで、オフラインでのトレーニングとオンラインでの推論の間のスキュー(乖離)を防ぎます。

モデル構築の選択肢は、特化したAWSサービスに対応しています。Amazon SageMakerは、組み込みアルゴリズム(XGBoost, Linear Learner, Random Cut Forest)やフレームワーク(MXNet, TensorFlow, PyTorch)向けのマネージドコンテナ、さらにバイアスと説明可能性のためのSageMaker Clarifyを提供します。Amazon Rekognitionは、ラベリング、顔/有名人の検出のための構築済み画像APIや、低い運用オーバーヘッドが求められる場合にRekognition Custom Labelsを介したカスタムラベルのトレーニングをカバーします。ドキュメントからのテキスト抽出と構造化データのためには、Amazon TextractがOCRおよびフォーム/テーブル抽出を提供します。感情分析、エンティティ認識、トピックモデリングなどの言語レベルのタスクには、Amazon ComprehendがマネージドAPIを提供し、臨床分野のNERにはComprehend Medicalがあります。本番環境で重要なのは、これらの要素を一貫したパイプラインに統合し、前処理、モデル入力、モニタリングが再現可能で監査可能であるようにすることです。

主要なサービスと設定

知っておくべき主要なAWSサービスと関連するAPI/設定パラメータは、Amazon SageMaker (TrainingJob, ModelPackage, ModelPackageGroup, ModelRegistry)、SageMaker Pipelines (RegisterModel, CallbackStep, ConditionStep)、SageMaker Model MonitorおよびClarify (BaselineConfig, DataConfig, ModelConfig, bias_config)、Amazon Rekognition、Amazon Comprehend、Amazon Textract、AWS Glue、そしてLake Formationです。安全で分離されたストレージのためには、SSE-KMSを使用してS3をサーバー側の暗号化で設定し(S3.PutBucketEncryptionとSSEKMSKeyId)、SageMakerの実行ロールにアクセスを制限するバケットポリシーをアタッチし、プライベートネットワーク転送のためにS3向けのゲートウェイVPCエンドポイントを有効にします。トレーニングジョブを開始する際には、CreateTrainingJobでVpcConfigパラメータ(SecurityGroupIdsとSubnets)を設定してインスタンスが顧客のVPC内で実行されるようにし、NetworkIsolationとInstanceMetadataServiceConfigurationを有効にしてアクセスを制限します。

最小限の運用オーバーヘッドでモデルを集中管理するには、ModelPackageGroupを作成し、CreateModelPackageを介してModelApprovalStatusを’PendingManualApproval’に設定したModelPackageバージョンを追加することで、SageMaker Model Registryを使用します。SageMaker PipelinesにCallbackStepまたは専用の「ManualApproval」ステップを追加することで、手動承認ゲートを自動化します。パイプラインは外部からのシグナルを待機し、その後UpdateModelPackageを呼び出してModelApprovalStatusを’Approved’に設定し、デプロイに進みます。デプロイされたリアルタイムエンドポイントのオンデマンドでのバイアスまたはドリフト評価には、バイアスメトリクスにはSageMaker Clarifyを、データおよび予測のドリフトにはSageMaker Model Monitorを使用します。CreateEndpointでDataCaptureConfigを有効にして(EnableCapture, CaptureOptions, DestinationS3Uri)、推論ペイロードをキャプチャし、その後CreateProcessingJobを介してClarify SDKのパラメータDataConfig、ModelConfig、bias_configを指定してClarifyの処理ジョブを開始し、ドリフトメトリクスを即座に計算します。

関連サービスは以下の通りです:

設計パターンとトレードオフ

不正検知のような表形式の分類では、実践的な設計パターンとして、AWS GlueやDMSを使用してリレーショナルテーブルの生ソースをセキュアなS3データレイクに集約し、Glue Data Catalogでカタログ化し、Lake Formationを介してアクセスを強制します。変換処理は、SageMaker Data WranglerのフローまたはGlue ETLジョブとして一度定義し、SageMaker Feature Storeに永続化することで、トレーニング時と推論時で同じ変換が実行されるようにします。Feature Storeを選択すると、初期の運用ステップは増えますが、スキューやデバッグ時間を削減できます。一方、ジョブ内で直接変換を行う方法は、初期オーバーヘッドは低いものの、再現性の確保やオンラインでの特徴量計算が難しくなります。トレーニングアルゴリズムには、XGBoost(SageMaker提供のコンテナ)が、その表形式データでのパフォーマンスと重み付け列のサポートにより、不正検知における強力なデフォルト選択肢となります。クラスの不均衡に対処するには、CreateTrainingJobのHyperParametersを使用してハイパーパラメータを設定し、重み付け列を渡すか、scale_pos_weightを設定します。これにより、より複雑なリサンプリングパイプラインを回避できます。

コンピュータビジョンでは、迅速なイテレーションが必要で、ラベル付きデータが限られている場合、Rekognition Custom Labelsが最小限の運用で最速のパスを提供します。最大限の制御とカスタムアーキテクチャが必要な場合は、MXNet/PyTorchを使用したSageMakerトレーニングを利用し、データセットはS3上にRecordIOまたはImageFolder形式で保存します。物体検出では、COCO形式を出力するフレームワークでのトレーニングが推奨されます。また、InstanceType=ml.p3.2xlarge以上を指定し、TrainingJobのAlgorithmSpecificationとTrainingInputModeでMPIまたはhorovodの設定を行うことで、SageMakerの分散トレーニングを活用します。トレードオフには、スループットとコストの比較が含まれます。マネージドスポットインスタンスを使用したバッチジョブはコストを削減しますが、レイテンシーの増加や中断のリスクが伴います。SageMaker Pipelinesのパイプラインキャッシュは、入力が変更されていない場合にステップの再起動を削減し、不要なコンピューティングの起動時間を最小限に抑えます。

よくある落とし穴と判断基準

よくある落とし穴は、前処理アーティファクトの集中管理を怠ることです。トークン化、NERのラベルマッピング、またはカテゴリカルエンコーダーがトレーニングと推論で異なる方法で適用されると、追跡が困難な予測エラーが発生します。Feature Storeを使用するか、前処理アーティファクト(tokenizer、vocab.json、label_map)をModel Registryのモデルパッケージと共に永続化することで、デプロイされたコンテナが正確な変換を取得して適用できるようにします。もう一つのよくある失敗は、モニタリングのためのキャプチャが不十分なことです。エンドポイントでDataCaptureConfigを有効にし、適切なグラウンドトゥルースのラベリングワークフローを構築しないと、Model Monitorはドリフトや品質メトリクスを計算できず、F1スコアの低下を解明することが当て推量になってしまいます。クラスの不均衡に対しては、サンプリングバイアスを導入する可能性のある闇雲なアップサンプリング/ダウンサンプリングよりも、アルゴリズムでサポートされている重み付け(例えば、XGBoostのscale_pos_weightハイパーパラメータや、トレーニングデータに重み列を提供するなど)を使用する方が、運用負荷が最も低い解決策です。

実践的な問題:ユースケースシナリオ

企業名:MeridianPay。MeridianPayは、S3内のトランザクションログとオンプレミスのMySQLデータベース内の顧客プロファイルを組み合わせた、リアルタイムの不正検知パイプラインを構築する必要があります。要件には、安全で隔離されたストレージ、手動承認付きの中央モデルレジストリ、連続するトレーニング実行間での最小限の起動レイテンシー、集計後の自動異常検知と可視化、最小限の操作でのカテゴリカル特徴と数値特徴の混合サポート、クラス不均衡への対応、そしてドリフトとバイアスをオンデマンドで監視できる本番モデルが含まれます。

  1. データの集約と保護:AWS DMSを使用してオンプレミスのMySQLテーブルを暗号化されたS3ランディングゾーンに継続的にレプリケートし、AWS Glueクローラーを実行して、結果のテーブルをAWS Glueデータカタログに登録します。AWS Lake FormationとS3バケットポリシーを介してアクセスを強制します。S3用のGateway VPC Endpointを有効にし、最小権限のIAMでSageMaker実行ロールを設定します。S3でSSE-KMSを使用し、カスタマーマネージドKMSキーを指定し、BucketEncryptionKmsMasterKeyIdを設定します。

  2. 特徴量の変換と保存:SageMaker Data WranglerまたはGlue ETLジョブで変換を作成し、派生した特徴量をAmazon SageMaker Feature Storeのオンラインストアに永続化して推論時の低レイテンシー検索を実現し、オフラインストアに保存してトレーニングに使用します。tokenizer/encoderアーティファクトはモデルアーティファクトと一緒に保存します。FeatureGroup APIを使用して特徴量グループを作成し、RecordIdentifierFeatureNameEventTimeFeatureNameを設定してポイントインタイムの正確性を確保します。

  3. 最小限の運用オーバーヘッドでのトレーニング:AlgorithmSpecificationでXGBoostコンテナのURIを指定したCreateTrainingJobを作成し、SageMaker XGBoost組み込みコンテナを使用します。VPC内で実行するためにVpcConfigを指定し、HyperParameters"objective":"binary:logistic"を含め、クラスの不均衡に対処するために"scale_pos_weight"を負例と正例の比率に設定します。繰り返される起動レイテンシーを削減するために、SageMaker Pipelinesを実装し、データ準備ステップのキャッシュを有効にして、連続するパイプライン実行で変更のないステップをスキップするようにします。可能な限り、再処理ではなく永続的な特徴量ストアのルックアップを使用します。

  4. モデルレジストリと手動承認:トレーニング済みのモデルを、ModelApprovalStatus='PendingManualApproval'を指定したCreateModelPackageを介してModelPackageGroupに登録します。RegisterModelの後に一時停止するSageMaker PipelinesのCallbackStepを統合します。レビュー担当者はUpdateModelPackageを呼び出してModelApprovalStatus='Approved'に設定します。この承認されたパッケージをCreateModelおよびCreateEndpointの設定に使用します。

  5. 異常検知と可視化:集計後、Amazon Lookout for Metricsを使用して時系列のトランザクション集計データに対して自動異常検知を実行し、S3/Glueへの統合を設定します。可視化には、Lookoutの結果とデータをQuickSightダッシュボードに接続するか、SageMaker Studioノートブックを使用して特徴量のドリフトを可視化します。デプロイされたエンドポイントのオンデマンドでのモデルバイアス/ドリフト評価には、CreateEndpointDataCaptureConfigを有効にし、キャプチャされたデータを指すDataConfigModelConfigを持つオンデマンドのSageMaker Clarify処理ジョブ(CreateProcessingJob)を実行します。定期的なチェックをスケジュールし、StartMonitoringScheduleで一度限りの実行をトリガーするために、Model Monitor/CreateMonitoringScheduleを使用します。

根拠:このアプローチは、データと変換を集中管理し、運用負担を軽減するマネージドサービス(それぞれの領域でGlue/DMS/Lookout/Comprehend/Textract)を使用します。SageMaker Model RegistryとPipelinesを活用して、最小限のカスタムインフラでバージョニングと手動承認を実現します。大規模なリサンプリングを避けるためにアルゴリズムのパラメータを通じてクラスの不均衡を解決し、データを暗号化してネットワーク的に隔離しつつ、Model MonitorとClarifyを介してスケジュールされた評価とオンデマンドのバイアス/ドリフト評価の両方を提供します。


ML ワークロードのコスト最適化 · すべてのドメイン

これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

試験に合格する →

Amazonを閲覧 →

Related guides

オールインワンアクセス

1つのサブスクリプション。すべての試験。

すべてのプランで、無制限の回答検索、模擬試験、AI解説、および完全なリソースライブラリが利用可能 — 20以上の言語に対応。

月額
24.87
Just €0.83/day
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

ベストバリュー
12ヶ月
179.87
Just €0.49/daySave 40%
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

✓ 無料プランが含まれています · ✓ いつでもキャンセル可能 · ✓ すべてのプランで製品の全機能が利用可能