Amazon MLA-C01: 生成 AI と基盤モデル — 学習ガイド

こちらの一部です: AWS Machine Learning Engineer Associate MLA-C01 — 学習ガイド. 検証済みの解答で練習: Amazon試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.

コアコンセプト

基盤モデルは、通常Transformerベースの大規模な事前学習済みネットワークであり、汎用的な言語、ビジョン、またはマルチモーダルな表現を提供します。実用的な本番環境への導入には、これら広範な能力をアプリケーション固有の振る舞いに変えるため、3つの直交する手段が必要です。すなわち、推論時のプロンプトエンジニアリング、最新またはドメイン固有の知識に出力を基づかせるための検索拡張生成(RAG)、そしてファインチューニングやパラメータ効率の良い手法によるモデルのカスタマイズです。Amazon Bedrockは、統合APIを介してサードパーティおよびAmazon提供の基盤モデルを呼び出すためのマネージドな手段を提供します。これにより、入力、モデルパラメータ(temperature、top_p、max_output_tokens)、および応答処理の制御を維持しつつ、モデル選択を抽象化します。SageMaker JumpStartは、SageMaker TrainingまたはHugging Faceコンテナ上で実行される事前学習済みモデルアーティファクト、トレーニングスクリプト、およびファインチューニングレシピをパッケージ化することでBedrockを補完し、再現可能な適応ワークフローとモデルレジストリとの統合を可能にします。

ファインチューニングには、適応の忠実度と引き換えに、コンピューティングとデータセットの要件が異なるいくつかの種類があります。完全なファインチューニングは、すべてのモデルの重みを更新し、多くの場合、タスク固有の最高のパフォーマンスをもたらしますが、チェックポイントのために大規模なGPUフリートとストレージを必要とします。LoRA(低ランクアダプタ)、アダプタモジュール、またはQLoRA(量子化低ランクアダプタ)などのパラメータ効率の良いファインチューニング(PEFT)技術は、少数の追加パラメータを注入してトレーニングすることにより、GPUメモリと時間を大幅に削減します。これらは、Hugging Faceと8ビット/4ビット量子化のためのbitsandbytesを使用したSageMakerトレーニングと互換性があります。人間のフィードバックからの強化学習(RLHF)はより複雑なパイプラインです。ペアワイズの人間の嗜好ラベルを収集し、報酬モデルをトレーニングし(SageMaker TrainingとModelPackageを使用した教師あり学習ステップ)、オンポリシーRL(PPOなど)でポリシーモデルを最適化します。その間、ロールアウトとチェックポイントをS3に保存し、SageMaker Debuggerで報酬シグナルをモニタリングします。

RAGアーキテクチャは、基盤モデルと最新のコーパスを橋渡しして、ハルシネーションを削減します。典型的なRAGパイプラインは、埋め込みモデル(Bedrock Embeddings APIまたはSageMaker Hugging Faceエンベッダー)でクエリテキストを埋め込み、インデックス(k-NNを使用したAmazon OpenSearch Service、Amazon Kendra、またはサードパーティのベクトルDB)で最近傍ベクトル検索を実行し、上位k個のドキュメントを取得し、プロンプトテンプレートと制御されたデコーディングパラメータを介して取得したコンテキストでLMを条件付けします。鮮度と関連性を管理するには、AWS Glue、ストリーミング更新のためのAWS Lambda、またはトランザクションソースのためのAWS DMSを使用してソースを定期的に再取り込みおよび再インデックス付けし、監査可能性のためにベクトルと共に出所メタデータ(source_id、document_id、ingestion_time)を保存する必要があります。

主要なサービスと設定

Amazon BedrockはInvokeModel APIを公開しており、リクエストにはモデル識別子とランタイムパラメータが含まれます。modelId、contentTypeおよびacceptヘッダー、プロンプトまたはinputTextを含むbody、そしてtemperature、topP、maxOutputTokensなどのmodelParametersを渡します。構造化されたシステムメッセージとユーザーメッセージを使用して、役割ベースの指示を分離し、出力形式を制約します。レイテンシーとコストを抑制するために、停止シーケンスとmax_output_tokensを強制します。埋め込み生成には、Bedrockの埋め込みエンドポイントまたはSageMaker Hugging Face推論コンテナを使用し、ベクトルをOpenSearch、Kendra、または外部のベクトルDBに永続化します。

SageMaker JumpStartは、事前に構築されたノートブックとファインチューニングパイプラインを提供します。これらは、TrainingJobName、AlgorithmSpecification(TrainingImage、TrainingInputMode)、RoleArn、InputDataConfig(S3Uri、DataSource)、OutputDataConfig(S3OutputPath)、ResourceConfig(InstanceType、InstanceCount、VolumeSizeInGB)、およびStoppingCondition(MaxRuntimeInSeconds)といった具体的なAPIパラメータを持つCreateTrainingJobに接続されます。モデルガバナンスのためには、SageMaker Model RegistryとCreateModelPackage/CreateModelPackageGroupを使用し、ApprovalStatusを「PendingManualApproval」に設定します。デプロイをゲートするために、ApprovalStatus属性をAWS CodePipelineまたはAWS Step Functions、およびManualApprovalアクションと共に使用して、モデルの昇格をCI/CDに統合します。継続的なモニタリングとバイアス検出のためには、MonitoringScheduleConfigとBaselineConfigを指定してCreateMonitoringScheduleを介してSageMaker Model Monitorをデプロイします。ProcessingJob API(ClarifyProcessor.run_pre_training_biasおよびrun_post_training_bias)を通じてSageMaker Clarifyを使用し、データセットのバイアス指標を計算し、S3に保存されるベースラインを生成します。

ベクトル検索とRAGでは、スケールとクエリのレイテンシーに基づいてインデックス作成と検索のテクノロジーを選択します。Amazon OpenSearch Serviceはk-NNプラグインをサポートし、REST APIときめ細かいアクセスコントロールを提供します。Amazon Kendraは、S3、SharePoint、RDSへのコネクタを備えたエンタープライズセマンティック検索を提供します。AWS Glueクローラーを使用して中央のデータカタログを構築し、AWS Lake Formationを使用してS3トレーニングデータのきめ細かいアクセスコントロールと分離を強制し、IAM、バケットポリシー、および暗号化(SSE-S3またはSSE-KMS)が適用されることを保証します。

設計パターンとトレードオフ

基盤モデルをカスタマイズする際は、オフラインでのファインチューニングとランタイムでのプロンプトエンジニアリングのどちらかを選択します。完全なファインチューニングは、特定のタスクに対するパフォーマンスを最大化しますが、運用上の複雑さが増します。トレーニングジョブには、大規模なGPUフリート、マルチノード分散トレーニング(Script ModeでSageMaker DistributedDataParallelまたはHorovodを使用)、UploadDirectoryを介したS3へのチェックポイント作成、そして効率的な推論のための後工程での量子化と変換が必要です。LoRAなどのPEFTアプローチでは、モデルの重みの大半を凍結するため、トレーニング時間が劇的に短縮され、より安価なハイパーパラメータースイープが可能になり、ベースモデルがそのまま残るためロールバックも簡素化されます。推論については、Bedrockが管理するエンドポイントはサードパーティ製FMの運用負荷を軽減する一方、SageMakerのリアルタイムエンドポイントはより詳細な制御を提供します。単一インスタンスから多数のモデルを提供するためのMultiModelEndpoints、予測不能なトラフィックに対応するServerless Inference、またはコールドスタートを削減するためにオートスケーリングとプロビジョンドコンカレンシーを備えたプロビジョニング済みエンドポイントを使用します。

RAGは、インデックスを最新の状態に保つことと、検索とハルシネーションのバランスを取ることにおいて複雑さを伴います。シンプルなパターンはハイブリッド検索です。まずベクトル検索(セマンティック)を実行し、次にキーワードフィルターを適用して精度を確保します。ドキュメントのチャンクのメタデータを保存することで、生成ステップで出典を引用できるようになり、Model Monitorによるハルシネーション頻度のチェックが容易になります。レイテンシーに敏感なアプリケーションでは、埋め込み計算とインデックスを同じ場所に配置し(同一VPC内のSageMaker推論 + OpenSearch)、近似最近傍(ANN)インデックスを使用して、再現率と引き換えに速度を向上させます。

RLHFは手間がかかりますが、人間の価値観や安全性への整合性が求められる場合には必要です。このパイプラインには、アノテーション用のツール、SageMaker Estimator APIを使用した再現可能な報酬トレーニング、そして安定したRLオプティマイザ(RLlibまたはStable BaselinesファミリーのPPO実装)が必要です。RLHFのコストと不安定性は、静的な損失としてエンコードできない振る舞いを修正できる能力と天秤にかける必要があります。

よくある落とし穴と判断基準

よくある間違いは、モデルレベルの適応が必要な体系的なエラーを修正するために、プロンプトのみに依存することです。プロンプトは役立ちますが、ドメインへのグラウンディングのためのファインチューニングやRAGを代替するものではありません。もう一つの落とし穴は、ガバナンスを過小評価することです。生成系システムを本番環境に導入するには、モデルの系譜(SageMaker Model Registry)、自動ドリフト検出(Model MonitorのベースラインとClarify)、そして承認ワークフロー(ApprovalStatus + CodePipelineの手動承認)が必要です。埋め込みストアでは、メタデータや来歴情報のないベクトルインデックスを選択すると、後の監査やエラー分析が高コストになります。

モデルホスティングは、コントロールと運用オーバーヘッドのバランスを取って決定します。多様で高性能な基盤モデルへのマネージドアクセスが必要で、推論フリートの管理を避けたい場合はBedrockを使用します。カスタム推論スタック、VPC分離、またはModel RegistryやModel Monitorとの完全な統合が必要な場合は、SageMakerエンドポイントを使用します。ファインチューニング手法については、データセットのサイズが比較的小さく、迅速なイテレーションが重要な場合はPEFTを選択します。ドメインが深い表現の変更を必要とし、GPU予算がある場合は、完全なファインチューニングを選択します。

実践的な問題:ユースケースシナリオ

企業名:AuroraPayments — 課題:トランザクションのコンテキストとポリシー文書を統合して疑わしいスコアを説明し、制御されたモデル更新をサポートする、低レイテンシーで監査可能な不正検知アシスタントをデプロイする。

  1. データの集約とストレージ:AWS Glueを使用してS3のトランザクションログをクロールし、AWS DMSを設定してオンプレミスのMySQLテーブルをAmazon RDSまたはS3にレプリケートします。すべてのソースをAWS Glueデータカタログに登録し、Lake Formationポリシーを適用します。根拠:GlueはサーバーレスETLと下流での検索のための統合カタログを提供し、Lake FormationはS3のアクセス分離を強制します。

  2. 特徴量エンジニアリングと異常検知:オフライン/オンライン間の一貫性を保つため、特徴量をSageMaker Feature Storeに取り込みます。トランザクションの時系列データに対してAmazon Lookout for Metricsを使用して自動異常検知を実行し、Amazon QuickSightでダッシュボードを表示します。根拠:Feature Storeはトレーニングとサービングのための再現可能な特徴量を保証し、Lookout for Metricsは異常検知を自動化し、QuickSightはビジネスアナリスト向けに可視化を提供します。

  3. モデルトレーニングと不均衡データへの対応:SageMakerの組み込みXGBoostを使用してXGBoost分類器をハイパーパラメータ付きでトレーニングし、クラスの不均衡を是正するためにscale_pos_weightを(num_negative/num_positive)に設定します。トレーニングサイズに合わせて調整されたResourceConfigを持つSageMaker TrainingのCreateTrainingJobを使用し、耐障害性のためにS3チェックポイントを有効にします。根拠:XGBoostは表形式データの不正検知タスクに効果的です。scale_pos_weightは、合成データによるオーバーサンプリングと比較して、最小限の運用オーバーヘッドで済みます。

  4. モデルレジストリ、承認、デプロイ:CreateModelPackage/ModelPackageGroupNameを使用してモデルアーティファクトをSageMaker Model Registryに登録し、ApprovalStatusを「PendingManualApproval」に設定します。承認アクションをトリガーするCodePipelineを実装し、承認されたバージョンをMultiModelエンドポイントまたはAuto Scaling配下のProvisioned Instancesを持つSageMakerリアルタイムエンドポイントにデプロイします。根拠:Model Registryは一元的なバージョニングとガバナンスを維持し、CodePipelineによる手動承認は承認されたリリースを強制します。

  5. 説明可能性とポリシーグラウンディングのためのRAG:BedrockまたはSageMakerのHugging Faceエンベッダーを使用してポリシー文書の埋め込みを作成し、メタデータと共にAmazon OpenSearchのk-NNにインデックス付けします。そして、疑わしいトランザクションに関するプロンプトに、検索された上位k件のポリシー断片と、基盤モデルにソースを引用して人間が読める形式の説明を生成するよう指示するテンプレートを含めるRAGフローを実装します。根拠:RAGは信頼できるドキュメントに説明をグラウンディングさせ、OpenSearchはセキュリティ境界内でスケーラブルなベクトル検索を提供します。

  6. モニタリングと再トレーニング:初期検証から得られたベースラインでSageMaker Model Monitorを有効にし、デプロイ後のバイアスチェックを実行するためにオンデマンドのClarify ProcessingJobsをスケジュールします。Model Monitorがドリフト(特徴量の分布変化やラベルの変化)を検知した場合、データ取り込みを実行し、テキスト特徴量に基盤モデルのエンコーダーを使用している場合はLoRAファインチューニングで再トレーニングし、評価を行い、新しいモデルをPendingManualApprovalとしてレジストリに配置するSageMaker Pipelineをトリガーします。根拠:自動化されたパイプラインによる継続的なモニタリングは、本番環境への変更に対する手動コントロールを維持しつつ、モデルのパフォーマンスとコンプライアンスを維持します。


セキュリティ、ガバナンス、コンプライアンス · すべてのドメイン · ML ワークロードのコスト最適化

これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

試験に合格する →

Amazonを閲覧 →

Related guides

オールインワンアクセス

1つのサブスクリプション。すべての試験。

すべてのプランで、無制限の回答検索、模擬試験、AI解説、および完全なリソースライブラリが利用可能 — 20以上の言語に対応。

月額
24.87
Just €0.83/day
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

ベストバリュー
12ヶ月
179.87
Just €0.49/daySave 40%
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

✓ 無料プランが含まれています · ✓ いつでもキャンセル可能 · ✓ すべてのプランで製品の全機能が利用可能