Amazon AIF-C01: AI と ML の基礎 — 学習ガイド
こちらの一部です: AWS AI Practitioner AIF-C01 — 学習ガイド. 検証済みの解答で練習: Amazon試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.
中核概念とモデルタイプ
中核となる用語を理解することは、健全なアーキテクチャ設計とトレードオフの判断の基礎となります。教師あり学習は、入力をラベル付きの出力に対応させ、連続値をターゲットとする回帰と、離散的なクラスを対象とする分類に分かれます。多クラス分類(20種類の遺伝子クラスなど)と二値分類では、モデルの選択や損失関数が異なります。教師なし学習は、ラベルなしデータの中から、クラスタリングや次元削減を通じて構造を見つけ出し、セグメンテーションや異常検知に利用されます。一般的なアルゴリズムファミリーには、線形モデルやツリーアンサンブル(解釈性が高く、表形式データに対して高速)、カーネル法(SVMなど)、そしてニューラルネットワーク(柔軟で、画像、音声、テキストに対して高い表現能力を持つ)が含まれます。画像タスクでは、畳み込みニューラルネットワークや、事前学習済みのビジョン基盤モデル(Amazon SageMaker JumpStartやAmazon Rekognition Custom Labels経由で利用)が主流です。テキストタスクでは、Transformerアーキテクチャが大規模言語モデルやシーケンスモデルを支えています。解釈性の要件がある場合、実践者はよりシンプルなモデルや、SageMaker Clarifyのような説明可能性ツールを利用する傾向があります。モデル選択では、予測性能、解釈性、推論レイテンシー、コストのバランスを取ります。例えば、透明性が求められる遺伝子分類にはツリーベースのモデルで十分な場合がありますが、高次元の画像や言語タスクにはディープモデルが適しています。これらのアルゴリズムファミリーを理解し、事前学習済みモデルを再利用すべきか、ゼロからトレーニングすべきかを判断することが、効率的でコンプライアンスに準拠したソリューションを導きます。
MLライフサイクル、データおよび特徴量管理
機械学習のライフサイクルは、問題設定、データ収集、ラベリング、特徴量エンジニアリング、トレーニング、検証、デプロイ、モニタリング、そして反復という段階で構成されます。AWS環境では、SageMakerがライフサイクルの多くの段階をオーケストレーションします。例えば、データ変換にはSageMaker Processing、特徴量の一元的な保存とオンライン/オフラインでの提供にはSageMaker Feature Store、モデルワークフローのCI/CDにはSageMaker Pipelinesが利用されます。ラベルの品質とクラスの不均衡は、しばしばボトルネックとなります。堅牢なアノテーションパイプラインに投資するか、SageMaker Ground Truthを使用してノイズの多いラベルを減らし、アクティブラーニングで人間の作業を集中させることが有効です。特徴量の系譜(リネージ)とアクセス制御は、再現性とガバナンスにとって重要です。SageMaker Model Registryに特徴量とモデルを登録し、Amazon S3のデータセットはライフサイクルポリシーでバージョニングします。本番環境では、SageMaker Model Monitorによる自動モデルモニタリングを導入し、データドリフト、コンセプトドリフト、精度低下を検出し、Amazon CloudWatchとAWS Lambdaを介してアラートを統合します。パイプラインは、べき等性と回復性を考慮して設計します。イベント駆動パターン(S3イベント、Step Functions)を使用し、レイテンシーとスループットの要件に基づいて、コンピューティングとストレージがスケールするように設計します(トレーニングにはEC2/GPUやTrainium、推論にはInf1/Neptune/Gravitonインスタンスなど)。
評価、アルゴリズム、および一般的な落とし穴
評価指標とベースラインの選択は、決定的に重要なプラクティスです。分類問題では、適合率(precision)、再現率(recall)、F1スコア、ROC曲線下面積(AUC)を検討します。多クラス分類では、クラスごとの再現率や、マクロ/マイクロ平均を使用します。回帰の評価には、RMSE、MAE、決定係数(R-squared)が使われます。本番環境でのサービングでは、実行効率はテールレイテンシー(P95/P99)とスループット(1秒あたりのリクエスト数)、そして推論あたりのコストで測定されます。典型的な落とし穴には、不均衡データセットで正解率(accuracy)を選択すること、テストデータで過剰なハイパーパラメータチューニングを行い過学習に陥ること、ビジネス上の意思決定で確率値を使用する際にキャリブレーションを怠ることなどがあります。交差検証やホールドアウト検証を使用し、ベースラインモデル(単純なヒューリスティックなど)を実装して、機械学習が確実に価値をもたらすようにします。ラベル付きデータが少ない場合は、転移学習、画像に対するデータ拡張、または半教師あり学習のアプローチを使用します。説明可能性とコンプライアンスのためには、ブラックボックスモデルを事後的な説明手法(SHAP、Integrated Gradientsなど)と組み合わせ、SageMaker Clarifyを統合します。AWSで一般的に選択されるアルゴリズムには、SageMakerの高速なトレーニングを利用した表形式データ向けのXGBoost、GPUインスタンス上のTorch/TensorFlowによる画像向けのCNN、SageMaker上のHugging Faceを利用したテキスト向けのTransformer、または検索拡張生成(RAG)のためのBedrock基盤モデルなどがあります。
基盤モデル、デプロイパターン、およびセキュリティ
基盤モデルは開発を加速させますが、特有のアーキテクチャ上の選択肢とセキュリティの考慮事項をもたらします。Amazon Bedrockは、複数のベースモデルへのマネージドアクセスを提供し、ファインチューニング、検索拡張生成 (RAG) ワークフロー、およびセマンティック検索のためのAmazon OpenSearch Service (k-NN) やAmazon Kendraなどのベクトルストアとの統合をサポートします。データサイズと安全性のニーズに基づいて、ファインチューニング、インストラクションチューニング、または軽量アダプタの中から選択します。低レイテンシー、高スループットの推論には、Amazon EC2 Inf1 (Inferentia) への最適化されたモデルのデプロイ、またはSageMaker Neo/Edge Managerを使用したエッジデバイス上でのモデルのコンパイルとホストを検討します。デバイス上での絶対的に最も低いレイテンシーの推論には、モデルの量子化、プルーニング、およびSageMaker Edge ManagerまたはAWS IoT Greengrassを介したローカルランタイムが必要であり、モデルサイズと精度はトレードオフの関係になります。セキュリティパターンには、VPCエンドポイント、Bedrock用のAWS PrivateLink、厳格なIAMロール、機密データに対するKMSで保護されたS3暗号化、および監査ログが含まれます。ハルシネーションやプロンプト攻撃を軽減するため、入力のサニタイズ、プロンプトテンプレート、レスポンスフィルター、RLHFまたは後処理チェックなどのガードレールを実装します。CloudTrailで利用状況と異常なAPIコールを監視し、レート制限と異常検出を実装して、モデルへのアクセスとデータプライバシーを保護します。
実践的な問題: ユースケースシナリオ
シナリオ: GreenGene Labsは、生データ用にAmazon S3、モデル開発用にSageMaker、基盤モデルの実験用にAmazon Bedrockを備えたAWS AI環境を使用しています。彼らは機密性の高いゲノムおよび臨床メタデータを厳格なアクセス制御下で維持し、研究ダッシュボードのためにスケーラブルな推論を必要としています。
課題: ヒト遺伝子サンプルを20のカテゴリに分類し、透明性のある決定ロジックを維持し、チーム間で特徴量を再利用し、研究者向けに監視された低レイテンシーのAPIをデプロイする。
推奨アプローチ:
- SageMaker ProcessingとGround Truthを使用してデータを準備・ラベル付けし、キュレートされた特徴量をSageMaker Feature Storeに保存します。
- SageMaker Trainingで解釈可能なモデル (XGBoost、決定木) をトレーニングし、SageMaker Model Registryにモデルを登録し、リネージを記録します。
- 最良のモデルを、オートスケーリングを備えたApplication Load Balancerの背後にあるSageMakerエンドポイントにデプロイします。ドリフト検出のためにSageMaker Model Monitorを有効にし、CloudWatchアラートを設定します。
- より大きな表現での実験のために、BedrockまたはHugging Faceモデルを埋め込みに使用し、類似性検索のためにOpenSearchベクトルインデックスを追加します。最終的な分類のために、解釈可能なモデルと組み合わせます。
理論的根拠: 一元化された特徴量管理と再現可能なパイプラインは、データ漏洩を減らし、コラボレーションを加速させます。一方、解釈可能なモデルを優先することで透明性のニーズを満たし、Bedrockの埋め込みはガバナンスを犠牲にすることなく、よりリッチな表現を可能にします。
これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
試験に合格する →