Amazon MLS-C01: モデリング — 教師ありと教師なし(古典的なML) — 学習ガイド
こちらの一部です: AWS Machine Learning Specialty MLS-C01 — 学習ガイド. 検証済みの解答で練習: Amazon試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.
教師あり問題のモデル選択とアーキテクチャ
モデルの選択は、データの形状と本番環境の制約から始まります。多くのサンプルを持つ線形シグナルで、係数が解釈可能であることが重要な場合、正則化された線形回帰またはロジスティック回帰(SageMaker LinearLearnerまたはscikit-learn ElasticNet)は高速で、調査可能な係数が得られます。非線形な相互作用が支配的な場合、XGBoost(SageMaker XGBoostコンテナ)やLightGBMのようなツリーアンサンブルモデルは、大規模な特徴量スケーリングなしで異質性を捉えることができます。過学習を制御するために、eta (learning_rate)、max_depth、subsample、colsample_bytree、および正則化のalpha/lambdaを調整します。SVMは、小規模から中規模で、適切にスケーリングされた特徴量セットに対して効果的ですが、大規模なデータセットではコストがかかるため、通常はSageMaker上でカスタムコンテナまたはscikit-learnのScriptModeを必要とします。特徴量を標準化し、カーネル/正則化(C、gamma)を慎重に選択することを忘れないでください。Naive Bayesは、高次元で疎なカテゴリカル/テキスト入力に対する高速なベースラインです。これは条件付き独立性を仮定しており、相関が強い場合にはうまく機能しません。数千の特徴量や非常に大規模なデータセットの場合は、次元削減(PCA)や特徴量ハッシュを使用し、GPUベースのディープネットを使用する場合はml.c5またはml.p3インスタンスでの分散トレーニングを推奨します。リアルタイム推論にはSageMakerエンドポイントを、一括予測にはBatch Transformを使用してデプロイします。多くのモデルを維持してコストを削減する場合は、Multi-Model Endpointsを使用します。
メトリクス、不均衡、キャリブレーション、デプロイメントのトレードオフ
Accuracy(精度)は魅力的ですが、不均衡問題では誤解を招く可能性があります。クラスのバランスを重視する場合は適合率(precision)、再現率(recall)、F1スコア、ROC AUCのようなクラスを考慮したメトリクスを、正例クラスが稀な場合はPR AUCを優先します。確率を生成する際は、信頼性ダイアグラムとBrierスコアでキャリブレーションを確認します。Plattスケーリングやアイソトニックキャリブレーションをオフラインで実装(scikit-learn CalibratedClassifierCV)するか、SageMakerのトレーニング内で生のスコアを出力し後処理ステップを適用することでキャリブレーションを行います。クラスの不均衡に対処するには、サンプル重み付け(SageMaker LinearLearnerや多くのトレーニングスクリプトでサポート)、トレーニング中のターゲットを絞ったオーバーサンプリング(SMOTE)やアンダーサンプリング、ニューラルネットの場合は損失の再重み付けやfocal lossを優先します。不正利用確率のほぼリアルタイムなスコアリングのためには、推論レイテンシーの低いインスタンスタイプ(ml.m5.largeまたはCPU最適化インスタンス)を使用してモデルのレイテンシーを最適化し、モデルをコンパクトに保ち(プルーニングまたは蒸留モデルを使用)、SageMakerエンドポイントを介したマルチモデルエンドポイントやA/Bトラフィックシフティングを使用して安全にアップデートを展開します。SageMaker Model Monitorで本番環境のドリフトとデータ品質を監視し、CloudWatchへのメトリクスのロギングを自動化します。
特徴量エンジニアリング、多重共線性、正則化
多重共線性は、線形モデルにおける係数推定値の分散を増大させます。これを分散拡大係数(VIF)とペアワイズのピアソン相関で検出し、冗長な特徴量を削除するか、次元削減(PCA、SVD)を使用して緩和します。正則化は原理に基づいた解決策です。L2(Ridge)は係数を縮小し、L1(Lasso)は特徴量選択のためのスパース性(疎性)を誘導し、ElasticNetはその両方を組み合わせます。これらはscikit-learnとSageMaker LinearLearnerで利用可能です。強く歪んだ数値特徴量には、対数変換またはBox-Cox変換を適用して分散を安定させ、線形モデルの適合度を向上させます。ツリーアンサンブルは単調変換に対して頑健ですが、SVMやニューラルネットは安定したトレーニングのために標準化された入力(StandardScaler)が必要であることを覚えておいてください。カーディナリティの高いカテゴリカル特徴量には、ターゲットエンコーディング、埋め込み、またはハッシュ化が有効です。ターゲットエンコーディングを使用する際は、交差検証のフォールド内でエンコーディングを計算するか、別のホールドアウトセットを使用してリークを避けます。SageMaker Feature Storeを使用して、トレーニングと推論の両方に対して一貫した特徴量変換を一元化して提供し、前処理コードをモデルパッケージやDockerイメージと共に永続化することで、本番環境の変換がトレーニング時と一致するようにします。
教師なし学習、クラスタリング、異常検知、解釈可能性
クラスタリングと異常検知は、教師ありモデリングのための探索的ツールであり、前処理ステップです。K-means (SageMaker k-means) は高速ですが、球状のクラスターを想定し、特徴量のスケーリングを必要とします。イナーシャ (inertia) が曖昧になる可能性があるため、シルエットスコアやエルボー法を用いて慎重に k を選択してください。密度ベースの手法 (DBSCAN) や階層的クラスタリングは、非球状の構造を捉えられますが、計算コストが高くなります。大規模な異常検知には、ストリーミングセンサーデータに対しては SageMaker Random Cut Forest を、ほぼリアルタイムのスコアリングには Kinesis/Lambda パイプラインを検討してください。感度を制御するために、ツリーの数とサンプルサイズを調整します。解釈可能性ツールは非常に重要です。ツリーベースのモデルにはモデルネイティブの特徴量重要度を、局所的な説明や全体的な影響の要約には SHAP 値 (SageMaker Clarify または SHAP パッケージ) を使用します。よくある落とし穴に注意してください。時系列データをランダムに分割する際の時間のリーク、不均衡なデータセットにおける正解率への過度な依存、Naive Bayes での独立性の仮定などです。デプロイにあたっては、必要に応じてカスタムアルゴリズムを Docker でパッケージ化し、推論エンドポイントとヘルスチェック用エンドポイントを公開し、エンドポイントのトラフィックスプリッティングを通じてカナリアリリースを編成します。
実践的な問題: FleetSight Logistics — トラック画像の探索的 ML
シナリオ: FleetSight 社は、S3 に保存されたトラック画像を 1 日あたり約 100 GB 収集し、実験には SageMaker Studio を、画像ラベリングには SageMaker Ground Truth を使用しています。彼らは欠陥検出のための軽量な ML 機能と、将来的なスケールアウトを計画しています。
課題: 実現可能な教師あり/教師なしのユースケースと、限られたラベルで初期モデルをトレーニングし、アラートのためにほぼリアルタイムで推論を行うための低コストなパイプラインを特定すること。
推奨アプローチ:
- アクティブラーニングを備えた SageMaker Ground Truth を使用してシードセットをラベリングします。ラベル付けされたデータは S3 に保存し、特徴量は SageMaker Feature Store に登録します。
- まず、画像から派生したセンサーメタデータと単純な画像埋め込みに対して、SageMaker Random Cut Forest を用いた教師なし異常検知から始めます (埋め込みは、GPU インスタンス ml.p3.2xlarge を使用した SageMaker Notebook 上で、事前学習済みの CNN を用いて抽出します)。
- ラベル付けされたサブセットに対して、転移学習 (SageMaker の組み込み TensorFlow または PyTorch コンテナ) を使用して軽量な教師あり分類器をトレーニングします。手早くベースラインを作成するには、埋め込みを抽出し、CPU インスタンスで XGBoost モデル (SageMaker XGBoost) をトレーニングします。
- コスト効率のために、XGBoost モデルを非同期推論またはマルチモデルエンドポイントを備えた SageMaker エンドポイントにデプロイします。SageMaker Model Monitor で入力と予測をモニタリングし、Ground Truth を介してラベリングを繰り返します。
論理的根拠: まず、教師なしの埋め込みと Random Cut Forest を使用して、多くのラベルがなくても異常候補を見つけ出します。次に、転移学習と XGBoost を介して教師ありモデルをブートストラップし、コンパクトで高速な推論を実現します。SageMaker サービスは、統合され、スケーラブルな開発およびモニタリングのワークフローを提供します。
← 探索的データ分析と可視化 · すべてのドメイン · ディープラーニングとコンピュータビジョン →
これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
試験に合格する →