Amazon MLS-C01: データエンジニアリングと特徴量エンジニアリング — 学習ガイド

こちらの一部です: AWS Machine Learning Specialty MLS-C01 — 学習ガイド. 検証済みの解答で練習: Amazon試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.

データインジェスト、ストレージ、ファイルフォーマット

ML対応のデータレイクの設計は、適切なインジェストパターンと永続化フォーマットの選択から始まります。リアルタイムのテレメトリには、Kinesis Data Streams(低レイテンシー処理)またはKinesis Data Firehose(マネージド配信)を使用します。Firehoseは、AWS Glue Schema RegistryとLambda変換を組み合わせることで、Amazon S3に直接配信し、サーバーサイドでレコードフォーマットをParquet/ORCに変換できます。カスタムエンリッチメントやサブ秒の応答が必要な場合は、Data Streams + Kinesis Data AnalyticsまたはLambdaを選択します。一括移行には、AWS DataSync、RDS/OLTPソース用にはDatabase Migration Service (DMS)、テラバイト規模のオフライン転送にはSnowballを使用します。S3では、分析ワークロードにはカラムナフォーマットのParquet(述語プッシュダウン、Snappyなどの圧縮、クエリパターンに合わせたパーティションキー)を、高スループットのシーケンシャルリードのためにTensorFlowパイプラインにデータを供給する場合はTFRecordを保存します。スモールファイルの爆発的な増加に注意してください。(Firehoseのバッファリング、Glueのバッチ処理などで)書き込みをバッファリングし、ビッグデータフレームワークに適したサイズ(数十から数百MB)のS3オブジェクトを生成します。スキーマの進化は一般的です。Glue CatalogとSchema Registryを使用してスキーマをバージョニングし、パーティショニングと命名規則を使用してコストのかかるフルテーブルスキャンを回避します。よくある罠は、下流の処理でFileモードを使用し、データセット全体をコンピュートノードにコピーすることです。データセットが数百万レコードに及ぶ場合は、全体をコピーするのではなく、ストリーミング(SageMaker Pipeモード)、Redshift Spectrum、またはAthenaを優先します。

サーバーレスおよびクラスターETL: Glue、EMR、Redshift、SageMaker

ETLの選択は、スケール、カスタマイズ、コストプロファイル、およびライブラリのニーズに依存します。AWS Glueは、カタログ化、クローラー、組み込みのジョブオーケストレーションを備えたサーバーレスのSpark ETLを提供し、マネージドスケーリングが求められる頻繁なイベント駆動型の変換に最適です。カスタムのSpark/Hadoopエコシステム、長時間実行されるクラスター、または特殊なライブラリ(GraphX、MLlibのカスタムビルド)が必要で、S3を基盤となるデータレイクとして使用できる場合は、EMRが望ましいです。インジェストなしの分析には、Redshift SpectrumまたはAthenaを使用してS3内のParquet/ORCを直接クエリします。Redshiftは、複雑な結合やBIワークロードに適しています。モデルデータの準備には、SageMaker Processingジョブが、スケーラブルなSparkまたはPythonの前処理を実行するためのマネージドコンテナを提供します。これにより、前処理コードがトレーニングの近くで実行され、トレーニングジョブと共にバージョニングできることが保証されます。組み込みアルゴリズムでSageMakerトレーニングを起動する際は、最低限、トレーニングイメージ、IAMロール、instance_type/count、およびトレーニングデータ用のS3 URIを提供します。数百万レコードのデータセットの場合は、Pipeモードを検討してレコードをストリーミングし、EBSへのコピーを回避します。よくある罠:非常に低レイテンシーの変換にGlueを選択する(代わりにLambda/Kinesisを使用するべき)、またはRedshift Spectrum/Athenaで十分な場合にS3データを不必要にHDFS/EBSにコピーすること。

特徴量エンジニアリング、変換パイプライン、特徴量選択

特徴量エンジニアリングは、再現可能であり、リーケージから隔離されている必要があります。前処理は、本番環境レベルのパイプライン(scikit-learn Pipeline、Spark MLパイプライン、またはSageMaker Processing + Feature Store)として実装し、トレーニング時と推論時で同一の変換が適用されるようにします。欠損値は戦略を選択して処理します。小さな欠損には単純な補完(平均値/中央値/最頻値)を、他の特徴量が欠損値を予測できる場合はモデルベースの手法(KNN、反復的なMICE)を使用します。勾配ベースのモデルには、StandardScalerまたはMinMaxで数値特徴量をスケーリングします。外れ値が多い場合は、ロバストなスケーリングを適用します。カテゴリカル変数については、カーディナリティが低い場合はone-hotエンコーディングを、カーディナリティが高いカテゴリにはターゲットエンコーディングまたは学習済み埋め込み(ディープモデルでのEmbeddingsの使用や、次元削減のための特徴量ハッシング)を選択します。テキストには、一貫した正規化(小文字化、句読点除去、トークン化)を実行します。埋め込みにはWord2Vec/BlazingTextを、線形モデルにはTF-IDF/スパースパイプラインを使用します。SageMakerのBlazingTextはskip-gram/CBoWをサポートし、大規模な処理で効率的です。特徴量選択には、L1正則化、ツリーベースの重要度(XGBoost/RandomForest)、相互情報量、または再帰的特徴量削減を使用し、選択バイアスを避けるために常にクロスバリデーションのフォールド内で特徴量選択を実行します。最大の実践的な罠はリーケージです。将来のターゲット情報を使用して特徴量を導出したり、分割前にデータセット全体を使用して前処理を適用したりしてはなりません。


すべてのドメイン · 探索的データ分析と可視化

これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

試験に合格する →

Amazonを閲覧 →

Related guides

オールインワンアクセス

1つのサブスクリプション。すべての試験。

すべてのプランで、無制限の回答検索、模擬試験、AI解説、および完全なリソースライブラリが利用可能 — 20以上の言語に対応。

月額
24.87
Just €0.83/day
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

ベストバリュー
12ヶ月
179.87
Just €0.49/daySave 40%
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

✓ 無料プランが含まれています · ✓ いつでもキャンセル可能 · ✓ すべてのプランで製品の全機能が利用可能