Amazon AIF-C01: AI/MLのコスト最適化と料金設定 — 学習ガイド
こちらの一部です: AWS AI Practitioner AIF-C01 — 学習ガイド. 検証済みの解答で練習: Amazon試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.
Bedrock、SageMaker、EC2におけるコスト要因と料金モデル
AI/MLワークロードの料金は、コンピューティング、ストレージ、ネットワーク、そしてサービス固有の課金体系にまたがって発生します。Amazon Bedrockを介した基盤モデルへのアクセスは、通常、テキストワークロードではリクエストごとまたはトークンごとに、ストリーミングAPIでは秒単位で課金されます。一方、SageMakerは、トレーニングとマルチテナントホスティングのインスタンス時間、さらにデータ転送とストレージに対して課金します。EC2ベースのホスティングでは、生のインスタンス時間コストに加えて、EBS、EFS、またはFSxのストレージ料金とVPC egressの料金が発生します。主なコスト要因は、モデルサイズ(モデルが大きいほどトークン/計算処理とメモリフットプリントが増加)、推論スループット(レイテンシーに敏感な同期呼び出しは、高価なGPUに固定されるとコストが増加)、そして検索拡張生成(RAG)のためのデータ移動です。RAGでは、埋め込みのルックアップとベクトル検索によって呼び出し回数が倍増する可能性があります。実務者が陥りがちな罠には、高QPSのRAGシステムにおける埋め込みコストの過小評価、複数のアイドル状態のSageMakerエンドポイントの放置、そしてPIIをリージョン内に保持する際のクロスリージョンegressの無視などがあります。したがって、意思決定の基準には、リクエスト量、リクエストごとのレイテンシー許容度、モデルをファインチューニングする必要があるか既製のままでよいか、そして管理とスケーリングのオーバーヘッドを考慮した場合にプロバイダー管理の推論(Bedrock/SageMakerエンドポイント)とセルフホストのEC2/GPUインスタンスのどちらがより良いTCOを提供するか、といった点を考慮すべきです。
インスタンス選択、スポットインスタンス、コンピューティング最適化パターン
インスタンスの選択は、パフォーマンスとコストの両方に影響します。トレーニングには、大規模な行列スループットが不可欠な場合にTrainium (trn1) またはGPUクラスター (p4/p5) を使用します。推論には、コストを削減するために、より小さなモデルに対してInferentia/Inf2 (inf1/inf2) またはGravitonベースのCPU推論を選択することが望ましいです。SageMaker Managed Spot TrainingやSageMaker Distributed Trainingのようなマネージドサービスは、チェックポイント機能を統合し、スポットキャパシティを自動的に再確保することで、トレーニングコストを大幅に削減します。しかし、スポットインスタンスは、堅牢なフォールバックと組み合わせない限り、低レイテンシーのプロダクション環境では罠となり得ます。支出を削減するアーキテクチャパターンには、非同期バッチ処理、コールドスタート対策を施したオートスケーリング、単一ホストに多数の小規模モデルを集約するマルチモデルエンドポイント、そしてメモリとスループットの要件を削減するための混合精度と量子化の使用が含まれます。大規模モデルのトレーニングにおけるメモリフットプリントを削減するためにDeepSpeedやZeROのようなフレームワークを使用し、モデル全体の再トレーニングを避けるためにパラメータ効率の良いファインチューニング(LoRA/アダプター)を評価します。よくある間違いは、CPUやInferentiaインスタンスの方がはるかに優れた価格性能を発揮するであろう埋め込み中心のワークロードに、最上位のGPUを使用することです。
モデル選択のトレードオフとコストを意識した戦略
モデルの選択は、コスト、レイテンシー、精度、およびデータ機密性の間のトレードオフです。Bedrockの基盤モデルは、マネージドスケーリング、セーフティツール、迅速なイテレーションを提供しますが、大規模になると支配的になり得る呼び出しごとまたはトークンごとのコストが発生します。SageMakerやEC2でホストされるオープンソースモデルは、ホスティングと運用のオーバーヘッドを償却できれば、推論ごとの費用を削減できます。ハイブリッドアーキテクチャはうまく機能します。リクエストの大部分には小さく安価なモデルを実行し、複雑なクエリに対してはより大きなモデルにエスカレーションするか、または重いコンテキストをベクトルストア(OpenSearch、Amazon QLDBベースのベクトルDB、またはサードパーティ)から提供し、簡潔なプロンプトのみをLLMに送信する検索拡張生成を使用します。ファインチューニングの決定に際しては、データセットとコンピューティングの使用量を制限するために、パラメータ効率の良い手法(LoRA、アダプター)や、text-to-textタスクのためのJSONL形式のプロンプトと補完のペアを検討すべきです。よくある罠には、プロンプトエンジニアリングを使用する代わりに不必要に大きなモデルをファインチューニングすること、プロンプトのトークン長の肥大化を見過ごすこと、そして繰り返し頻度の高いクエリに対する応答をキャッシュまたは重複排除しないことなどがあります。
コスト管理のためのストレージ、データローカリティ、ガバナンス、オブザーバビリティ
ストレージの選択は、月々のコストと法的コンプライアンスの両方に影響します。データセットには、ライフサイクルポリシー、Intelligent-Tiering、圧縮フォーマット(Parquet/TFRecord)を設定したS3を使用します。アクティブなトレーニングデータは高スループットの階層に配置し、生のデータ資産はGlacierにアーカイブします。PIIとデータレジデンシー要件のため、S3バケット、KMSキー、コンピューティングリソースは指定されたAWSリージョン内に保持し、VPCエンドポイント、IAMポリシー、プライベートネットワーキングを介してアクセスを制御し、意図しないクロスリージョンへのデータ転送を防ぎます。RAGの検索パイプラインでは、転送コストとレイテンシーを回避するため、ベクトルストア(Amazon OpenSearch ServiceまたはEC2/EBS上の埋め込みストア)を推論レイヤーと同じ場所に配置(コロケーション)すべきです。SageMaker Clarify、Debugger、Model Monitorなどのオブザーバビリティ(可観測性)および説明可能性ツールは、ガバナンスと早期のドリフト検出をもたらしますが、コストが増加します。支出を抑えるためには、サンプリングベースのモニターをデプロイします。効率的なチップ(Inferentia/Trainium)の選択とバッチ処理により、環境フットプリントと請求額を最小限に抑えます。よくある間違いは、サンプリングのしきい値を設定せずに完全なロギングと継続的なモデルモニタリングを有効にすることです。これは、わずかな付加価値しか提供しない一方で、コストとノイズの両方を増大させます。
実践的な問題:ユースケースシナリオ
シナリオ:Acme Retail社は、LLMアクセスにAmazon Bedrock、モデルのトレーニング/ホスティングにAmazon SageMaker、データ用にS3、製品インデックス作成にAmazon OpenSearchを使用するAWS AIスタックを運用しています。彼らは、一貫したブランドボイスを保ち、厳格なリージョン内PII要件と厳しいコスト目標を守りながら、1日に数千件の段落の長さの製品説明を生成する必要があります。
課題:説明あたりのコストを最小限に抑え、顧客データが指定されたAWSリージョンから決して出ないようにしながら、高品質でブランドイメージに沿った説明を大規模に提供すること。
推奨アプローチ:
- 2層の推論パイプラインを使用する:すべてのリクエストをまず、一般的なSKUと単純な説明を処理するためにSageMakerまたはEC2上でローカルにホストされた軽量モデル(量子化済み)にルーティングします。複雑な、または信頼度の低いケースは、Bedrockの基盤モデルにエスカレーションします。
- 埋め込みと検索インデックスをリージョン内のAmazon OpenSearchに保存します。簡潔な検索コンテキストを使用してBedrockのトークン使用量を低く抑え、一般的な応答はElastiCacheにキャッシュします。
- パラメータ効率の良い手法(LoRA)を用いて、SageMaker Managed Spot Training上で小規模な特化モデルをファインチューニングし、チェックポイントをS3に保存します。これにより、完全なモデルの再トレーニングは稀にします。
- リージョン境界制御を徹底する:S3バケットとKMSキーをリージョン内に配置し、Bedrock/SageMakerにはVPCエンドポイントを使用し、モニタリングコストを制限するためにサンプリングベースのModel Monitor + Clarifyを導入します。
論理的根拠:安価なベースラインモデルと選択的なエスカレーションを組み合わせることで、説明あたりのトークンコストとインスタンスコストを最小限に抑えます。一方、RAGとキャッシングによりBedrockの呼び出しが減少します。Managed Spot Trainingとパラメータ効率の良いファインチューニングはトレーニング費用とストレージのオーバーヘッドを削減し、リージョン内制御はPIIとコンプライアンス要件を満たします。
← MLOpsとデプロイ · すべてのドメイン
これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
試験に合格する →