Amazon AIF-C01: AI/ML için Maliyet Optimizasyonu ve Fiyatlandırma — Çalışma kılavuzu
Şunun bir parçası: AWS AI Practitioner AIF-C01 — Çalışma kılavuzu. Doğrulanmış cevaplarla şurada pratik yapın: Amazon sınav merkezi, veya şurada süreli deneme sınavları çözün: ExamRoll.io.
Bedrock, SageMaker ve EC2 genelinde maliyet etkenleri ve fiyatlandırma modelleri
Yapay zeka/makine öğrenmesi iş yüklerinin fiyatlandırması; işlem (compute), depolama, ağ ve servise özgü ölçümleme kalemlerine ayrılır. Amazon Bedrock üzerinden temel modellere (foundation model) erişim, metin iş yükleri için genellikle istek veya token başına, akış API’leri için ise saniye başına ücretlendirilir; SageMaker, eğitim ve çok kiracılı barındırma için örnek (instance) saati ücretlerinin yanı sıra veri transferi ve depolama için de ücret alır. EC2 tabanlı barındırma, ham örnek (instance) saati maliyetini beraberinde getirir ve buna ek olarak EBS, EFS veya FSx depolama ücretleri ile VPC çıkış (egress) trafiği maliyetleri eklenir. Başlıca maliyet etkenleri; model boyutu (daha büyük modeller token/matematiksel işlem yükünü ve bellek ayak izini artırır), çıkarım (inference) iş hacmi (gecikmeye duyarlı senkron çağrılar, pahalı GPU’lara sabitlendiğinde daha maliyetli olur) ve gömme (embedding) aramaları ile vektör aramalarının çağrı sayısını katlayabildiği geri çağırma ile zenginleştirilmiş üretim (RAG) için veri hareketidir. Uygulayıcıların düştüğü yaygın tuzaklar arasında yüksek QPS’li RAG sistemleri için gömme (embedding) maliyetlerini hafife almak, birden fazla SageMaker uç noktasını boşta çalıştırmak ve PII’ı (Kişisel Tanımlanabilir Bilgiler) bölge içinde tutarken bölgeler arası çıkış (egress) trafiğini göz ardı etmek yer alır. Bu nedenle karar kriterleri; istek hacmini, istek başına gecikme toleransını, modelin ince ayar gerektirip gerektirmediğini veya hazır haliyle kullanılıp kullanılamayacağını ve yönetim ile ölçeklendirme ek yükleri hesaba katıldığında sağlayıcı tarafından yönetilen çıkarımın (Bedrock/SageMaker uç noktaları) mı yoksa kendi kendine barındırılan EC2/GPU örneklerinin mi daha iyi bir TCO (Toplam Sahip Olma Maliyeti) sunduğunu dikkate almalıdır.
Örnek (instance) seçimi, spot örnekler ve işlem (compute) optimizasyon kalıpları
Örnek (instance) seçimi hem performansı hem de maliyeti etkiler. Eğitim için, büyük ölçekli matris iş hacminin kritik olduğu durumlarda Trainium (trn1) veya GPU kümeleri (p4/p5) kullanın; çıkarım (inference) için ise maliyeti düşürmek amacıyla daha küçük modellerde Inferentia/Inf2 (inf1/inf2) veya Graviton tabanlı CPU çıkarımını tercih edin. SageMaker Managed Spot Training ve SageMaker Distributed Training gibi yönetilen hizmetler, kontrol noktası oluşturma (checkpointing) özelliğini entegre eder ve spot kapasitesini otomatik olarak geri kazanarak eğitim maliyetini önemli ölçüde düşürür; ancak spot, sağlam yedekleme mekanizmalarıyla birleştirilmediği sürece düşük gecikmeli üretim ortamları için bir tuzaktır. Harcamayı azaltan mimari kalıplar arasında asenkron toplu işleme, soğuk başlangıç (cold-start) korumalı otomatik ölçeklendirme, çok sayıda küçük modeli tek bir ana makinede birleştirmek için çok modelli uç noktalar ve bellek ile iş hacmi gereksinimlerini azaltmak için karma hassasiyet (mixed-precision) ve nicemleme (quantization) kullanımı yer alır. Büyük modellerin eğitimi için bellek ayak izini düşürmek amacıyla DeepSpeed veya ZeRO gibi çerçeveleri kullanın ve tam modelin yeniden eğitilmesinden kaçınmak için parametre verimli ince ayarı (LoRA/adaptörler) değerlendirin. Sık yapılan bir hata, CPU veya Inferentia örneklerinin çok daha iyi bir fiyat-performans sunacağı gömme (embedding) ağırlıklı iş yükleri için üst düzey GPU’lar kullanmaktır.
Model seçimi ödünleşimleri ve maliyet odaklı stratejiler
Model seçimi; maliyet, gecikme, doğruluk ve veri hassasiyeti arasında bir ödünleşimdir. Bedrock’taki temel modeller (foundation models) yönetilen ölçeklendirme, güvenlik araçları ve hızlı iterasyon sunar, ancak ölçek büyüdükçe baskın hale gelebilecek çağrı başına veya token başına maliyetlere neden olur; SageMaker veya EC2’de barındırılan açık kaynaklı modeller, barındırma ve operasyonel ek yükleri amorti ederseniz çıkarım başına maliyeti düşürebilir. Hibrit mimariler iyi çalışır: isteklerin büyük çoğunluğu için küçük ve ucuz bir model çalıştırın ve karmaşık sorgular için daha büyük bir modele yükseltin veya ağır bağlamın bir vektör deposu (OpenSearch, Amazon QLDB destekli vektör DB veya üçüncü taraf) tarafından sunulduğu ve LLM’e yalnızca kısa ve öz istemlerin (prompt) gönderildiği geri çağırma ile zenginleştirilmiş üretimi kullanın. İnce ayar kararları, veri kümesi ve işlem (compute) kullanımını sınırlamak için metinden metne görevler için parametre verimli yöntemleri (LoRA, adaptörler) ve JSONL formatındaki istem-tamamlama çiftlerini dikkate almalıdır. Yaygın tuzaklar arasında, istem mühendisliği (prompt engineering) kullanmak yerine gereksiz yere büyük modellerde ince ayar yapmak, istem (prompt) token uzunluğunun şişmesini gözden kaçırmak ve sık tekrarlanan sorgular için yanıtları önbelleğe almamak veya tekilleştirmemek yer alır.
Maliyet kontrolü için depolama, veri yerelliği, yönetişim ve gözlemlenebilirlik
Depolama seçimleri hem aylık maliyetleri hem de yasal uyumluluğu etkiler. Veri kümeleri için S3’ü yaşam döngüsü politikaları, Intelligent-Tiering ve sıkıştırılmış formatlarla (Parquet/TFRecord) kullanın; aktif eğitim verilerini yüksek verimli katmanlarda hazırlayın ve ham varlıkları Glacier’e arşivleyin. PII (Kişisel Tanımlayıcı Bilgiler) ve veri yerleşimi için S3 bucket’larını, KMS anahtarlarını ve işlem gücünü gerekli AWS Bölgesinde tutun ve yanlışlıkla bölgeler arası veri çıkışını önlemek için VPC endpoint’leri, IAM politikaları ve özel ağ iletişimi aracılığıyla erişimi kontrol edin. RAG için getirme (retrieval) işlem hatları, aktarım maliyetlerinden ve gecikmeden kaçınmak için vektör depolarını (Amazon OpenSearch Service veya EC2/EBS üzerindeki bir embedding deposu) çıkarım katmanıyla aynı yerde konumlandırmalıdır. SageMaker Clarify, Debugger ve Model Monitor gibi gözlemlenebilirlik ve açıklanabilirlik araçları, yönetişim ve erken sapma tespiti sağlar ancak maliyet ekler—harcamaları kontrol etmek için örnekleme tabanlı izleyiciler dağıtın. Verimli yongaları (Inferentia/Trainium) seçerek ve toplu işlem (batching) yaparak çevresel ayak izini ve faturayı en aza indirin; yaygın bir hata, örnekleme eşikleri olmadan tam günlük kaydını ve sürekli model izlemeyi etkinleştirmektir; bu durum, çok az ek değer sağlarken hem maliyeti hem de gürültüyü artırır.
Pratik Problem: Kullanım Senaryosu
Senaryo: Acme Retail, LLM erişimi için Amazon Bedrock, model eğitimi/barındırma için Amazon SageMaker, veri için S3 ve ürün indeksleme için Amazon OpenSearch kullanan bir AWS yapay zeka yığını işletmektedir. Şirketin, tutarlı bir marka sesi, bölge içinde katı PII gereksinimleri ve sıkı bir maliyet hedefiyle günde binlerce paragraflık ürün açıklaması oluşturması gerekmektedir.
Zorluk: Açıklama başına maliyeti en aza indirirken ve müşteri verilerinin belirlenen AWS Bölgesinden asla ayrılmamasını sağlarken, ölçekte yüksek kaliteli, markalı açıklamalar sunmak.
Önerilen Yaklaşım:
- İki katmanlı bir çıkarım işlem hattı kullanın: tüm istekleri önce yaygın SKU’ları ve basit açıklamaları işlemek için SageMaker veya EC2’de yerel olarak barındırılan hafif bir modele (nicemlenmiş/quantized) yönlendirin; karmaşık veya düşük güvenilirlikli vakaları bir Bedrock temel modeline iletin.
- Embedding’leri ve getirme (retrieval) indekslerini bölge içindeki Amazon OpenSearch’te saklayın; Bedrock token kullanımını düşük tutmak için kısa ve öz getirilmiş bağlam kullanın ve yaygın yanıtları ElastiCache’te önbelleğe alın.
- Tam model yeniden eğitimini nadiren yaparak, S3’e checkpoint’ler alarak SageMaker Managed Spot Training üzerinde parametre verimli yöntemler (LoRA) kullanarak küçük, özelleşmiş bir modele ince ayar yapın.
- Bölge sınırı denetimlerini uygulayın: S3 bucket’ları ve KMS anahtarları bölge içinde, Bedrock/SageMaker için VPC endpoint’leri ve izleme maliyetlerini sınırlamak için örnekleme tabanlı Model Monitor + Clarify kullanın.
Gerekçe: Ucuz bir temel modeli seçici yönlendirme ile birleştirmek, açıklama başına token ve instance maliyetlerini en aza indirirken, RAG ve önbelleğe alma Bedrock çağrılarını azaltır. Yönetilen spot eğitimi ve parametre verimli ince ayar, eğitim giderini ve depolama yükünü düşürürken, bölge içi denetimler PII ve uyumluluk gereksinimlerini karşılar.
← MLOps ve Dağıtım · Tüm alanlar
Bu soruları çözün → · ExamRoll.io’da süreli pratik →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Sınavınızı geçin →