Amazon MLS-C01: Eğitim, Dağıtık Eğitim ve Hiperparametre Optimizasyonu — Çalışma kılavuzu

Şunun bir parçası: AWS Machine Learning Specialty MLS-C01 — Çalışma kılavuzu. Doğrulanmış cevaplarla şurada pratik yapın: Amazon sınav merkezi, veya şurada süreli deneme sınavları çözün: ExamRoll.io.

Eğitim işleri, konteynerler ve bulut eğitimine minimum kodla geçiş

Eğitim iş yüklerini SageMaker’a taşırken, temel tasarım hedefi, konteyner çalışma zamanının beklenen SageMaker ortam değişkenlerini ve kanal yollarını sunduğundan emin olurken model kodunu yeniden yazmaktan kaçınmaktır. Aynı eğitim betiğinin yerel olarak ve bulutta minimum değişiklikle çalışması için SageMaker Script Mode’u çerçeveye özgü Estimator (PyTorch, TensorFlow, XGBoost) ile kullanın: veriyi SM_CHANNEL_TRAIN’den okuyun, modeli SM_MODEL_DIR’e yazın ve SM_NUM_GPUS/SM_HOSTS/SM_CURRENT_HOST değişkenlerine uyun. Özel ortamlar için, resmi AWS Deep Learning Containers’ı (veya SageMaker eğitim araç setini) genişleten bir Docker imajı oluşturun ve bunu Amazon ECR’a gönderin; konteyner giriş noktasının SageMaker’ın eğitim sözleşmesine uyduğundan emin olun. İşlem profiline göre örnek tiplerini seçin: CPU ağırlıklı işler için ml.c5/m5 aileleri, GPU eğitimi için ml.p3, ml.p4d, g4dn veya g5 örnekleri; örnek boyutunu belleğe ve GPU-CPU oranına göre seçin. Sık karşılaşılan tuzaklar arasında sabit kodlanmış yerel dosya yolları, tek bir ana makine varsayımı (dağıtık işlerde sorun yaratır) ve G/Ç performansını etkileyen eğitim girdi modunu (Pipe vs File) belirtmemek yer alır. Tekrarlanabilirlik ve maliyet öngörülebilirliği için, yönetilen spot eğitimini yalnızca sağlam bir kontrol noktası oluşturma (checkpointing) mekanizması ekledikten ve Spot kesintilerine izin vermek için max_wait > max_run olarak ayarladıktan sonra etkinleştirin.

Dağıtık eğitim desenleri, veri girdi modları ve depolama seçenekleri

Dağıtık derin öğrenme; model paralelliği, veri paralelliği ve G/Ç mimarisinin dengelenmesini gerektirir. Çoklu GPU’lu tek ana makine ve çoklu ana makine eğitimi için, çerçevelerin yerel temel bileşenlerini (torch.distributed veya TensorFlow’un MultiWorkerMirroredStrategy’si) kullanın veya SageMaker’ın smdistributed kütüphanelerinden yararlanın: veri paralel ölçeklendirme için smdistributed.dataparallel ve çok büyük transformer modelleri için smdistributed.modelparallel veya DeepSpeed. Büyük veri setleri için standart depolama alanı olarak S3’ü kullanın, ancak çok sayıda küçük S3 GET isteğinden kaçının: dosyaları daha az sayıda arşivde birleştirin, RecordIO/TFRecord parçalanmış (sharded) dosyaları kullanın veya bir POSIX dosya sistemi bağlayın. Büyük veri setleri için yerel disk kullanımını ve başlangıç süresini azaltmak amacıyla eğitim verilerini doğrudan S3’ten akışla almak için Pipe modunu seçin; eğitimin rastgele erişim gerektirdiği veya veri setinin tamamına bir EBS biriminde ihtiyaç duyduğunuz durumlarda File modunu kullanın. Birden çok örnekte yüksek verim ve POSIX semantiği için Amazon FSx for Lustre veya Amazon EFS bağlayın; FSx, yüksek performanslı paralel okumalar için daha iyidir. Sık yapılan hatalar arasında veriyi ana makineler arasında parçalayamama (bu durum yinelenen verilere neden olur), örnek başına S3 verimini abartma ve paralelliği artırırken yığın boyutu (batch-size) ve öğrenme oranı (learning-rate) ölçeklendirme kurallarını göz ardı etme yer alır.

Spot eğitimi, kontrol noktası oluşturma ve maliyet optimizasyon stratejileri

Yönetilen Spot eğitimi, eğitim tasarımınız kesintileri tolere edebiliyorsa maliyeti önemli ölçüde düşürebilir. Yönetilen spot’u SageMaker Estimator aracılığıyla (use_spot_instances=True) ve kontrol noktası oluşturma (checkpointing) ile yapılandırın: kalıcı bir checkpoint_s3_uri ve yerel bir checkpoint_dir sağlayın ve yeniden yapılacak iş süresini sınırlamak için kontrol noktalarını yeterli sıklıkta kaydedin. İşin, kesintiye uğrayan örnekleri spot penceresi içinde yeniden deneyebilmesi için max_wait’i max_run’dan önemli ölçüde daha yüksek ayarlayın. Çerçeveler için, atomik kontrol noktası yazma işlemleri ve en son S3 kontrol noktasını inceleyen, optimize edici (optimizer) ve zamanlayıcı (scheduler) durumunu geri yükleyen, ardından eğitime devam eden sağlam bir devam etme mantığı uygulayın. Kontrol noktası sıklığı, yazma yükü ile potansiyel olarak boşa harcanan işlem gücü arasında bir denge kurmalıdır; uzun epoch’lar veya çok büyük modeller için, gradyan biriktirme anlık görüntüleri (gradient accumulation snapshots) veya adım tabanlı kaydetmeler kullanarak epoch ortasında kontrol noktası alın. Maliyet tuzakları arasında kontrol noktalarını S3’e kalıcı olarak kaydetmeyi unutmak (kesinti durumunda tam yeniden başlatmaya neden olur), geçici örnek depolamasına güvenmek ve yeniden denemeleri engelleyen max_wait’i max_run’a eşit ayarlamak yer alır. Ek işlem tasarrufu için spot’u karma hassasiyet (AMP) ile ve S3 yazma maliyetlerini ve devam etme gecikmesini azaltmak için daha küçük kontrol noktası yükleri (yalnızca ağırlıkları + optimize ediciyi kaydetme) ile birleştirin.

Hiperparametre optimizasyonu, ayarlama stratejileri ve pratik karar kriterleri

Etkili HPO (Hiperparametre Optimizasyonu), arama stratejisi, kaynak tahsisi ve erken durdurmayı bir araya getirir. SageMaker HyperparameterTuner, yapılandırılabilir ContinuousParameter, IntegerParameter ve CategoricalParameter aralıklarıyla Rastgele (Random) ve Bayesci (Bayesian) aramayı destekler; geniş arama uzayları için keşfi geniş bir alanda yapmak üzere rastgele arama ile başlayın, ardından umut vadeden bölgelerden yararlanmak için Bayesci optimizasyonu çalıştırın. Bütçeden tasarruf etmek için Hyperband veya SageMaker’ın yerleşik erken durdurma gibi erken durdurma yöntemlerini kullanın ve ilgili deneyler arasında sonuçları yeniden kullanmak için warm-start (önceden ısıtılmış başlangıç) ayarlaması yapın. Amaç metriklerini dikkatlice seçin (dengesiz görevler için doğrulama AUC’si, sınıf dengesizliği olan dolandırıcılık tespiti için F1, envanter stok tükenmesi senaryoları için özel maliyet ağırlıklı metrikler). Yaygın tuzaklar arasında, çok sayıda işin başarısız olmasına neden olan aşırı geniş aralıklar, aslında sürekli olan hiperparametreler için kategorik kodlama kullanmak ve kaynağa duyarlı HPO’yu ölçeklendirmemek yer alır: kaba bölgeleri bulmak için kısa, daha küçük instance’lı yoklama işleri ve ardından tam boyutlu GPU instance’larında daha uzun süreli çalıştırmalar. Dağıtık eğitim için hem algoritmik hiperparametreleri (öğrenme oranı, batch boyutu) hem de sistem düzeyindeki ayarları (gradyan biriktirme adımları, veri parçası sayısı) ayarlayın. Gürültülü ölçümleri tespit etmek için SageMaker Debugger ile enstrümantasyon yapın ve CloudWatch metriklerini kullanın; yüksek varyans olduğunda, yapılandırma başına tekrarları artırın veya medyan tabanlı seçim kullanın.

Pratik Problem: Kullanım Senaryosu

Senaryo: FinRetailer, SageMaker’da SKU başına binlerce 30 günlük talep tahmini çalıştırır; yıllarca süren günlük CSV’leri S3’te saklarlar ve toplu puanlama işlerinde çıkarım gecikmesini kabul edilebilir seviyede tutarken, kuyrukta yer alan (tail-demand) ürünlerde yüksek doğruluk gerektirirler.

Zorluk: Uzun geçmişlere ve dengesiz öneme sahip (stok tükenmesinin maliyeti stok fazlasından daha yüksektir) binlerce zaman serisini tahmin etmek, nadir görülen yüksek talep olaylarındaki doğruluğu korurken hesaplama maliyetini en aza indirmek.

Önerilen Yaklaşım:

  1. SageMaker yerleşik DeepAR’ı veya bir Script Mode Estimator içinde paketlenmiş özel bir PyTorch zamansal modelini (Transformer tabanlı) kullanın; eğitim verilerini parçalanmış (sharded) RecordIO/TFRecord dosyaları olarak saklayın ve yüksek verimli çoklu instance’lı eğitim için FSx for Lustre ile Dosya (File) modunu kullanın.
  2. Model mimarisini ve hiperparametreleri ayarlamak için daha küçük instance’lı dağıtık eğitimle (smddp veya Horovod) başlayın, Bayesci arama ve erken durdurma ile HyperparameterTuner’ı kullanın; amacı, eksik tahmini daha ağır şekilde cezalandıran ağırlıklı bir kantil kaybı (weighted quantile loss) olarak tanımlayın.
  3. checkpoint_s3_uri ve sık adım tabanlı checkpoint’ler ile yönetilen spot eğitimi (managed spot training) etkinleştirin; kesintileri tolere etmek ve en son S3 checkpoint’i ile devam etmek için max_wait > max_run olarak ayarlayın.
  4. Üretim çıkarımı için, işlem için optimize edilmiş (compute-optimized) instance’larda çok modelli uç noktalar (multi-model endpoints) veya eşzamansız toplu dönüştürme (asynchronous batch transform) işleri kullanarak toplu puanlama yapın; stok tükenmesi maliyetlerini hesaba katan işlem sonrası iş kuralları ve kalibre edilmiş bir eşik değeri uygulayın.

Gerekçe: DeepAR/transformer mimarilerini kullanmak birçok zaman serisini verimli bir şekilde yönetir; parçalanmış ikili formatlar ve FSx, dağıtık eğitim için G/Ç (I/O) darboğazlarını azaltır, özel bir amaca sahip Bayesci HPO, aramaları operasyonel maliyet metriklerine odaklar ve checkpoint’li spot eğitimi, ilerlemeden ödün vermeden maliyeti düşürür.


Zaman Serileri ve Tahminleme · Tüm alanlar · Dağıtım

Bu soruları çözün → · ExamRoll.io’da süreli pratik →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Sınavınızı geçin →

Amazon'a göz atın →

Related guides

Hepsi bir arada erişim

Tek abonelik. Her sınav.

Her plan, sınırsız cevap aramayı, pratik testlerini, AI açıklamalarını ve tam kaynak kütüphanesini — 20'den fazla dilde — açar.

Aylık
24.87
Just €0.83/day
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

En iyi değer
12 ay
179.87
Just €0.49/daySave 40%
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

✓ Ücretsiz plan dahil · ✓ İstediğiniz zaman iptal edin · ✓ Tüm planlar tam ürünü açar