Amazon MLS-C01: Modelleme — Gözetimli ve Gözetimsiz (Klasik ML) — Çalışma kılavuzu
Şunun bir parçası: AWS Machine Learning Specialty MLS-C01 — Çalışma kılavuzu. Doğrulanmış cevaplarla şurada pratik yapın: Amazon sınav merkezi, veya şurada süreli deneme sınavları çözün: ExamRoll.io.
Gözetimli problemler için model seçimi ve mimari
Model seçimi, veri şekli ve üretim kısıtlamalarıyla başlar. Çok sayıda örneğe sahip doğrusal sinyal ve yorumlanabilir katsayılar için, düzenlileştirilmiş doğrusal veya lojistik regresyon (SageMaker LinearLearner veya scikit-learn ElasticNet) hızlıdır ve inceleyebileceğiniz katsayılar üretir. Doğrusal olmayan etkileşimler baskın olduğunda, XGBoost (SageMaker XGBoost container) veya LightGBM gibi ağaç toplulukları, yoğun özellik ölçeklendirme olmadan heterojenliği yakalar; aşırı öğrenmeyi (overfitting) kontrol etmek için eta (learning_rate), max_depth, subsample, colsample_bytree ve düzenlileştirme parametreleri olan alpha/lambda’yı ayarlayın. SVM’ler, küçük ila orta ölçekli, iyi ölçeklendirilmiş özellik setlerinde etkili olabilir ancak büyük veri setleri maliyetli olduğundan genellikle SageMaker üzerinde özel container’lar veya scikit-learn ScriptMode gerektirir; özellikleri standartlaştırmayı ve kernel/düzenlileştirme (C, gamma) parametrelerini dikkatlice seçmeyi unutmayın. Naive Bayes, yüksek boyutlu seyrek kategorik/metin girdileri için hızlı bir temel modeldir; koşullu bağımsızlık varsayar ve korelasyonlar güçlü olduğunda başarısız olur. Binlerce özellik veya çok büyük veri setleri için boyut azaltma (PCA) veya özellik hash’leme (feature hashing) kullanın ve GPU tabanlı derin ağlar kullanıyorsanız ml.c5 veya ml.p3 instancelarında dağıtık eğitimi tercih edin. Gerçek zamanlı çıkarım için SageMaker endpoint’leri ile veya toplu tahminler için Batch Transform ile dağıtım yapın; maliyeti düşürmek için çok sayıda modeli yönetirken Multi-Model Endpoints kullanın.
Metrikler, dengesizlik, kalibrasyon ve dağıtım ödünleşimleri
Doğruluk (accuracy) baştan çıkarıcıdır ancak dengesiz problemlerde yanıltıcıdır; dengeli sınıf vurgusu için precision, recall, F1, ROC AUC gibi sınıfa duyarlı metrikleri ve pozitif sınıf nadir olduğunda PR AUC’yi tercih edin. Olasılıklar üretirken, güvenilirlik diyagramları (reliability diagrams) ve Brier skoru ile kalibrasyonu kontrol edin; çevrimdışı olarak uygulanan Platt ölçeklemesini veya isotonik kalibrasyonu (scikit-learn CalibratedClassifierCV) kullanın veya ham skorları çıktı alıp bir son işleme adımı uygulayarak SageMaker eğitimi içinde kalibrasyon yapın. Sınıf dengesizliğini ele almak için, örnek ağırlıklandırmayı (SageMaker LinearLearner ve birçok eğitim betiğinde desteklenir), eğitim sırasında hedeflenmiş aşırı örneklemeyi (oversampling - SMOTE) veya eksik örneklemeyi (undersampling) ve sinir ağları için kayıp fonksiyonu yeniden ağırlıklandırmayı (loss re-weighting) veya focal loss’u tercih edin. Dolandırıcılık olasılıklarının neredeyse gerçek zamanlı olarak skorlanması için, düşük çıkarım gecikmesine sahip bir instance türü (ml.m5.large veya CPU optimize edilmiş instancelar) kullanarak model gecikmesini optimize edin, modelleri kompakt tutun (budama yapın veya damıtılmış modeller kullanın) ve güncellemeleri güvenli bir şekilde dağıtmak için SageMaker endpoint’leri aracılığıyla multi-model endpoint’leri veya A/B trafik kaydırmayı kullanın. SageMaker Model Monitor ile üretimdeki sapmayı (production drift) ve veri kalitesini izleyin ve metriklerin CloudWatch’a kaydedilmesini otomatikleştirin.
Özellik mühendisliği, çoklu doğrusallık ve düzenlileştirme
Çoklu doğrusallık (multicollinearity), doğrusal modellerdeki katsayı tahminlerinin varyansını şişirir; bunu varyans şişirme faktörü (VIF) ve ikili Pearson korelasyonu ile tespit edin ve gereksiz özellikleri kaldırarak veya boyut azaltma (PCA, SVD) kullanarak azaltın. Düzenlileştirme (regularization) ilkeli bir çözümdür: L2 (Ridge) katsayıları küçültür, L1 (Lasso) özellik seçimi için seyreklik sağlar ve ElasticNet her ikisini birleştirir—bunlar scikit-learn ve SageMaker LinearLearner’da mevcuttur. Güçlü çarpıklığa sahip sayısal özellikler için varyansı stabilize etmek ve doğrusal model uyumunu iyileştirmek amacıyla log veya Box–Cox dönüşümleri uygulayın; ağaç topluluklarının monoton dönüşümlere karşı dayanıklı olduğunu, SVM’lerin ve sinir ağlarının ise kararlı bir eğitim için standartlaştırılmış girdilere (StandardScaler) ihtiyaç duyduğunu unutmayın. Yüksek kardinaliteye sahip kategorik özellikler, hedef kodlama (target encoding), gömme (embeddings) veya hash’lemeden fayda görür; hedef kodlama kullanıldığında, kodlamaları çapraz doğrulama (cross-validation) katmanları içinde hesaplayarak veya ayrı bir holdout seti kullanarak sızıntıyı (leakage) önleyin. Hem eğitim hem de çıkarım için tutarlı özellik dönüşümlerini merkezileştirmek ve sunmak için SageMaker Feature Store’u kullanın ve üretimdeki dönüşümlerin eğitimdekilerle eşleşmesi için ön işleme kodunu model paketleri veya Docker imajları ile kalıcı hale getirin.
Gözetimsiz yöntemler, kümeleme, anomali tespiti ve yorumlanabilirlik
Kümeleme ve anomali tespiti, keşif amaçlı araçlar ve gözetimli modelleme için ön işleme adımlarıdır. K-means (SageMaker k-means) hızlıdır ancak küresel kümeler varsayar ve ölçeklendirilmiş öznitelikler gerektirir; inertia belirsiz olabileceğinden, silhouette scores veya elbow plots ile k’yı dikkatli bir şekilde seçin. Yoğunluk tabanlı yöntemler (DBSCAN) ve hiyerarşik kümeleme, küresel olmayan yapıları yakalayabilir ancak hesaplama açısından daha maliyetlidir. Büyük ölçekte anomali tespiti için, akan sensör verileri için SageMaker Random Cut Forest’ı ve neredeyse gerçek zamanlı puanlama için Kinesis/Lambda işlem hatlarını değerlendirin; hassasiyeti kontrol etmek için ağaç sayısını ve örneklem boyutunu ayarlayın. Yorumlanabilirlik araçları kritik öneme sahiptir: ağaç modelleri için modele özgü öznitelik önemini ve yerel açıklamalar ile küresel etki özetleri için SHAP değerlerini (SageMaker Clarify veya SHAP paketi) kullanın. Yaygın tuzaklara dikkat edin: zamana göre sıralanmış verileri rastgele bölerken zamansal sızıntı, dengesiz veri setlerinde doğruluğa aşırı güvenme ve Naive Bayes için bağımsızlık varsayımı. Dağıtım için, gerektiğinde özel algoritmaları Docker’da paketleyin, tahmin (prediction) ve sağlık (health) uç noktalarını (endpoint) kullanıma açın ve uç nokta trafiğini bölerek canary rollouts düzenleyin.
Pratik Problem: FleetSight Logistics — Kamyon Görüntüleri Üzerinde Keşif Amaçlı Makine Öğrenmesi
Senaryo: FleetSight, S3’te depolanan günde yaklaşık 100 GB kamyon görüntüsü toplamakta ve deneyler için SageMaker Studio’yu, görüntü etiketleme için ise SageMaker Ground Truth’u kullanmaktadır. Kusur tespiti için hafif ML yeteneklerine ve ileride ölçeklendirme niyetine ihtiyaçları var.
Zorluk: Uygulanabilir gözetimli/gözetimsiz kullanım senaryolarını ve sınırlı etiketlerle başlangıç modellerini eğitmek ve uyarılar için neredeyse gerçek zamanlı çıkarım yapmak üzere düşük maliyetli bir işlem hattı belirlemek.
Önerilen Yaklaşım:
- Bir başlangıç setini etiketlemek için aktif öğrenme ile SageMaker Ground Truth’u kullanın; etiketlenmiş verileri S3’te depolayın ve öznitelikleri SageMaker Feature Store’a kaydedin.
- Görüntüden türetilmiş sensör meta verileri ve basit görüntü gömülmeleri (embedding) üzerinde SageMaker Random Cut Forest kullanarak gözetimsiz anomali tespiti ile başlayın (gömülmeleri bir GPU
ml.p3.2xlargekullanarak SageMaker Notebook’ta önceden eğitilmiş bir CNN ile çıkarın). - Etiketlenmiş alt küme üzerinde transfer öğrenmeyi kullanarak (SageMaker yerleşik TensorFlow veya PyTorch container’ı) hafif bir gözetimli sınıflandırıcı eğitin; hızlı temel modeller (baseline) için, gömülmeleri çıkarın ve CPU örneklerinde bir XGBoost modeli (SageMaker XGBoost) eğitin.
- XGBoost modelini, maliyet verimliliği için eşzamansız çıkarım (async inference) ile bir SageMaker uç noktasına veya bir Multi-Model Endpoint’e dağıtın; SageMaker Model Monitor ile girdileri ve tahminleri izleyin ve Ground Truth aracılığıyla etiketlemeyi yineleyin.
Gerekçe: Çok sayıda etiket olmadan aday anomalileri bulmak için gözetimsiz gömülme + Random Cut Forest kullanın, ardından kompakt ve hızlı çıkarım için transfer öğrenme ve XGBoost aracılığıyla gözetimli modelleri başlatın; SageMaker hizmetleri entegre, ölçeklenebilir bir geliştirme ve izleme iş akışı sağlar.
← Keşifsel Veri Analizi ve Görselleştirme · Tüm alanlar · Derin Öğrenme ve Bilgisayarlı Görü →
Bu soruları çözün → · ExamRoll.io’da süreli pratik →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Sınavınızı geçin →