Amazon MLS-C01: Keşifsel Veri Analizi ve Görselleştirme — Çalışma kılavuzu

Şunun bir parçası: AWS Machine Learning Specialty MLS-C01 — Çalışma kılavuzu. Doğrulanmış cevaplarla şurada pratik yapın: Amazon sınav merkezi, veya şurada süreli deneme sınavları çözün: ExamRoll.io.

Dağılımlar, Dönüşümler ve Özellik Ölçeklendirme

Ham özellik dağılımlarını anlamak, Keşifçi Veri Analizinin (EDA) temelidir. Her bir değişkeni bir SageMaker Studio not defterinde veya bir SageMaker Processing işinde (scikit-learn/pandas ile ml.m5.xlarge) histogramlar, çekirdek yoğunluk tahminleri ve kantil özetleri ile profillemeye başlayın. Logaritmik dönüşümler, Box–Cox, Yeo–Johnson ve sıra tabanlı dönüşümler (kantil dönüştürücü) sağa çarpık veriler için uygundur, ancak Box–Cox kesinlikle pozitif değerler gerektirir ve sıfırlarda başarısız olur. Sık karşılaşılan tuzaklar arasında, sıfırları dengelemeden log/Box–Cox uygulamak ve model çıktılarını yorumlarken dönüşümleri tersine çevirmeyi unutmak yer alır. Standardizasyon (sıfır ortalama, birim varyans), mesafe tabanlı yöntemlerden (k-means, PCA, SVM) ve regülarize edilmiş doğrusal modellerden önce esastır; Min-Maks ölçeklendirme ise sınırlı aktivasyonlara sahip sinir ağları için kullanışlıdır. Dağıtım yaparken, çevrimiçi ve toplu çıkarımın aynı ön işlemeyi kullanması için dönüştürücüleri SageMaker Feature Store’da veya model artefaktları olarak kalıcı hale getirin. Çok büyük S3 veri kümelerini profillemek ve özet istatistikler oluşturmak için AWS Glue veya Glue DataBrew’u; tabakalı örneklemleri sorgulamak için ise Athena’yı kullanın. Karar kriterleri algoritmanın hassasiyetine bağlıdır: ağaç toplulukları ölçeklenmemiş özellikleri tolere edebilirken, doğrusal ve mesafe tabanlı yöntemler edemez. Son olarak, dayanıklı istatistikler (medyan, IQR - Çeyrekler Arası Açıklık) ile aykırı değerleri ve ağır kuyrukları kontrol edin ve noktaları körü körüne kaldırmak yerine kırpma (clip), winsorize etme veya ayrı olarak modelleme (segmentasyon) seçeneklerini değerlendirin.

Artık Analizi, Öğrenme Eğrileri ve Teşhis Testleri

Artıklar (rezidüler), modelin yanlış belirlendiğini ortaya koyar: sıfırdan farklı ortalama, değişen varyans (heteroskedastisite), otokorelasyon veya doğrusal olmama durumu teşhis edilmelidir. SageMaker Studio’da artıkları tahmin edilen değerlere ve temel özelliklere karşı çizin; otokorelasyon için Durbin–Watson testini hesaplayın ve zaman serisi artık korelasyonu için Ljung–Box testini kullanın. Regresyon için, değişen varyansı gösteren huni şekillerini arayın; varyans stabilize edici dönüşümler veya heteroskedastik modeller (ör. hedefi ayarlanmış XGBoost veya olasılıksal tahmin) uygulayın. Öğrenme eğrileri—eğitim ve doğrulama hatasının eğitim kümesi boyutuna karşı grafikleri—yüksek varyansı (aşırı öğrenme) veya yüksek yanlılığı (eksik öğrenme) tespit eder. Epok başına tensörleri ve CloudWatch metriklerini yakalamak için SageMaker Debugger’ı kullanın ve eğitim kaybı azalırken doğrulama kaybı artarsa tetiklenmesi için bir CloudWatch alarmı ekleyin. Sık karşılaşılan tuzaklar arasında zamansal veriler için rastgele çapraz doğrulama kullanmak (zaman tabanlı bölmeler kullanın) ve dengesiz kümelerde doğruluk (accuracy) ile değerlendirme yapmak (precision–recall veya AUC-PR’ı tercih edin) yer alır. Hiperparametre ayarı için kararlarınızı bu teşhislere dayandırın: doğrulama (validation) farkı devam ederse regülarizasyonu artırın, veri ekleyin veya model karmaşıklığını azaltın; her iki hata da yüksekse kapasiteyi artırın veya yeni özellikler ekleyin. Tekrarlanabilirlik için teşhis grafiklerini ve metrikleri SageMaker Experiments aracılığıyla kalıcı hale getirin.

Boyut Azaltma, PCA, Özdeğer Analizi ve Kümeleme

Boyut azaltma, gürültüyü azaltır ve yorumlanabilirliği artırır. Ölçeklendirme sonrası PCA veya randomized SVD (EMR/Glue üzerinde scikit-learn veya Spark MLlib) uygulayın; bileşen sayısını seçmek için açıklanan varyans oranını inceleyin ve bileşenleri orijinal özelliklerle eşleştirmek için yükleri (loadings) gözden geçirin. Özvektör işaretleri keyfidir—mutlak yükleri yorumlayın ve özellikleri büyüklüklerine göre gruplandırın. Yüksek derecede doğrusal olmayan yapılar için, t-SNE veya UMAP’ı yalnızca görselleştirme amacıyla kullanın, dikkatli bir çapraz doğrulama olmaksızın modeller için bir ön işleme adımı olarak kullanmayın. Kümeleme için, küresel kümeler için k-means (ölçeklendirme gerekir), yumuşak atamalar için Gaussian Mixture Models ve yoğunluk tabanlı şekiller için DBSCAN’i seçin; karşılaştırma yapmak için siluet skorlarını ve Davies–Bouldin indeksini çalıştırın. Büyük veri kümelerinde, SageMaker’ın yerleşik k-means algoritmasını (GPU/CPU örnek tipleri) kullanın veya SageMaker Processing’de mini-batch k-means çalıştırın. One-hot ile kodlanmış kategorik özelliklere PCA uygulama tuzağına dikkat edin—bunun yerine özellik hashleme (feature hashing) veya gömme (embedding) katmanlarını değerlendirin. k değerine karar vermek için dirsek grafikleri, açıklanan varyans grafikleri ve alt örneklemler arasındaki küme kararlılığını kullanın. Sonraki aşamadaki gerçek zamanlı puanlama ve segment tabanlı modellerin tutarlı dönüşümler kullanması için küme merkezlerini ve PCA dönüştürücülerini SageMaker Feature Store’da kalıcı hale getirin.

Sürüklenme ve Performans için Görselleştirme, İzleme ve AWS Entegrasyonu

Görselleştirme hem keşif amaçlı hem de operasyoneldir: anlık grafikler için SageMaker Studio’da matplotlib/seaborn ve canlı performans metriklerini izleyen panolar için Amazon QuickSight kullanın. Model sürüklenmesi ve veri kalitesi için, dağılımsal kaymaları, özellik önemindeki değişiklikleri ve yanlılığı tespit etmek amacıyla SageMaker Model Monitor ve SageMaker Clarify aracılığıyla temsili bir eğitim örneğiyle temeller (baseline) oluşturun. Model Monitor’ü bir Processing işi artefaktından türetilen bir temelle yapılandırın ve dağıtılan uç noktalarda saatlik/günlük kontrollerle sürekli izlemeyi etkinleştirin; CloudWatch olayları ve SNS, uyarıları tetikleyebilir. Akış halinde veri alımı ve analizi için, JSON’u Parquet’ye format dönüşümüyle S3’te kalıcı kılmak üzere Kinesis Data Firehose’u kullanın (kayıt formatı dönüşümünü ve Glue Catalog entegrasyonunu etkinleştirin) veya özel dönüşümler için bir Lambda ekleyin. Sıkıştırılmış dosyalar üzerinde neredeyse gerçek zamanlı SQL için, veriyi Glue Data Catalog’da bölümleyin ve kaydedin ve yeni S3 nesnesi geldiğinde Lambda aracılığıyla bölümleri yenileyerek Athena ile sorgulayın. Yaygın tuzaklar arasında temelleri sürümlememek, şema evrimini göz ardı etmek (Glue Schema Registry kullanın) ve yalnızca toplu metriklere güvenmek yer alır—yerel bozulmayı tespit etmek için her zaman özellik başına sürüklenmeyi ve segment başına performansı dahil edin. Hiperparametre değişikliklerini sürüklenme olaylarıyla ilişkilendirmek ve köken takibini (lineage) sürdürmek için SageMaker Experiments ve Model Monitor’ü birlikte kullanın.

Pratik Problem: Kullanım Senaryosu

Senaryo: Acme Retailer, görselleştirme için SageMaker Studio, S3 veri gölü, Kinesis Firehose veri alımı, Glue Data Catalog ve QuickSight içeren AWS ML yığınını kullanmaktadır. Ekip, müşteri demografilerini, oturum günlüklerini ve satın alımları S3’te JSON ve Parquet olarak saklamaktadır.

Zorluk: Önümüzdeki altı ay içinde müşteri kaybı (churn) yaşama olasılığı en yüksek olan müşteri segmentlerini belirlemek ve dağıtımdan sonra özellik dağılımlarının veya model performansının sürüklenip sürüklenmediğini tespit etmek için izleme mekanizması kurmak.

Önerilen Yaklaşım:

  1. Veriyi pandas/sklearn kullanarak örneklemek ve profillemek, uygun yerlerde log/Box–Cox dönüşümleri uygulamak ve ön işleme artefaktlarını SageMaker Feature Store’a kaydetmek için bir SageMaker Processing işi (ml.m5.xlarge) oluşturun.
  2. Boyutluluğu azaltmak için ölçeklemeden sonra PCA (scikit-learn veya Glue/EMR üzerinde Spark ML) hesaplayın, açıklanan varyansı ve yükleri (loadings) inceleyin ve segmentleri türetmek için SageMaker xgboost veya yerleşik k-means ile kümeleme yapın.
  3. Zamana duyarlı eğitim/doğrulama ayrımları kullanarak bir sınıflandırma modeli (SageMaker’da XGBoost veya TensorFlow’da küçük bir NN) eğitin, metrikleri SageMaker Experiments’e kaydedin ve dengesizlik için erken durdurma (early stopping) ve sınıf ağırlıklandırması (class-weighting) ayarlayın.
  4. SageMaker Endpoint ile dağıtım yapın, Processing işinden oluşturulan bir temeli kullanarak Model Monitor’ü etkinleştirin, saatlik sürüklenme kontrolleri ve SNS aracılığıyla bildirim gönderecek CloudWatch alarmları yapılandırın; segment düzeyindeki performansı ve sürüklenmeyi QuickSight’ta görselleştirin.

Gerekçe: Bu yaklaşım, segmentasyon için sağlam ön işleme, yorumlanabilir boyutluluk azaltma ve ölçeklenebilir kümelemeyi bir araya getirirken, SageMaker Model Monitor ve QuickSight veri ve performans sürüklenmesinin operasyonel olarak tespit edilmesini sağlar, Feature Store aracılığıyla tekrarlanabilir ön işleme ve kök neden analizi için izlenen deneyler sunar.


Veri Mühendisliği ve Özellik Mühendisliği · Tüm alanlar · Modelleme — Gözetimli ve Gözetimsiz (Klasik ML)

Bu soruları çözün → · ExamRoll.io’da süreli pratik →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Sınavınızı geçin →

Amazon'a göz atın →

Related guides

Hepsi bir arada erişim

Tek abonelik. Her sınav.

Her plan, sınırsız cevap aramayı, pratik testlerini, AI açıklamalarını ve tam kaynak kütüphanesini — 20'den fazla dilde — açar.

Aylık
24.87
Just €0.83/day
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

En iyi değer
12 ay
179.87
Just €0.49/daySave 40%
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

✓ Ücretsiz plan dahil · ✓ İstediğiniz zaman iptal edin · ✓ Tüm planlar tam ürünü açar