Amazon MLS-C01: Veri Mühendisliği ve Özellik Mühendisliği — Çalışma kılavuzu

Şunun bir parçası: AWS Machine Learning Specialty MLS-C01 — Çalışma kılavuzu. Doğrulanmış cevaplarla şurada pratik yapın: Amazon sınav merkezi, veya şurada süreli deneme sınavları çözün: ExamRoll.io.

Veri alımı, depolama ve dosya formatları

ML’e hazır bir veri gölü tasarlamak, doğru veri alım modelini ve kalıcı formatı seçmekle başlar. Gerçek zamanlı telemetri için Kinesis Data Streams (düşük gecikmeli işleme) veya Kinesis Data Firehose (yönetilen teslimat) kullanın. Firehose, doğrudan Amazon S3’e teslimat yapabilir ve AWS Glue Schema Registry ile bir Lambda dönüşümüyle birleştirildiğinde sunucu tarafında kayıt formatını Parquet/ORC’ye dönüştürebilir; özel zenginleştirme veya saniye altı yanıtlara ihtiyacınız varsa Data Streams + Kinesis Data Analytics veya Lambda’yı seçin. Toplu taşıma için AWS DataSync, RDS/OLTP kaynakları için Database Migration Service (DMS) veya terabayt ölçeğindeki çevrimdışı transferler için Snowball kullanın. S3’te, analitik iş yükleri için sütun bazlı Parquet (predicate pushdown, Snappy gibi sıkıştırma, sorgu desenlerine göre ayarlanmış bölümleme anahtarları) ve yüksek verimli sıralı okumalar için TensorFlow pipeline’larını beslerken TFRecord formatında depolayın. Küçük dosya patlamasına dikkat edin: büyük veri çerçeveleri için boyutlandırılmış S3 nesneleri (onlarca ila yüzlerce MB) üretmek için yazmaları arabelleğe alın (Firehose arabelleğe alma, Glue toplu işleme). Şema evrimi yaygındır: şemaları versiyonlamak için Glue Catalog ve Schema Registry kullanın; maliyetli tam tablo taramalarından kaçınmak için bölümleme ve adlandırma kurallarını kullanın. Yaygın bir tuzak, tüm veri setlerini işlem düğümlerine kopyalayan alt süreçlerde File modunu kullanmaktır; veri setleri milyonlarca kayıttan oluştuğunda toptan kopyalama yerine akış (SageMaker Pipe modu), Redshift Spectrum veya Athena’yı tercih edin.

Sunucusuz ve cluster ETL: Glue, EMR, Redshift ve SageMaker

ETL seçimleri ölçek, özelleştirme, maliyet profili ve kütüphane ihtiyaçlarına bağlıdır. AWS Glue, kataloglama, crawler’lar ve yerleşik iş orkestrasyonu ile sunucusuz Spark ETL sağlar—yönetilen ölçeklendirme istediğiniz sık, olay güdümlü dönüşümler için mükemmeldir. Özel Spark/Hadoop ekosistemlerine, uzun süreli çalışan cluster’lara veya özelleşmiş kütüphanelere (GraphX, MLlib özel derlemeleri) ihtiyacınız olduğunda ve S3’ü temel veri gölü olarak kullanabildiğinizde EMR tercih edilir. Veri alımı olmadan analitik yapmak için, S3’teki Parquet/ORC’yi doğrudan sorgulamak üzere Redshift Spectrum veya Athena kullanın; Redshift, karmaşık join’ler ve BI iş yükleri için daha iyidir. Model verisi hazırlama için, SageMaker Processing işleri, ölçeklenebilir Spark veya Python ön işlemesini çalıştırmak için yönetilen container’lar sağlar, bu da ön işleme kodunun eğitime yakın çalışmasını ve eğitim işiyle birlikte versiyonlanabilmesini temin eder. SageMaker eğitimini yerleşik algoritmalarla başlatırken, en azından eğitim imajını, IAM rolünü, instance_type/count’u ve eğitim verisi için S3 URI’sini sağlayın; milyonlarca kayıtlık veri setleri için kayıtları akışla göndermek ve EBS kopyalamasından kaçınmak için Pipe modunu düşünün. Yaygın tuzaklar: aşırı düşük gecikmeli dönüşümler için Glue seçmek (bunun yerine Lambda/Kinesis kullanın) veya Redshift Spectrum/Athena’nın yeterli olacağı durumlarda S3 verilerini gereksiz yere HDFS/EBS’ye kopyalamak.

Özellik mühendisliği, dönüşüm pipeline’ları ve seçimi

Özellik mühendisliği tekrarlanabilir ve sızıntıdan yalıtılmış olmalıdır. Eğitim ve çıkarım sırasında aynı dönüşümlerin uygulanabilmesi için ön işlemeyi üretim seviyesinde pipeline’lar (scikit-learn Pipeline, Spark ML pipeline’ları veya SageMaker Processing + Feature Store) olarak uygulayın. Eksik verileri strateji seçimiyle ele alın: küçük boşluklar için basit tamamlama (ortalama/medyan/mod); diğer özellikler eksik değerleri tahmin ettiğinde model tabanlı yöntemler (KNN, yinelemeli MICE). Gradyan tabanlı modeller için sayısal özellikleri StandardScaler veya MinMax ile ölçeklendirin; aykırı değerler baskınsa dayanıklı ölçeklendirme uygulayın. Kategorik değişkenler için, düşük kardinaliteli olanlarda one-hot encoding, yüksek kardinaliteli kategorilerde ise target encoding veya öğrenilmiş embedding’ler seçin (derin modellerde Embeddings veya boyutsallık kontrolü için feature hashing kullanın). Metin için, tutarlı normalleştirme yapın (küçük harf, noktalama işaretleri, tokenizasyon); embedding’ler için Word2Vec/BlazingText veya doğrusal modeller için TF-IDF/seyrek pipeline’lar kullanın; SageMaker’daki BlazingText, skip-gram/CBoW’u destekler ve büyük ölçekte verimlidir. Özellik seçimi için, L1 regülarizasyonu, ağaç tabanlı önem (XGBoost/RandomForest), karşılıklı bilgi veya özyinelemeli özellik eleme kullanın ve seçim yanlılığından kaçınmak için özellik seçimini her zaman çapraz doğrulama (cross-validation) katmanları içinde gerçekleştirin. En büyük pratik tuzak sızıntıdır: asla gelecekteki hedef bilgisini kullanarak özellikler türetmeyin veya veri setini bölmeden önce tamamına ön işleme uygulamayın.

Güvenlik, erişim kontrolü, yönetişim ve operasyonel izleme

Güvenli ve denetlenebilir veri mühendisliği zorunludur. S3 ve EBS birimleri için SSE-KMS kullanarak bekleyen verileri şifreleyin ve ek kontrol için istemci tarafı şifreleme kullanın; anahtarları AWS KMS CMK’leri ile yönetin ve en az ayrıcalık ilkesi için anahtar politikaları ve grant’ler kullanın. Bir S3 VPC uç noktası ve hassas bucket politikaları veya VPC principal’ına göre kapsamı belirlenmiş S3 Erişim Noktaları kullanarak S3 veri kümelerini bir VPC ile sınırlandırın; en az ayrıcalık ilkesini uygulamak için SageMaker, Glue, EMR veya Lambda’ya eklenmiş IAM rolleriyle birleştirin. Hassas PII (Kişisel Tanımlayıcı Bilgiler) için tokenizasyon veya alan düzeyinde şifreleme kullanın ve KMS’in anahtarları politikaya göre döndürdüğünden emin olun. Operasyonel olarak, SageMaker ve Glue API aktivite günlüğü için CloudTrail’i ve iş metrikleri için CloudWatch’u etkinleştirin; sapma tespiti için SageMaker Model Monitor’ü kullanın ve modelleri yeniden eğitmek veya yanlılık kontrolü yapmak için alarmlar ayarlayın. Veri yönetişimi, Glue Data Catalog veya kurumsal bir meta veri deposu, veri kökeni (data lineage) ve yaşam döngüsü politikaları için etiketleme gerektirir; soğuk veriler için S3 yaşam döngüsü kurallarını (glacier’e geçiş) uygulayın. Yaygın yanlış anlamalar arasında, yalnızca güvenlik gruplarının yeterli olduğunu varsaymak (ayrıca IAM, bucket politikaları ve VPC uç noktalarına da ihtiyacınız vardır) veya eğitim örneği birimlerinde şifrelemeyi etkinleştirmeyi unutmak yer alır—eğitim işi tanımlarına her zaman EBS şifrelemesini dahil edin ve erişimi en az ayrıcalıklı rollerle doğrulayın.

Pratik Problem: Kullanım Senaryosu

Senaryo: MetroRetail, müşteri tıklama akışının (clickstream) Kinesis Data Streams’e alındığı, S3’te saklandığı ve modellerin SageMaker’da eğitildiği bir AWS ML ortamı işletmektedir. Veri gölü, analistler için Glue Catalog ve Athena’yı kullanmaktadır.

Zorluk: Akış halindeki CSV tıklama olaylarını şema evrimiyle S3’te Parquet’e dönüştürmek, bir öneri modeli için güvenilir özellik vektörleri üretmek ve işlem hattının çok gigabaytlık veri kümelerini eğitim örneklerine kopyalamadan ölçeklenmesini sağlamak.

Önerilen Yaklaşım:

  1. Veri alımı için Kinesis Data Streams kullanın, hafif doğrulama yapmak ve kayıtları bir Kinesis Data Firehose teslimat akışına iletmek için bir Lambda consumer ekleyin. Bu akışı, JSON/CSV’yi Parquet’e dönüştürmek ve bölümlenmiş Parquet dosyalarını S3’e yazmak için Glue Schema Registry ile yapılandırın (arabellek ipuçları ~64–128 MB’a ayarlanmalıdır).
  2. Parquet’i AWS Glue’de kataloglayın; tekrarlanabilir özellik işlem hatları oluşturmak için Glue ETL işlerini (sunucusuz Spark) veya SageMaker Processing’i (Spark container) kullanın. Bu süreçte, yüksek kardinaliteye sahip item_id için atama (eğik sayısallar için medyan), StandardScaler ve kategorik gömme (embedding) uygulayın.
  3. Çevrimiçi özellik vektörlerini SageMaker Feature Store’da (düşük gecikmeli aramalar için çevrimiçi mağaza) ve çevrimdışı özellikleri S3’te (Parquet aracılığıyla özellik deposu çevrimdışı mağazası) saklayın. Verileri akışla almak ve tam kopyalardan kaçınmak için S3 Parquet manifestolarını işaret eden Pipe modunu kullanarak SageMaker’da eğitim yapın.
  4. S3’ü SSE-KMS ile güvence altına alın, VPC için bir S3 VPC uç noktası ve sıkı bucket politikaları kullanarak erişimi kısıtlayın ve aktivite günlüğü ile sapma uyarıları için CloudTrail + SageMaker Model Monitor’ü etkinleştirin.

Gerekçe: Bu yaklaşım, ölçeklenmek için yönetilen akıştan Parquet’e dönüştürme ve sunucusuz ETL’den yararlanır, eğitim ve çıkarım arasında tutarlılık için Feature Store’u kullanır, Pipe modu ile maliyetli veri hareketini önler ve üretime hazır olmak için şifreleme ve en az ayrıcalıklı erişimi zorunlu kılar.


Tüm alanlar · Keşifsel Veri Analizi ve Görselleştirme

Bu soruları çözün → · ExamRoll.io’da süreli pratik →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Sınavınızı geçin →

Amazon'a göz atın →

Related guides

Hepsi bir arada erişim

Tek abonelik. Her sınav.

Her plan, sınırsız cevap aramayı, pratik testlerini, AI açıklamalarını ve tam kaynak kütüphanesini — 20'den fazla dilde — açar.

Aylık
24.87
Just €0.83/day
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

En iyi değer
12 ay
179.87
Just €0.49/daySave 40%
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

✓ Ücretsiz plan dahil · ✓ İstediğiniz zaman iptal edin · ✓ Tüm planlar tam ürünü açar