Amazon MLA-C01: Bilgisayarlı Görü, NLP ve Özelleştirilmiş ML — Çalışma kılavuzu

Şunun bir parçası: AWS Machine Learning Engineer Associate MLA-C01 — Çalışma kılavuzu. Doğrulanmış cevaplarla şurada pratik yapın: Amazon sınav merkezi, veya şurada süreli deneme sınavları çözün: ExamRoll.io.

Temel kavram

AWS’teki bilgisayarla görü ve NLP çözümleri üç katmanlı konuya dayanır: veri alımı ve güvenliği, öznitelik ve etiket hazırlığı ve model yaşam döngüsü (eğitim, kayıt defteri, dağıtım, izleme). Görüntü sınıflandırma ve nesne tespiti için eğitim iş akışları; sıkı şifreleme ve ağ denetimleriyle Amazon S3’te etiketlenmiş varlıkların depolanmasına, nesne tespiti için Pascal VOC / COCO gibi notasyon formatlarına ve yüksek verimli eğitim için RecordIO veya TFRecord’a odaklanır. Metin sınıflandırma ve adlandırılmış varlık tanıma (NER) için girdiler genellikle token’lara ayrılmış diziler (transformer modelleri için WordPiece/BPE) veya etiketli, satırlarla ayrılmış JSON’dır; ön işleme, NER etiket hizalamasının tutarlı olması için Rekognition Textract çıktıları veya insan tarafından etiketlenmiş aralıklar kullanılırken token’dan karaktere ofsetleri korumalıdır. Tablosal dolandırıcılık modelleri için öznitelik mühendisliği; zaman pencereli toplamaya, kategorik kardinalite azaltmaya ve eğitim ile sunum arasında tutarlı kodlamaya odaklanır; merkezi bir dönüşüm (Feature Store veya Data Wrangler akışı) kullanmak, çevrimdışı eğitim ile çevrimiçi çıkarım arasındaki sapmayı (skew) önler.

Model oluşturma seçenekleri, özelleşmiş AWS servisleriyle eşleşir: Amazon SageMaker, yerleşik algoritmalar (XGBoost, Linear Learner, Random Cut Forest) ve framework’ler (MXNet, TensorFlow, PyTorch) için yönetilen container’lar sunar, ayrıca yanlılık ve açıklanabilirlik için SageMaker Clarify’ı sağlar. Amazon Rekognition, düşük operasyonel yükün gerekli olduğu durumlarda etiketleme, yüz/ünlü tespiti için önceden oluşturulmuş görüntü API’larını ve Rekognition Custom Labels aracılığıyla özel etiketler eğitimini kapsar. Belgelerden metin ve yapılandırılmış veri çıkarmak için Amazon Textract, OCR ve form/tablo çıkarma sağlar; duygu analizi, varlık tanıma veya konu modelleme gibi dil düzeyindeki görevler için Amazon Comprehend, yönetilen API’lar ve klinik NER için Comprehend Medical sunar. Üretim için kritik olan, ön işleme, model girdileri ve izlemenin tekrarlanabilir ve denetlenebilir olması için bu parçaları tutarlı bir pipeline’da birleştirmektir.

Anahtar servisler ve yapılandırma

Bilinmesi gereken temel AWS servisleri ve ilgili API/yapılandırma parametreleri şunlardır: Amazon SageMaker (TrainingJob, ModelPackage, ModelPackageGroup, ModelRegistry), SageMaker Pipelines (RegisterModel, CallbackStep, ConditionStep), SageMaker Model Monitor ve Clarify (BaselineConfig, DataConfig, ModelConfig, bias_config), Amazon Rekognition, Amazon Comprehend, Amazon Textract, AWS Glue ve Lake Formation. Güvenli ve yalıtılmış depolama için, S3’ü SSE-KMS kullanarak sunucu tarafı şifreleme ile yapılandırın (SSEKMSKeyId ile S3.PutBucketEncryption), SageMaker yürütme rolüne erişimi sınırlayan bucket politikaları ekleyin ve özel ağ üzerinden transferler için S3 için bir Gateway VPC uç noktası etkinleştirin. Eğitim işlerini başlatırken, instance’ların müşteri VPC’sinde çalışması için CreateTrainingJob’da VpcConfig parametresini (SecurityGroupIds ve Subnets) ayarlayın ve erişimi sınırlamak için NetworkIsolation ve InstanceMetadataServiceConfiguration’ı etkinleştirin.

Modelleri minimum operasyonel yük ile merkezi olarak yönetmek için, bir ModelPackageGroup oluşturarak ve CreateModelPackage aracılığıyla ModelApprovalStatus’u ‘PendingManualApproval’ olarak ayarlanmış ModelPackage versiyonları ekleyerek SageMaker Model Registry’yi kullanın. SageMaker Pipelines’a bir CallbackStep veya özel bir “ManualApproval” adımı ekleyerek manuel onay kapısını otomatikleştirin; pipeline harici bir sinyal bekler ve ardından dağıtım için ModelApprovalStatus’u ‘Approved’ olarak ayarlamak üzere UpdateModelPackage’ı çağırırsınız. Dağıtılmış gerçek zamanlı uç noktaların isteğe bağlı yanlılık veya sapma değerlendirmeleri için, yanlılık metrikleri için SageMaker Clarify’ı ve veri ve tahmin sapması için SageMaker Model Monitor’ü kullanın: CreateEndpoint’te DataCaptureConfig’i etkinleştirerek (EnableCapture, CaptureOptions, DestinationS3Uri) çıkarım yüklerini yakalayın ve ardından sapma metriklerini anında hesaplamak için Clarify SDK parametreleri olan DataConfig, ModelConfig ve bias_config ile CreateProcessingJob aracılığıyla bir Clarify işleme işi başlatın.

İlgili servisler şunları içerir:

Tasarım desenleri ve ödünleşimler

Dolandırıcılık tespiti gibi tablosal sınıflandırma işlemleri için pratik tasarım deseni, ham kaynakları ilişkisel tablolar için AWS Glue veya DMS kullanarak güvenli bir S3 data lake’inde merkezileştirmek, bunları Glue Data Catalog’da kataloglamak ve Lake Formation aracılığıyla erişimi zorunlu kılmaktır. Dönüşümler, SageMaker Data Wrangler akışlarında veya Glue ETL işleri olarak bir kez ifade edilir ve SageMaker Feature Store’da kalıcı hale getirilir, böylece aynı dönüşümler hem eğitim hem de çıkarım zamanında çalışır. Feature Store’u seçmek başlangıçta operasyonel adımlar ekler ancak sapmayı (skew) ve hata ayıklama süresini azaltır; doğrudan iş içi dönüşümlerin başlangıçtaki ek yükü daha düşüktür ancak tekrarlanabilirliği ve çevrimiçi özellik hesaplamasını zorlaştırır. Eğitim algoritmaları için, tablosal performansı ve ağırlık sütunlarına (weight columns) verdiği destek nedeniyle XGBoost (SageMaker tarafından sağlanan container) dolandırıcılık tespiti için güçlü bir varsayılandır; sınıf dengesizliğine karşı koymak için CreateTrainingJob’daki HyperParameters’ı kullanarak hiperparametreleri yapılandırın ve bir ağırlık sütunu geçirin veya scale_pos_weight’i ayarlayın. Bu, daha karmaşık yeniden örnekleme (resampling) pipeline’larını önler.

Bilgisayarlı görü için, hızlı iterasyona ihtiyacınız varsa ve etiketlenmiş veri sınırlıysa, Rekognition Custom Labels minimum operasyonla en hızlı yolu sağlar; maksimum kontrol ve özel mimariler için, MXNet/PyTorch ile SageMaker eğitimini kullanın ve veri setlerini S3 üzerinde RecordIO veya ImageFolder formatında saklayın. Nesne tespiti için, COCO formatında çıktı veren framework’lerle eğitim yapmayı tercih edin ve InstanceType=ml.p3.2xlarge veya daha yükseğini belirterek ve TrainingJob’un AlgorithmSpecification ve TrainingInputMode’unda MPI veya horovod yapılandırmasını ayarlayarak SageMaker dağıtık eğitiminden (distributed training) yararlanın. Ödünleşimler arasında iş hacmi (throughput) ve maliyet karşılaştırması yer alır: yönetilen spot instance’ları kullanan toplu işler (batch jobs) maliyeti düşürür ancak gecikme/sonlandırılma riski ekler; SageMaker Pipelines’daki pipeline önbelleğe alma (caching) özelliği, girdiler değişmediğinde tekrarlanan adım başlatmalarını azaltır, bu da gereksiz işlem (compute) başlatma süresini en aza indirir.

Sık karşılaşılan tuzaklar ve karar kriterleri

Sık karşılaşılan bir tuzak, ön işleme yapıtlarının merkezileştirilmemesidir. Tokenizasyon, NER için etiket eşlemesi veya kategorik kodlayıcılar eğitim ve çıkarımda farklı şekilde uygulanırsa, izlenmesi zor tahmin hatalarına yol açarsınız. Dağıtılan container’ın tam dönüşümleri alıp uygulayabilmesi için Feature Store kullanın veya ön işleme yapıtını (tokenizer, vocab.json, label_map) Model Registry’deki model paketiyle birlikte kalıcı hale getirin. Bir diğer yaygın hata, izleme için yetersiz veri yakalamadır: endpoint üzerinde DataCaptureConfig etkinleştirilmeden ve uygun bir ground-truth etiketleme iş akışı olmadan, Model Monitor sapma veya kalite metriklerini hesaplayamaz ve F1 skorundaki düşüşleri açıklamak tahmine dayalı hale gelir. Sınıf dengesizliği için, operasyonel olarak en az yoğun çözüm, örnekleme yanlılığına yol açabilen körü körüne yukarı/aşağı örnekleme yerine, algoritma destekli ağırlıklandırma kullanmaktır (örneğin XGBoost’un scale_pos_weight hiperparametresi veya eğitim verilerinde bir ağırlık sütunu sağlamak).

Pratik Problem: Kullanım Senaryosu

Şirket adı: MeridianPay. MeridianPay, S3’teki işlem günlüklerini ve şirket içi bir MySQL veritabanındaki müşteri profillerini birleştiren gerçek zamanlı bir dolandırıcılık tespit ardışık düzeni oluşturmalıdır. Gereksinimler arasında güvenli, yalıtılmış depolama, manuel onaylı merkezi bir model kaydı, ardışık eğitim çalışmalarında minimum başlangıç gecikmesi, toplama sonrası otomatik anomali tespiti ve görselleştirme, minimum operasyonla karma kategorik ve sayısal özellikleri destekleme, sınıf dengesizliğini ele alma ve isteğe bağlı olarak sapma ve yanlılık açısından izlenebilen bir üretim modeli bulunmaktadır.

  1. Verileri toplama ve güvence altına alma: şirket içi MySQL tablolarını şifreli bir S3 hazırlık alanına sürekli olarak çoğaltmak için AWS DMS kullanın, AWS Glue crawler’larını çalıştırın ve ortaya çıkan tabloları AWS Glue Data Catalog’a kaydedin. AWS Lake Formation ve S3 bucket policy’leri aracılığıyla erişimi zorunlu kılın; S3 için bir Gateway VPC Endpoint etkinleştirin ve SageMaker execution role’ünü en az ayrıcalıklı IAM ile yapılandırın. S3’te müşteri tarafından yönetilen bir KMS anahtarı ile SSE-KMS kullanın ve KmsMasterKeyId ile BucketEncryption’ı ayarlayın.

  2. Özellikleri dönüştürme ve saklama: dönüşümleri SageMaker Data Wrangler veya bir Glue ETL işinde yazın, türetilmiş özellikleri çıkarım sırasında düşük gecikmeli arama için Amazon SageMaker Feature Store online store’da ve eğitim için offline store’da kalıcı hale getirin. Tokenizasyon/kodlayıcı yapıtlarını model yapıtlarının yanında saklayın. Özellik grupları oluşturmak için FeatureGroup API’lerini kullanın ve zamana bağlı doğruluğu sağlamak için RecordIdentifierFeatureName ve EventTimeFeatureName’i yapılandırın.

  3. Minimum operasyonel yük ile eğitim: AlgorithmSpecification’ı XGBoost container URI’sine işaret eden bir CreateTrainingJob oluşturarak SageMaker XGBoost yerleşik container’ını kullanın, VPC içinde çalışması için VpcConfig belirtin, “objective”:“binary:logistic” dahil olmak üzere HyperParameters’ı geçin ve sınıf dengesizliğini gidermek için “scale_pos_weight"i negatif örneklerin pozitif örneklere oranına ayarlayın. Tekrarlanan başlangıç gecikmesini azaltmak için, SageMaker Pipelines’ı uygulayın ve veri hazırlama adımları için önbelleğe almayı etkinleştirin, böylece ardışık pipeline çalıştırmaları değişmeyen adımları atlar; mümkün olduğunda yeniden işlemek yerine kalıcı feature store aramalarını kullanın.

  4. Model kaydı ve manuel onay: eğitilmiş modelleri ModelApprovalStatus=‘PendingManualApproval’ ile CreateModelPackage aracılığıyla bir ModelPackageGroup’a kaydedin. RegisterModel’dan sonra duraklayan bir SageMaker Pipelines CallbackStep entegre edin; gözden geçirenler daha sonra ModelApprovalStatus=‘Approved’ olarak ayarlamak için UpdateModelPackage’ı çağırır. Bu onaylanmış paketi CreateModel ve CreateEndpoint yapılandırmaları için kullanın.

  5. Anomali tespiti ve görselleştirme: toplama işleminden sonra, zaman serisi işlem agregaları üzerinde otomatik anomali tespiti yapmak için Amazon Lookout for Metrics’i kullanın ve S3/Glue entegrasyonlarını yapılandırın. Görselleştirme için, Lookout sonuçlarını ve verileri QuickSight panolarına bağlayın veya özellik sapmasını görselleştirmek için SageMaker Studio notebook’larını kullanın. Dağıtılan endpoint’lerin isteğe bağlı model yanlılığı/sapması değerlendirmesi için, CreateEndpoint’te DataCaptureConfig’i etkinleştirin ve yakalanan verileri işaret eden DataConfig ve ModelConfig ile isteğe bağlı bir SageMaker Clarify işleme işi (CreateProcessingJob) çalıştırın; tekrarlayan kontrolleri zamanlamak ve StartMonitoringSchedule ile tek seferlik bir çalıştırmayı tetiklemek için Model Monitor/CreateMonitoringSchedule kullanın.

Gerekçe: bu yaklaşım, verileri ve dönüşümleri merkezileştirir, operasyonel yükü azalttıkları yerlerde yönetilen hizmetleri kullanır (kendi alanları için Glue/DMS/Lookout/Comprehend/Textract), minimum özel altyapı ile sürüm oluşturma ve manuel onay için SageMaker Model Registry ve Pipelines’tan yararlanır, yoğun yeniden örneklemeden kaçınmak için sınıf dengesizliğini algoritma parametreleri aracılığıyla çözer ve verileri şifreli ve ağdan yalıtılmış tutarken Model Monitor ve Clarify aracılığıyla hem zamanlanmış hem de isteğe bağlı yanlılık/sapma değerlendirmeleri sağlar.


ML İş Yükleri için Maliyet Optimizasyonu · Tüm alanlar

Bu soruları çözün → · ExamRoll.io’da süreli pratik →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Sınavınızı geçin →

Amazon'a göz atın →

Related guides

Hepsi bir arada erişim

Tek abonelik. Her sınav.

Her plan, sınırsız cevap aramayı, pratik testlerini, AI açıklamalarını ve tam kaynak kütüphanesini — 20'den fazla dilde — açar.

Aylık
24.87
Just €0.83/day
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

En iyi değer
12 ay
179.87
Just €0.49/daySave 40%
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

✓ Ücretsiz plan dahil · ✓ İstediğiniz zaman iptal edin · ✓ Tüm planlar tam ürünü açar