Amazon MLA-C01: Model İzleme ve Gözlemlenebilirlik — Çalışma kılavuzu
Şunun bir parçası: AWS Machine Learning Engineer Associate MLA-C01 — Çalışma kılavuzu. Doğrulanmış cevaplarla şurada pratik yapın: Amazon sınav merkezi, veya şurada süreli deneme sınavları çözün: ExamRoll.io.
Temel kavramlar: sapma, temeller ve gözlemlenebilirlik
Model izleme, ham çalışma zamanı telemetrisini eyleme geçirilebilir sinyallere dönüştüren operasyonel bir disiplindir: veri sapması, kavram sapması, model kalitesi gerilemeleri ve altyapı sağlığı. Veri sapması, üretimdeki girdi özelliklerinin istatistiksel dağılımının eğitim sırasında gözlemlenen temel dağılımdan farklılaşması anlamına gelir; kavram sapması ise girdiler ve etiketler arasındaki istatistiksel ilişkinin değişerek modelin tahmin eşlemesinin bozulması demektir. Etkili gözlemlenebilirlik, beklenen davranışın bir temelini, üretim girdilerinin ve çıktılarının sürekli profilinin çıkarılmasını, metrik çıkarımını (hem F1/ROC AUC gibi model merkezli hem de KS mesafesi, PSI, eksiklik oranları, kategorik kardinalite gibi veri merkezli metrikler) ve doğrulama veya yeniden eğitime giden döngüyü kapatan güvenilir bir uyarı ve iş akışı sistemini gerektirir.
Temeller genellikle eğitim (ve doğrulama) verilerinin temsili bir anlık görüntüsünden, tanımlayıcı istatistikler ve kısıt dosyaları kullanılarak oluşturulur. AWS SageMaker’da, DefaultModelMonitor.suggest_baseline yardımcı programı veya bir Processing işi, temel istatistikleri ve başlangıç kısıt setini (ör. min/maks, izin verilen kategorik değerler, yüzdelikler) hesaplayabilir. Çıktı, S3’te saklanan bir JSON kısıt dosyası ve bir istatistik dosyasıdır; bu yapıtlar, devam eden izleme işleri tarafından referans alınan kanonik temel haline gelir. İzleme, toplu iş başına istatistikleri bu temellerle karşılaştırır ve yapılandırılmış eşikler aşıldığında ihlalleri işaretler. Gözlemlenebilirlik aynı zamanda model girdilerini, model çıktılarını, çıkarım gecikmesini ve (varsa) akış aşağı iş metriğini yakalamak ve F1 gibi model seviyesi metriklerdeki bir düşüşü hızlıca analiz etmek için bu sinyalleri ilişkilendirmek anlamına da gelir.
Anahtar hizmetler ve yapılandırma
SageMaker Model Monitor, temellere göre istatistikleri hesaplayan ve değerlendiren işleme işlerini zamanlamak için yönetilen bir yetenek sağlar. Kullanacağınız temel API’ler ve yapılandırma nesneleri arasında, MonitoringScheduleName ve MonitoringScheduleConfig parametreleriyle CreateMonitoringSchedule bulunur. MonitoringScheduleConfig, cron tarzı bir ScheduleExpression içeren bir ScheduleConfig ve RoleArn, MonitoringAppSpecification.ImageUri, MonitoringResources.ClusterConfig (InstanceType, InstanceCount, VolumeSizeInGB), MonitoringInputs (S3 girdi konumları ve DatasetFormat) ve MonitoringOutputConfig.S3OutputPath’ı içeren bir MonitoringJobDefinition barındırır. Temel yapıtlarına MonitoringJobDefinition.BaselineConfig aracılığıyla referans verilir. Otomatik temel türetme için, S3’e kısıtları ve istatistikleri yazan bir ProcessingJob çalıştıran DefaultModelMonitor.suggest_baseline çağrısını (SageMaker Python SDK) kullanın.
Gözlemlenebilirlik ve uyarı, CloudWatch metrikleri ve alarmları ile olay güdümlü iş akışları için EventBridge kullanılarak uygulanır. Model Monitor, CloudWatch metriklerine dönüştürülebilen yürütme sonuçlarını yayınlar; bir alarm oluşturmak için AlarmName, MetricName, Namespace, Statistic (veya MetricDataQuery), ComparisonOperator, Threshold, Period ve EvaluationPeriods ile PutMetricAlarm API’sini kullanırsınız. Bir SNS konusuna veya bir EventBridge hedefine işaret eden AlarmActions belirterek alarmları otomatik eylemlere bağlayın. EventBridge kuralları, kaynak olarak “aws.sagemaker” için filtreleme yapabilir ve Model Monitor izleme programı yürütme hatalarına veya kısıt ihlallerine uyan bir desen kullanarak bir Lambda’ya veya doğrudan bir SageMaker Pipeline için StartPipelineExecution’a yönlendirebilir.
Kontrollü dağıtım ve manuel onaylar için SageMaker Model Registry, ModelPackage ve ModelPackageGroup nesnelerini destekler. CreateModelPackage’i çağırdığınızda ModelApprovalStatus’u “PendingManualApproval” olarak ayarlayabilirsiniz ve daha sonra yetkili bir kullanıcı ModelApprovalStatus’u “Approved” olarak ayarlayarak UpdateModelPackage’i çağırır. Model dağıtımı yapan Pipelines veya CI/CD işleri, yalnızca ModelApprovalStatus == “Approved” olan model paketi sürümlerini yükseltir. UpdateModelPackage’i kimin çağırabileceğini kontrol etmek için IAM politikalarını kullanın.
Eksiksiz bir izleme yığını genellikle aşağıdaki hizmetleri bir arada kullanır:
- Amazon SageMaker Model Monitor
- Amazon SageMaker Pipelines ve Model Registry
- Amazon S3 (temeller, referans veriler (ground truth) ve çıkarım yakalama için)
- Amazon CloudWatch (metrikler, loglar, PutMetricAlarm)
- Amazon EventBridge (olay kuralları ve yönlendirme)
- AWS Lambda veya Step Functions (otomasyon hedefleri)
- Amazon SNS (alarm bildirimleri)
- Geçici (ad-hoc) keşif ve görselleştirme için AWS Glue / Athena / QuickSight
Tasarım desenleri ve ödünleşimler
Yaygın ve sağlam bir desen, kısa vadeli tespiti uzun vadeli iyileştirmeden ayırmaktır. Toplu iş başına istatistikleri hesaplamak ve kaymayı hızla tespit etmek için yüksek frekanslı bir izleme programı (örneğin, saatlik veya günlük CreateMonitoringSchedule ile ScheduleExpression kullanarak) kullanın. Her çalıştırmanın sonuçlarını PutMetricData kullanarak CloudWatch özel metriklerine besleyin ve otomatik, düşük güvenli eylemler (ör. bildirim gönderme) için ihtiyatlı eşiklere sahip CloudWatch Alarms ve otomatik, yüksek güvenli eylemler (ör. bir yeniden eğitim ardışık düzenini tetikleme) için daha katı eşiklere sahip alarmlar oluşturun. EventBridge kuralları, bir Model Monitor ihlal olayını veya CloudWatch Alarm durum değişikliğini, bir SageMaker Pipeline için kimlik doğrulaması yapan ve StartPipelineExecution‘ı çağıran ya da CreateTrainingJob aracılığıyla bir yeniden eğitim işi başlatan bir Lambda’ya eşleyerek tespit ile iyileştirme arasında köprü kurar.
Otomatik olarak yeniden eğitip eğitmemeye veya manuel onay gerektirip gerektirmemeye karar verirken, iş riskini ve uyumluluğu tartın. Otomatik yeniden eğitim, ardışık düzende güvenilir otomatik doğrulama adımları (veri doğrulama, ayrılmış veriye (holdout data) karşı model değerlendirmesi, geri alma testleri) bulunan düşük riskli modeller için uygundur. Regülasyona tabi veya yüksek etkili modeller için Model Registry manuel onay desenini kullanın: ModelApprovalStatus‘u “PendingManualApproval” olan aday ModelPackage‘ı itin, bir insan incelemesi akışını (örneğin, bir MLOps panosunda bir bilet veya UpdateModelPackage aracılığıyla ModelPackage‘ı güncelleyen bir onaylayıcı Lambda) tetikleyin ve yalnızca bundan sonra üretim uç noktalarına dağıtıma izin verin.
İzleme sıklığı ve çıkarım yakalamanın boyutu, maliyet ve hassasiyet arasında ödünleşimler sunar. Daha küçük toplu iş pencereleri, geçici gürültüye karşı hassasiyeti artırır ve işlem maliyetlerini yükseltirken, daha büyük pencereler maliyeti düşürür ancak hızlı kaymanın tespitini geciktirebilir. Benzer şekilde, tam çıkarım yüklerini (payload) yakalamak maliyetli olabilir ve veri yönetişimi sorunları ortaya çıkarabilir; kök neden analizi için tam tekrarlar gerekmedikçe, örnekleme yapmayı veya yalnızca toplu özellikleri ve model çıktılarını saklamayı düşünün.
Yeniden eğitim tetikleyicileri için, iş mantığını ardışık düzende kodlayan olay güdümlü otomasyonu tercih edin: tetiklenen bir CloudWatch Alarmı, “TrainingDataS3Uri”, “BaselineConstraintsS3Uri” ve “RetrainTriggerReason” gibi PipelineParameters ile StartPipelineExecution‘a minimum bir yük (yakalanan veri ve kısıt farkı dosyaları için S3 URI’leri) ileten bir EventBridge kuralını tetikler. Bu, tetikleyicinin deterministik ve denetlenebilir olmasını sağlar.
Yaygın tuzaklar ve karar kriterleri
Sık karşılaşılan bir tuzak, istatistiksel sapmayı mutlaka eyleme geçilebilir olarak değerlendirmektir. Her sapma, model performansını etkilemez. Maliyetli bir yeniden eğitme başlatmadan önce, özellik dağılımı değişikliklerini model kalitesi metrikleriyle (F1, precision-recall, kalibrasyon) ilişkilendirin. Bir diğer hata, yakalanan çıkarım verilerinin güvenliğini sağlamamaktır; üretim verilerini izole tutmak için bekleme durumunda şifrelemeyi (S3 SSE-KMS), S3 bucket policy’lerini ve VPC endpoint’lerini seçin. İzleme işlerini yapılandırırken, IAM RoleArn‘ünün en az ayrıcalıkla erişime sahip olduğundan emin olun: çıkarım yakalama S3 ön eklerine okuma, izleme çıktısı S3 ön ekine yazma ve eğer log üretiyorsanız CloudWatch logları oluşturma izni.
Yeniden eğitme sıklığını ve pipeline karmaşıklığını seçerken, kararlarınızı gözlemlenen sinyal-gürültü oranlarına dayandırın. Eğer Model Monitor sıkça geçici ihlaller gösteriyorsa, pipeline’ları tetiklemeden önce düzeltme (smoothing) uygulayın veya art arda birden fazla ihlal eden çalıştırma gerektirin. Manuel onay iş akışları için, ModelPackage UpdateModelPackage(ModelApprovalStatus="Approved") işlemini dar kapsamlı bir IAM izin seti aracılığıyla zorunlu kılın ve uyumluluk için onaylayan kimliğini pipeline yürütme meta verilerine kaydedin.
Pratik Problem: Kullanım Senaryosu
Şirket adı: FinSecure Analytics; zorluk: üretimdeki bir sahtekarlık tespiti XGBoost modeli, yanlış pozitiflerde (false positive) aralıklı ani artışlar ve aylar içinde F1 skorunda istikrarlı bir düşüş gösteriyor; veriler S3 işlem loglarından ve şirket içi (on-premises) bir MySQL müşteri profili yansımasından geliyor; model denetlenmeli ve insan onaylarıyla yeniden eğitilmeli.
Otomatik izleme ve temel çizgisi (baseline): Temsili bir eğitim anlık görüntüsüne (snapshot) karşı
DefaultModelMonitor.suggest_baselineçalıştırarak S3’te (temel çizgisi S3 ön eki) saklanacak temel çizgisi istatistiklerini ve kısıtlamalarını üretin. Saatlik çalıştırmalar içinScheduleExpression, S3 okuma/yazma yetkisine sahipRoleArn, Model Monitor container’ını işaret edenMonitoringAppSpecification.ImageUri,InstanceTypeml.m5.large veInstanceCount1 olanMonitoringResources.ClusterConfig, yakalanan çıkarım (inference) S3 ön eklerini gösterenMonitoringInputsve çalıştırma çıktılarını yakalamak içinMonitoringOutputConfig.S3OutputPathbelirten birMonitoringScheduleConfigileCreateMonitoringScheduleoluşturun.Alarmlar ve önceliklendirme (triage): Çalıştırma başına ihlal sayılarını özel bir Ad Alanı (Namespace) altında
PutMetricDatakullanarak CloudWatch’a yayınlayın veNumberOfViolations > Xeşiğini art arda üç periyot boyunca aşması durumundaAlarmNameile birPutMetricAlarmoluşturun.AlarmActions‘ı bir SNS konusuna ve kaynak olarak “aws.sagemaker” ve detay türü olarak “SageMaker Model Monitor” filtreleyen, ihlal meta verilerini içerecek bir EventBridge kuralına yapılandırın.Manuel onaylı iyileştirme pipeline’ı: Veri alımı (S3 + MySQL yansımasını bir eğitim veri setinde merkezileştirmek için Glue işi), otomatik özellik mühendisliği, XGBoost container’ını kullanarak
CreateTrainingJobile eğitim, F1 ve yanlılık (bias) raporları üreten bir değerlendirme adımı veModelApprovalStatus="PendingManualApproval"ileCreateModelPackagearacılığıyla Model Registry kaydı gerçekleştiren bir SageMaker Pipeline uygulayın. Pipeline, değerlendirme metriklerini CloudWatch’a veModelPackagemeta verilerine yazar.İnsan müdahaleli döngü (Human-in-the-loop) ve zorlama: Veri bilimi ekibini SNS aracılığıyla bilgilendirmek için CloudWatch Alarmı tarafından tetiklenen bir EventBridge kuralı kullanın; onaylayan, S3/QuickSight’ta erişilebilen değerlendirme çıktılarını inceler ve ardından
ModelApprovalStatus="Approved"ileUpdateModelPackage‘i çağırır. CICD/dağıtım adımı,CreateModel(veya SageMaker endpoint güncellemesi) çağırmadan önceModelApprovalStatus‘u kontrol eder. Metriklerin otomatik eşiklerin altına düştüğü ve iş biriminin otomatik yeniden eğitmeyi kabul ettiği otomatik yeniden eğitme durumlarında,PipelineParametersolarakTrainingDataS3UriveRetrainTriggerReasonileStartPipelineExecution‘ı çağıran bir Lambda hedefini EventBridge kuralına ekleyerek, daha katı eşiklerle korunan tam otomatik bir yol sağlayın.
AWS gerekçesi: SageMaker Model Monitor, minimum operasyonel iş yükü ile sapma tespitini ve temel çizgisi karşılaştırmasını merkezileştirir; CloudWatch ve EventBridge, SNS/Lambda’ya sağlam uyarı ve yönlendirme sağlar; SageMaker Pipelines, yeniden eğitme ve model doğrulamasını otomatikleştirir; Model Registry’nin ModelApprovalStatus özelliği, üretim dağıtımları için manuel bir onay kapısı uygular ve S3/Glue/Athena, eğitim ve görselleştirme için merkezi ve güvenli veri toplama imkanı sunar. Bu hizmetler birlikte, tekrarlanabilir temel çizgileri, denetlenebilir onaylar ve tespit ile iyileştirme arasında net bir ayrım bulunan yapılandırılabilir otomatik yeniden eğitme sağlar.
← MLOps ve Model Yaşam Döngüsü Yönetimi · Tüm alanlar · Güvenlik →
Bu soruları çözün → · ExamRoll.io’da süreli pratik →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Sınavınızı geçin →