Amazon AIF-C01: ML Veri Mühendisliği — Çalışma kılavuzu
Şunun bir parçası: AWS AI Practitioner AIF-C01 — Çalışma kılavuzu. Doğrulanmış cevaplarla şurada pratik yapın: Amazon sınav merkezi, veya şurada süreli deneme sınavları çözün: ExamRoll.io.
Veri toplama, etiketleme, sürüm oluşturma ve yönetişim
Temsili ve denetlenebilir veri kümeleri toplamak, tüm ML çalışmalarının temel adımıdır. Ham girdileri korumak ve kaynak takibini (provenance) sağlamak için, S3 Sürüm Oluşturma (Versioning) ve nesne kilidi (object lock) etkinleştirilmiş şekilde Amazon S3’ü merkezi ve dayanıklı bir depolama alanı olarak kullanın. Yapılandırılmış veri alımı ve kataloglama için, veri kümelerini AWS Glue Data Catalog’a kaydedin ve Lake Formation kullanarak ayrıntılı erişim denetimi uygulayın. İnsan tarafından etiketleme gerektiğinde, Amazon SageMaker Ground Truth, etiketleyici uyumu ve güveni için meta veriler oluştururken etiketleme maliyetini düşüren yerleşik iş akışları, not ekleme arayüzleri (annotation UI) ve aktif öğrenme döngüleri sağlar. Yaygın tuzaklar arasında yanlı veya temsili olmayan örnekler toplamak, köken (lineage) ve etiketleme kurallarını kaydetmemek ve yetersiz etiket kalite kontrolleri bulunur; bunları etiketleme denetimlerini saklayarak, alt kümeleri körlemesine yeniden etiketleyerek (blind-relabel) ve etiket birleştirme sezgisel yöntemlerini (heuristics) kullanarak azaltın. Gizlilik ve uyumluluk kararları mimariyi yönlendirir: KMS tarafından yönetilen CMK’ler ile S3 sunucu tarafı şifrelemesini kullanın, IAM politikaları ve VPC uç noktaları (AWS PrivateLink) ile erişimi kısıtlayın ve model eğitimi için verileri paylaşmadan önce Amazon Comprehend ile PII (Kişisel Tanımlayıcı Bilgiler) tespiti ve redaksiyonu yapın. Uzun süren programlar için, tekrarlanabilir eğitim ve yasal raporlama sağlamak amacıyla veri kümesi anlık görüntülerini (snapshot) alın, veri kümesi kimlikleriyle etiketleyin ve deneyleri Amazon SageMaker Experiments veya DVC gibi harici bir araçla takip edin.
Ön işleme, özellik mühendisliği ve keşifsel veri analizi (EDA)
Dönüşümler ve özellikler, bir modelin genelleme yapma kapasitesini belirler. Verileri profillemek, temizlemek ve normalleştirmek için AWS Glue veya Amazon SageMaker Data Wrangler’ı kullanın ve Amazon QuickSight veya Amazon SageMaker Studio’da barındırılan Jupyter not defterleri ile yinelemeli keşifsel veri analizi yapın. Üretim ortamındaki özellik yönetimi için, çevrimdışı ve çevrimiçi özellik hesaplamalarının tutarlı olmasını sağlamak ve eğitim/sunum sapmasını (train/serve skew) önlemek amacıyla Amazon SageMaker Feature Store’u benimseyin; ham ve türetilmiş özellikleri ayrı ayrı saklayın ve özellik oluşturma mantığını kaydedin. Zaman serisi ve akış (streaming) işlem hatları, düşük gecikmeli özellik yenileme için Amazon Kinesis veya AWS Glue streaming ETL’den yararlanmalıdır. Tipik tuzaklar arasında, gelecekteki bilgilerin eğitim verisine sızdığı veri sızıntısı (data leakage), eksik değerlerin yanlış ele alınması ve çevrimdışı eğitim özellikleri ile çevrimiçi sunum özellikleri arasındaki uyumsuzluk yer alır. İşlem hatlarını tasarlarken karar kriterleri güncellik (freshness) ve maliyet dengesine dayanır: yoğun geçmişe yönelik yeniden hesaplamalar için toplu (batch) ETL’i, neredeyse gerçek zamanlı kişiselleştirme için akış (streaming) yöntemini ve düşük gecikmeli çevrimiçi özellikler gerektiğinde hibrit mimarileri seçin. Şema kaymasını (schema drift) erken yakalamak için doğrulama kontrollerini ve şema zorlamasını Glue’da veya SageMaker Processing işlerinin bir parçası olarak otomatikleştirin.
Gömülüler (Embeddings), artırma, sentetik veri ve temel modeller için veri kümeleri
Gömülüler (Embeddings), metin, resim veya çok modlu girdileri anlamsal ilişkileri yakalayan yoğun vektörlere dönüştürür; anlamsal arama, geri getirme destekli üretme (retrieval-augmented generation) ve kümeleme gibi işlemlere güç verirler. Amazon Bedrock veya SageMaker’da barındırılan kodlayıcılarla (encoder) gömülüler oluşturduğunuz, vektörleri Amazon OpenSearch Service (k-NN), Amazon Kendra veya yönetilen bir vektör deposunda sakladığınız ve temel modeli koşullandırmak için bağlamı geri getirdiğiniz bir geri getirme destekli üretme (RAG) deseni oluşturun. Gerçek örneklerin az olduğu durumlarda veri artırma ve sentetik veri üretimi pratik çözümlerdir: yeniden ifade edilmiş cümleler (paraphrase), görüntü dönüşümleri (Albumentations veya SageMaker Processing aracılığıyla) veya gizliliği koruyan sentetik kayıtlar oluşturmak için SageMaker’daki üretken modelleri kullanın. Sentetik verilere aşırı güvenmekten kaçının; düşük sadakat (fidelity), dağılım kaymasına (distribution shift) neden olabilir ve modellerin yapaylıklara (artifact) aşırı uyum sağlamasına (overfit) yol açabilir. Temel model (FM) eğitim veri kümeleri için yüksek kaliteli örnekler seçin, prompt şablonları ile formatları standartlaştırın (canonicalize) ve her veri kümesi anlık görüntüsünü S3’te sürümleyin. Üçüncü taraf temel modellerle (FM) kullanılan özel veriler için, özel bir ince ayar (fine-tuning) yolunu (işlem gücünü bir VPC’ye taşıyarak) tercih edin veya kaynak belgeleri güvenli bir vektör deposunda tutarken temel modele yalnızca hassas olmayan bağlamı gönderen, yalnızca geri getirme (retrieval-only) amaçlı işlem hatları dağıtın; sızıntıyı önlemek için redaksiyon ve token düzeyinde maskeleme uygulayın. Prompt mühendisliği ve talimat şablonları (sistem prompt’ları), model yanıtlarını şekillendirmek için kritik öneme sahiptir; gereken determinizm ve yaratıcılığa göre temperature, top_k veya top_p parametrelerini ayarlayın.
Değerlendirme, dağıtım, izleme ve yaşam döngüsü yönetimi
Değerlendirme, iş hedefleriyle uyumlu metrikler kullanılarak açıkça yapılmalıdır: regresyon görevleri RMSE veya MAE kullanır, ikili sınıflandırma precision/recall/F1 ve ROC AUC’yi değerlendirir ve özetleme ROUGE varyantlarını kullanır. Değerlendirme aşamasında doğrulama ve çapraz doğrulama yapın ve nihai kabul için bir kör test seti ayırın. Dağıtımı Amazon SageMaker uç noktalarını (gerçek zamanlı veya sunucusuz çıkarım) veya yönetilen FM sunumu için Amazon Bedrock’u kullanarak yapın; daha küçük, damıtılmış (distilled) modeller seçerek, çok modelli uç noktaları (multi-model endpoints) etkinleştirerek veya öngörülemeyen trafik için SageMaker Serverless Inference kullanarak gecikme süresini optimize edin. Amazon SageMaker Model Monitor ile üretimdeki performansı ve veri kaymasını (data drift) izleyin ve metrik bozulması için uyarılar ayarlayın; riski sınırlamak için kanarya (canary) veya mavi/yeşil (blue/green) dağıtımlar kullanın. Model kullanımına yönelik erişim kontrolü, IAM rol politikaları, kaynak seviyesi izinler ve ağ izolasyonu kullanılarak uygulanır. Uygulamacıların düştüğü tuzaklar arasında yanlış metriği seçmek (dengesiz sınıflar için doğruluk), kavram kaymasını (concept drift) göz ardı etmek ve denetlenebilirlik için eğitim verilerini ve çıkarım günlüklerini enstrümante etmemek yer alır. Yeniden eğitim sıklığını standartlaştırmak, veri seti ve model sürümlemesini tutarlı tutmak ve uyumluluk için savunulabilir bir denetim izi sağlamak amacıyla ML için CI/CD’yi SageMaker Pipelines ile kullanın.
Pratik Problem: Kullanım Senaryosu
Senaryo: Bir çevrimiçi market zinciri olan BrightCart, şirket içi (on-prem) envanter sistemini AWS’ye modernize ediyor ve müşteri sorularını yanıtlayan, canlı envanter konumlarını döndüren ve aynı zamanda uyumluluk kurallarına uygun olarak müşteri ve envanter verilerini koruyan üretken bir yapay zeka sohbet botu istiyor. AWS AI ortamları veri setleri için S3, işlemsel envanter için Amazon RDS, geliştirme için SageMaker Studio, temel modeller (foundation models) için Bedrock erişimi ve VPC ağını içeriyor.
Zorluk: Mevcut envanteri alan ve hassas verileri ifşa etmekten veya halüsinasyonları tetiklemekten kaçınan, düşük gecikmeli, özel (private) ve RAG özellikli bir sohbet botu oluşturun.
Önerilen Yaklaşım:
- Özel bir VPC oluşturun ve Bedrock ile SageMaker için AWS PrivateLink uç noktalarını yapılandırın; standart ürün dokümanlarını ve envanter anlık görüntülerini sunucu tarafı şifreleme (KMS) ile S3’te saklayın ve S3 sürümlemesini etkinleştirin.
- Özel bir alt ağda (private subnet) bir Bedrock kodlayıcısı veya SageMaker modeli ile ürün dokümanlarından sürekli olarak embedding’ler hesaplayın ve hızlı en yakın komşu alımı için k-NN ile vektörleri Amazon OpenSearch Service’te saklayın; canlı envanteri Amazon RDS’te tutun ve alım için güvenli bir çalışma zamanı bağlayıcısı sağlayın.
- Uygulamanın önce bağlam için OpenSearch’ü sorguladığı, ardından alınan bağlamı ve açık güvenlik talimatlarını içeren bir sistem istem şablonu (system prompt template) ile Bedrock’u çağırdığı, geri çağırma ile zenginleştirilmiş (retrieval-augmented) bir işlem hattı uygulayın; girdi doğrulaması yoluyla kullanıcı girdilerini temizleyin ve alımdan önce PII’ı tespit edip çıkarmak için Amazon Comprehend’i kullanın.
- Sohbet botunu bir Application Load Balancer arkasında dağıtın, FM’i VPC içindeki bir API ağ geçidi ile Bedrock aracılığıyla sunun, kısıtlı erişimle CloudWatch’a günlük kaydını etkinleştirin ve SageMaker Model Monitor ve periyodik insan denetimleri ile model yanıtlarını ve kaymayı izleyin.
Gerekçe: Bu yaklaşım, hassas veri ifşasını en aza indirmek için bir RAG deseni kullanır, uyumluluk için özel ağ kullanımından (private networking) ve KMS’ten yararlanır, doğruluk için canlı envanteri model bağlamından ayırır ve halüsinasyonları kontrol etmek ve sürekli güvenilirliği sağlamak için izleme ve insan döngüsü içinde (human-in-the-loop) kontroller uygular.
← AI Güvenliği ve Gizlilik · Tüm alanlar · Model Eğitimi →
Bu soruları çözün → · ExamRoll.io’da süreli pratik →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Sınavınızı geçin →