Amazon DEA-C01: Veri Depolama ve Göl Mimarisi — Çalışma kılavuzu
Şunun bir parçası: Amazon Data Engineer Associate DEA-C01 — Çalışma kılavuzu. Doğrulanmış cevaplarla şurada pratik yapın: Amazon sınav merkezi, veya şurada süreli deneme sınavları çözün: ExamRoll.io.
Bu alan, AWS depolama hizmetlerinin ve veritabanı motorlarının modern veri platformlarında büyük ölçekli veri alımını, dayanıklı arşivlemeyi, sorgu performansını ve güvenli yönetişimi nasıl desteklediğini kapsar. Veri mühendisleri; maliyet, erişim gecikmesi, dayanıklılık ve ayrıntılı erişim kontrolü arasında bir denge kurmalı ve S3, Lake Formation, Redshift ve DynamoDB gibi hizmetleri işlem hatlarına entegre etmelidir. Depolama sınıfı ödünleşimlerini, yaşam döngüsü otomasyonunu, yönetilen ve yerel depolama arasındaki farkları ve bölümleme desenlerini anlamak, üretim ortamında performans ve maliyet sürprizlerini önler.
Amazon S3 depolama sınıfları ve yaşam döngüsü politikaları
S3, maliyeti ve erişim desenlerini optimize etmek için birden fazla depolama sınıfı ve yaşam döngüsü kontrolü sunar. Depolama sınıfını yükleme sırasında (konsol veya CLI:
undefined
) yapılandırın veya bucket yaşam döngüsü kurallarını kullanın (
undefined
). Intelligent-Tiering, nesneleri sık ve seyrek erişilen katmanlar arasında otomatik olarak taşır ve küçük bir izleme ücreti vardır; bilinmeyen veya değişen erişim desenleri için etkinleştirin. Nesneleri uzun süreli saklama için GLACIER veya DEEP_ARCHIVE’e geçirmek ve eski sürümlerin süresini doldurmak/silmek için yaşam döngüsü kurallarını kullanın.
Karar kriterleri ve ödünleşimler:
- Intelligent-Tiering: değişken erişim için düşük operasyonel yük, nesne başına aylık izleme ücreti; erişim deseni öngörülemez olduğunda en iyisidir.
- Glacier vs Glacier Deep Archive: Glacier, daha yüksek depolama maliyetiyle daha hızlı standart ve hızlandırılmış geri getirme seçenekleri sunar; Deep Archive, toplu/standart geri getirme süreleriyle (saatler) yıllarca süren saklama için en ucuz olanıdır.
- Standard-IA vs Intelligent-Tiering: Standard-IA’da 30 günlük minimum ücret ve geri getirme ücretleri vardır — sık erişilen veriler veya kısa ömürlü nesneler için kaçının.
Operasyonel notlar:
- Değişmezlik için sürüm oluşturmayı (
undefined
) ve nesne kilidini (
undefined
) etkinleştirin; MFA Delete’i etkinleştirmek, özel CLI işlemleri ve MFA’lı bucket sahibi hesabını gerektirir.
- Yaşam döngüsü geçişleri nesne sürümlerine uygulanır ve ön ek/etiketlere göre kapsamlandırılabilir; depolama sızıntılarını önlemek için abort-incomplete-multipart-upload kullanın.
S3 ve Lake Formation ile veri gölü tasarımı
Merkezi nesne deposu olarak S3’ü ve merkezi erişim kontrolü ile kataloglama için Lake Formation’ı kullanarak bir veri gölü tasarlayın. S3 konumlarını Lake Formation kaynakları olarak kaydedin, bir AWS Glue Data Catalog kurun ve veritabanları/tablolar için Lake Formation izinlerini kullanın (
undefined
). Lake Formation, Glue/Athena sorgularına uygulanan LF-tag’ler ve veri filtreleri kullanarak sütun düzeyinde, satır düzeyinde (filtre ifadeleri) ve hücre düzeyinde maskeleme gibi ayrıntılı denetimler uygulayabilir.
Anahtar yapılandırma ve yönetişim desenleri:
- Konum kaydetme: s3://bucket/path yolunu kaydetmek ve Lake Formation’ın tarama/okuma yapmasına izin veren bir IAM rolü eklemek için Lake Formation konsolunu kullanın.
- Ayrıntılı politikalar: LF-tag’leri tanımlayın ve bunları tablolara/sütunlara ekleyin; sütunları kısıtlamak için column-list ile izinler verin ve bir principal için döndürülen satırları sınırlamak için row-filter ifadeleri kullanın.
- Lake Formation izinlerinin, Glue/Athena erişimi için IAM S3 izinlerini geçersiz kılabileceğini veya engelleyebileceğini unutmayın—gerektiğinde hem Lake Formation hem de S3 düzeyinde erişim izni verin.
Karar noktaları:
- Merkezi kataloglama, LF-tag’ler ve birden çok analiz motorunda ayrıntılı denetim uygulamasına ihtiyacınız olduğunda Lake Formation’ı kullanın.
- Basit erişim kontrolü veya harici araç erişimi için S3 bucket politikalarını ve IAM’i düşünebilirsiniz, ancak dikkatli olun: Lake Formation tarafından yönetilen analiz motorları yalnızca IAM izinlerini göz ardı edebilir.
Amazon Redshift mimarisi ve depolama
Redshift, RA3 düğümlerindeki işlem gücü ve yönetilen depolamayı, yerel SSD destekli DS2 düğümlerinden ayırır. RA3 düğümleri, verilerin küme tarafından yönetilen Amazon S3’te bulunduğu Redshift Managed Storage (RMS) kullanır; tutarlı sorgu performansıyla ölçeklenebilir depolama ve işlem gücü için ayrı ödeme yapma yeteneği için RA3’ü seçin. DS2 düğümleri, veriler büyüdüğünde dikkatli boyutlandırma ve yeniden boyutlandırma gerektiren örneğe bağlı yerel disklerde veri depolar.
Yapılandırma ve operasyonel detaylar:
- Konsol veya CLI aracılığıyla RA3 kümesi oluşturun:
undefined
.
- COPY komutu: S3 okuma erişimi veren bir IAM rolünün eklendiği bir küme altında çalışmalıdır. Rolü küme oluşturma sırasında ekleyin veya iam rollerini eklemek için kümeyi değiştirin; rol ARN’si (arn:aws:iam::acct:role/RedshiftS3Role), COPY komutunda kimlik bilgileri olarak ‘aws_iam_role=arn:…’ şeklinde referans gösterilir.
- Depolamayı ve performansı optimize etmek için WLM kuyruklarını, kısa sorgu hızlandırmayı (short query acceleration), otomatik vakumlamayı (automatic vacuuming) izleyin ve SORT/ENCODE kullanın.
Karşılaştırma (RA3 vs DS2):
- RA3: ayrıştırılmış depolama, S3’e otomatik veri katmanlama, daha az depolama yönetimi, büyüyen veri setleri için en iyisi.
- DS2: yerel SSD depolama, yerel veriler için daha düşük gecikme süresi ancak sınırlı kapasite ve ölçeklendirmesi daha zor.
DynamoDB ve amaca yönelik veritabanı seçimi
Tek haneli milisaniye gecikme süresi gerektiren yüksek ölçekli anahtar-değer ve belge iş yükleri için DynamoDB’yi seçin. Tablo tasarımı, bölüm anahtarı (ve isteğe bağlı sıralama anahtarı) seçimine bağlıdır: sıcak bölümlerden (hot partition) kaçınmak için yüksek kardinaliteli, iyi dağıtılmış anahtarlar kullanın. Sıralı veya zaman damgası tabanlı anahtarlar için, rastgele önek ekleme (sharding) uygulayın veya yazma işlemlerini dağıtmak için UUID’ler kullanın. Sağlama (provisioning) yapmaktan kaçınmak için isteğe bağlı kapasite (on-demand capacity) kullanın, ancak öngörülebilir iş yükleri için ve sıcak bölümlerdeki uyarlanabilir kapasiteden (adaptive capacity) yararlanmak için otomatik ölçeklendirmeli sağlanan kapasiteyi (provisioned capacity) göz önünde bulundurun.
Pratik yapılandırma notları:
- Tablo oluşturma CLI’ı:
undefined
.
- Alternatif erişim desenleri için GSI’ları kullanın, otomatik süre sonu için TTL’yi etkinleştirin ve veri değişikliği yakalama (change-data-capture) desenleri için DynamoDB Streams + Lambda’yı kullanın.
- Okuma ağırlıklı iş yüklerini önbelleğe almak için DAX ekleyin; karmaşık sorgular veya ilişkisel ihtiyaçlar için, sorgu karmaşıklığına ve tutarlılık ihtiyaçlarına bağlı olarak Aurora veya Redshift Spectrum’u seçin.
Motor seçimi için karar kriterleri:
- Öngörülebilir tek tablo erişim desenleri ve düşük gecikme süresiyle devasa ölçek için DynamoDB kullanın.
- Karmaşık analitik ve büyük ölçekli OLAP için Redshift kullanın.
- İşlemsel ilişkisel iş yükleri için Aurora kullanın.
Yaygın Hatalar ve Karar Kriterleri
- Sık erişilen veriler için S3 Standard-IA kullanmak — Standard-IA’nın minimum 30 günlük ücretlendirmesi vardır; kısa ömürlü veya sık erişilen nesneler için Standard veya Intelligent-Tiering kullanın.
- Lake Formation izinlerinin Glue/Athena için IAM S3 izinlerini geçersiz kıldığını unutmak — Glue/Athena kullanırken hem Lake Formation hem de S3 erişimi verin ve etkin izinleri Lake Formation konsolunda doğrulayın.
- Redshift COPY, sadece kullanıcı izinlerini değil, kümeye eklenmiş bir IAM rolü gerektirir — kümeye S3 erişimli bir IAM rolü ekleyin ve COPY işlemlerinde ARN’sine referans verin.
- Sıralı anahtarlardan kaynaklanan DynamoDB sıcak bölümleri — monotonik anahtarlardan kaçının; hash’lenmiş anahtarlar, rastgele önekler veya UUID’ler kullanın ve isteğe bağlı veya otomatik ölçeklendirmeli sağlanan kapasiteyi göz önünde bulundurun.
- S3 Object Lock ve MFA Delete’i yanlış etkinleştirmek — object lock, sürüm oluşturmanın etkinleştirilmesini ve uygun izinleri gerektirir; MFA Delete yalnızca MFA ile CLI kullanılarak etkinleştirilebilir/devre dışı bırakılabilir ve katı bucket sahibi gereksinimleri vardır.
- Geri getirme maliyetlerini ve sürelerini test etmeden uygun olmayan yaşam döngüsü geçişleri yapmak — sürpriz geri getirme gecikmelerinden ve ücretlerinden kaçınmak için Glacier sınıfları için geri getirme iş akışlarını test edin.
Pratik Problem: Kullanım Senaryosu
Acme Media, 50 TB ham video alımını depolamalı, analistlere dönüştürülmüş meta verilere sorgu erişimi sağlamalı ve depolama maliyetini en aza indirirken farklı iş birimleri için satır ve sütun düzeyinde erişim uygulamalıdır.
- Ham videoyu çok parçalı yükleme (multipart upload) kullanarak S3’e alın, nesneleri alım tarihine ve veri setine göre etiketleyin, başlangıçtaki bilinmeyen erişim desenleri için Intelligent-Tiering kullanın.
- Medyayı yapılandırılabilir bir saklama süresinden sonra GLACIER veya DEEP_ARCHIVE’e geçirmek için yaşam döngüsü kuralları yapılandırın (Standard-IA düşünülürse 30 günden fazla uyumluluğu sağlayın).
- S3 konumlarını Lake Formation’a kaydedin, Data Catalog’u doldurmak için Glue crawler’ları oluşturun ve iş birimlerine LF-etiket tabanlı satır ve sütun düzeyinde izinler verin.
- Analitik için derlenmiş meta verileri Redshift RA3’te saklayın; S3’ten COPY için kümeye bir IAM rolü ekleyin ve bakım pencerelerinde VACUUM/ANALYZE işlemlerini kullanın.
- Video manifestleri için yüksek verimli bir arama tablosu olarak hash’lenmiş UUID anahtarlarıyla DynamoDB kullanın ve trafik artışlarını karşılamak için isteğe bağlı kapasiteyi etkinleştirin.
Gerekçe: Bu yaklaşım, Glacier sınıflarıyla soğuk depolama maliyetini izole eder, bilinmeyen desenler için Intelligent-Tiering kullanır, analitik motorları arasında güvenli, ayrıntılı erişim kontrolü için Lake Formation’ı uygular ve DynamoDB düşük gecikmeli operasyonel aramaları yönetirken ölçeklenebilir analitik depolama için RA3’ü seçer.
← Veri Alımı ve Toplama · Tüm alanlar · Veri Kataloglama ve Metadata Yönetimi →
Bu soruları çözün → · ExamRoll.io’da süreli pratik →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Sınavınızı geçin →