Amazon DEA-C01: Veri Kataloglama ve Metadata Yönetimi — Çalışma kılavuzu

Şunun bir parçası: Amazon Data Engineer Associate DEA-C01 — Çalışma kılavuzu. Doğrulanmış cevaplarla şurada pratik yapın: Amazon sınav merkezi, veya şurada süreli deneme sınavları çözün: ExamRoll.io.

Bu alan, bir AWS veri platformunda verilerin keşfedilebilir, sorgulanabilir ve yönetilebilir olmasını sağlayan meta veri katmanını kapsar. Etkili kataloglama ve meta veri yönetimi, analitik süreçlerdeki engelleri azaltır ve alt sistem tüketicilerinin şemaları, bölümleri, erişim politikalarını ve veri soyunu (lineage) bulabilmesini sağlar. Bu alandaki AWS hizmetleri—Glue Data Catalog, Glue Schema Registry, Lake Formation, Athena entegrasyonu ve DataBrew—keşif, şema evrimi, yönetişim ve profilleme için tamamlayıcı araçlar sunar. Bu hizmetlerin nasıl etkileşimde bulunduğunu, yapılandırma ayrıntılarını ve tipik hata modlarını anlamak, operasyonel güvenilirlik ve güvenlik için esastır.

AWS Glue Data Catalog yapısı ve operasyonları

Glue Data Catalog; veritabanları, tablolar, bölümler, bağlantılar ve kullanıcı tanımlı sınıflandırıcılar için bölgesel, merkezi bir meta veri deposudur. Temel öğeler şunlardır:

Operasyonel desenler:

Karar kriterleri:

Şema keşfi ve evrimi

Schema Registry ve Glue şeması, akış (streaming) ve uzun ömürlü üretici/tüketici sözleşmeleri için Avro, JSON ve Protobuf’u destekler. Temel yetenekler:

Pratik yapılandırma ve evrim desenleri:

Karar kriterleri:

Lake Formation ile veri soyu (lineage) ve yönetişim

Lake Formation, ayrıntılı erişim kontrolü, denetim ve veri soyu (lineage) kontrolleri sağlamak için Glue Data Catalog üzerine inşa edilmiştir. Temel özellikler:

Yapılandırma desenleri:

Karar kriterleri:

Athena ve Glue katalog entegrasyonu

Athena, meta veriler için Glue Veri Kataloğu’na (Glue Data Catalog) bağımlıdır. Yaygın entegrasyon noktaları ve operasyonel ayarlar:

undefined

komutunu çalıştırın veya tablonun konumu altında keşfedilen partition’ları yenilemek için bu SQL ile

undefined

kullanın.

undefined

kullanın (olay güdümlü akışlar için önerilir).

undefined

,

undefined

,

undefined

ve

undefined

gibi tablo özelliklerini ayarlayarak partition projeksiyonu kullanın — bu, Glue aramalarını tamamen ortadan kaldırır ve çok yüksek partition sayıları için zorunludur.

undefined

, ara sıra yapılan anlık (ad-hoc) eklemeler için basittir ancak büyük veri setleri için yavaş olabilir.

Glue DataBrew tamamlayıcısı:

Karar kriterleri:

undefined

komutunu yalnızca ara sıra yapılan geriye dönük doldurmalar (backfill) için veya otomasyon mevcut olmadığında çalıştırın.

Yaygın Tuzaklar ve Karar Kriterleri

undefined

çalıştırın, S3 olaylarında

undefined

çağırın ya da büyük ve öngörülebilir partition setleri için partition projeksiyonu uygulayın.

undefined

, S3 okuma/yazma ve

undefined

izinlerine sahip olduğundan emin olun.

Pratik Problem: Kullanım Senaryosu

Acme Retail, S3’e saatlik satış dosyalarını tarih/saat partition’ları ile almaktadır ve analistler verileri Athena’da sorgulamaktadır; yüklemeden sonra, partition’lar Glue Veri Kataloğu’nda görünmediği için kullanıcılar sorgu hataları ve eski sonuçlar görmektedir.

  1. Yeni partition’ı anında kaydetmek için

undefined

komutunu çağıran bir Lambda fonksiyonunu tetikleyecek bir S3 PUT olay bildirimi uygulayın. 2. Eski veriler veya geriye dönük doldurmalar (backfill) için,

undefined

komutunu çalıştıran bir Athena sorgusu zamanlayın veya bilinen aralıklar için hedeflenmiş bir

undefined

çalıştırın. 3. Partition’lar katı bir tarih/saat adlandırma kuralını takip ediyorsa, katalog yenileme maliyetlerini ortadan kaldırmak için Glue tablosunda partition projeksiyonunu etkinleştirin (

undefined

olarak ayarlayın ve yıl/ay/gün/saat özelliklerini tanımlayın). 4. Tabloya hassasiyet için LF-Tag’ler ekleyin ve Athena sorgularına izin verilmesi ve yönetilmesi için analistlere Lake Formation izinleri verin. 5. Şema kaymasını (schema drift) yakalamak için hazırlık (staging) ortamındaki yeni saatlik dosyaları profilini çıkarmak için Glue DataBrew kullanın; şema değişiklikleri bulunursa, Glue Schema Registry’de yeni şema versiyonlarını kaydedin ve üretime sunmadan önce uyumluluğu doğrulayın.

Gerekçe: otomatik partition kaydı veya projeksiyonu, Athena sorgularını bozan meta veri gecikmesini ortadan kaldırır; bunu Lake Formation yönetişimi ile birleştirmek güvenli erişim sağlarken, DataBrew güdümlü profil oluşturma şema kaymasını erken yakalar ve Glue Schema Registry ise akış (streaming) ve toplu (batch) tüketicileri uyumsuz şema değişikliklerinden korur.


Veri Depolama ve Göl Mimarisi · Tüm alanlar · Veri Dönüşümü ve İşleme

Bu soruları çözün → · ExamRoll.io’da süreli pratik →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Sınavınızı geçin →

Amazon'a göz atın →

Related guides

Hepsi bir arada erişim

Tek abonelik. Her sınav.

Her plan, sınırsız cevap aramayı, pratik testlerini, AI açıklamalarını ve tam kaynak kütüphanesini — 20'den fazla dilde — açar.

Aylık
24.87
Just €0.83/day
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

En iyi değer
12 ay
179.87
Just €0.49/daySave 40%
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

✓ Ücretsiz plan dahil · ✓ İstediğiniz zaman iptal edin · ✓ Tüm planlar tam ürünü açar