Google PDE: Veri Depolama, Veri Gölleri ve Dosya Formatları — Çalışma kılavuzu

Şunun bir parçası: Google Professional Data Engineer — Çalışma kılavuzu. Doğrulanmış cevaplarla şurada pratik yapın: Google sınav merkezi, veya şurada süreli deneme sınavları çözün: ExamRoll.io.

Dosya formatları, sıkıştırma ve sorgu davranışı

Doğru formatı seçmenin maliyet ve performans üzerinde birinci dereceden etkileri vardır.

undefined

Düzen, bölümleme, performans mühendisliği, yerleşim ve geçiş

undefined

Pratik Problem Senaryosu

Acme Retail, bir lojistik ortağından bölgesel bir Cloud Storage bucket’ına günlük olarak CSV dosyaları almaktadır. Dosyalar ara sıra bozuk satırlar içermektedir. Acme’nin bu verileri alması, doğrulaması, analize hazır bir formata dönüştürmesi ve neredeyse gerçek zamanlı panolar için BigQuery’ye yüklemesi, aynı zamanda hatalı satırları inceleme için saklaması ve yönetişimi uygulaması gerekmektedir.

Yaklaşım:

  1. Ham veriyi Dataplex’te konumlandırın ve yönetin

    • gs://acme-raw/logistics/ yoluna eşlenmiş bir ham bölge (raw zone) varlığı ile bir Dataplex gölü oluşturun.
    • Gerekçe: Merkezi yönetişim, meta veri ve veri kökeni (lineage). IAM’i bölge düzeyinde uygulayın ve alt sistemlerde uygulanması için hassas alanları ilke etiketleriyle (policy tags) etiketleyin.
  2. Yaşam döngüsü ve saklama politikalarını uygulayın

    • acme-raw üzerinde 30 günlük bir bucket saklama politikası uygulayın ve nesne sürüm oluşturmayı (object versioning) etkinleştirin.
    • Gerekçe: Ortağın kazara üzerine yazma/silme işlemlerine karşı korur; kısa saklama süresi maliyet ve kurtarılabilirliği dengeler. Sürüm oluşturma, hatalı teslimatların geri alınmasını kolaylaştırır.
  3. Bir Dataflow toplu iş hattı (batch pipeline) ile doğrulayın ve veri alın

    • Nesne sonlandırma bildirimleri üzerine günlük bir Dataflow işi tetikleyin. CSV’yi şema ve kayıt bazında doğrulama ile okuyun; geçerli kayıtları BigQuery hazırlık (staging) tablosuna (event_date’e göre bölümlenmiş) yazın ve ayrıştırma/doğrulama hatalarını bir dead-letter BigQuery tablosuna yönlendirin.
    • Gerekçe: Dataflow, ölçeklenebilir paralel ayrıştırma ve sağlam dead-letter yönetimi sunar, böylece analistler bozuk satırları inceleyebilir. Bu, heterojen CSV kalitesi için en iyi uygulamayı yansıtır.
  4. Düzenlenmiş bölgede (curated zone) Parquet formatına dönüştürün ve sıkıştırın

    • Aynı iş hattı, doğrulanmış verileri gs://acme-curated/logistics/date=YYYY-MM-DD/ yoluna ~256–512 MB boyutunda Parquet dosyaları olarak yazar.
    • Gerekçe: Parquet, BigQuery ve Spark’ta sütun ayıklama (column pruning) ve koşul itme (predicate pushdown) özelliklerini etkinleştirerek taranan bayt miktarını düşürür ve gecikmeyi iyileştirir; sıkıştırma (compaction), ortağın teslimat modelinden kaynaklanan küçük dosya ek yükünü azaltır.
  5. Yönetilen analitiği BigLake aracılığıyla kullanıma sunun

    • Düzenlenmiş Parquet yolu üzerinde Hive otomatik bölümleme ile bir BigLake harici tablosu oluşturun; ortağa özgü filtreler için sütun düzeyinde ilke etiketleri (policy tags) ve satır erişim politikaları (row access policies) uygulayın.
    • Gerekçe: Merkezi denetim ile BigQuery ve Spark genelinde tek tip, ayrıntılı erişim. Bölüm ayıklama (partition pruning), tarih filtrelerindeki tarama maliyetlerini azaltır.
  6. Kritik özet verileri yerel BigQuery’ye yükleyin

    • Sık kullanılan (hot) panolar için, düzenlenmiş Parquet harici tablosundan son N günlük veriyi yerel, kümelenmiş ve bölümlenmiş bir tabloya alan zamanlanmış bir BigQuery işi çalıştırın.
    • Gerekçe: Yerel depolama, yüksek eşzamanlı BI’ı hızlandırırken, harici BigLake tablosu daha geniş erişim için yönetilen kayıt sistemi (system-of-record) olarak kalır.
  7. Cloud Logging ve Pub/Sub ile izleyin ve uyarı oluşturun

    • Dataflow ve BigQuery yükleme işi sonuçlarını Pub/Sub’a filtreleyen bir log havuzu (log sink) oluşturun; hatalar veya artan bozuk satır oranları için anlık uyarılar almak üzere izleme aracıyla entegre edin.
    • Gerekçe: Sürekli sorgulama (polling) olmadan hedeflenmiş, tabloya özgü operasyonel görünürlük; SRE uygulamalarını destekler.
  8. Depolama sınıfını ve yerleşimi optimize edin

    • Düzenlenmiş Parquet’i 14 gün boyunca Standard sınıfında tutun, 30 gün sonra yaşam döngüsü kuralı ile Coldline’a geçirin; çıkış trafiğini (egress) önlemek için hem ham hem de düzenlenmiş bucket’ları BigQuery veri setleriyle aynı bölgede saklayın.
    • Gerekçe: Sık okuma (hot read) performansını maliyetle dengeler. Aynı yerde konumlandırma, uyumluluğu sürdürür ve gecikme ile çıkış (egress) ücretlerini en aza indirir.
  9. Uçtan uca kaliteyi doğrulayın

    • Her çalıştırmadan sonra, hazırlık (staging), düzenlenmiş harici ve yerel BigQuery tabloları arasındaki sayımları ve hash özetlerini karşılaştırın; anormallikleri karantinaya alın.
    • Gerekçe: Şema kaymasının veya veri alım regresyonlarının erken tespiti; kriptografik veya parmak izi (fingerprint) hash’leri, tam yeniden tarama olmadan hafif bir güvence sağlar.

Bu tasarım, dead-letter analizi ile dayanıklı veri alımı, verimli sorgular için analize hazır Parquet, Dataplex ve BigLake aracılığıyla merkezi yönetişim ve maliyet optimizasyonlu yaşam döngüsü politikaları sunar; tüm bunları yaparken en az ayrıcalıkla erişim (least-privilege access) ve denetlenebilir operasyonlara bağlı kalır.


Veri Mühendisliği Mimarisi ve Tasarımı · Tüm alanlar · BigQuery Analitiği ve Veri Ambarı Mühendisliği

Bu soruları çözün → · ExamRoll.io’da süreli pratik →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Sınavınızı geçin →

Google'a göz atın →

Related guides

Hepsi bir arada erişim

Tek abonelik. Her sınav.

Her plan, sınırsız cevap aramayı, pratik testlerini, AI açıklamalarını ve tam kaynak kütüphanesini — 20'den fazla dilde — açar.

Aylık
24.87
Just €0.83/day
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

En iyi değer
12 ay
179.87
Just €0.49/daySave 40%
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

✓ Ücretsiz plan dahil · ✓ İstediğiniz zaman iptal edin · ✓ Tüm planlar tam ürünü açar