Google ACE: İzleme, Günlük Kaydı ve Operasyonel Sorun Giderme — Çalışma kılavuzu
Şunun bir parçası: Google Associate Cloud Engineer — Çalışma kılavuzu. Doğrulanmış cevaplarla şurada pratik yapın: Google sınav merkezi, veya şurada süreli deneme sınavları çözün: ExamRoll.io.
Genel Bakış
Google Cloud’da operasyonel mükemmellik, telemetriyi eyleme dönüştürmeye bağlıdır. İzleme, Loglama ve Sorun Giderme birlikte, servislerin güvenilir kalmasını sağlayan sinyalleri, koruma mekanizmalarını ve iş akışlarını sunar. Bu bölüm, temel gözlemlenebilirlik servislerini, teşhis araçlarını, güvenilirlik uygulamalarını ve olay operasyonlarını; tasarım gerekçeleri, ödünleşimler ve yaygın hata modlarıyla birlikte ele almaktadır.
İzleme ve Uyarı Temelleri
Cloud Monitoring, gösterge panoları, çalışma süresi denetimleri, SLO’lar ve uyarılar sağlamak için Google Cloud servislerinden, aracılardan ve özel metriklerden gelen zaman serilerini alır.
Metrikler ve kardinalite
- İzlenen kaynak türleri (örneğin, gce_instance, aws_ec2_instance, global), proje, bölge ve örnek kimliği gibi boyutları kapsar.
- Sorguları yavaşlatan ve maliyeti artıran yüksek kardinaliteli patlamaları önlemek için sınırsız etiket değerlerini (örneğin, user_id) en aza indirin.
- Gecikme için dağılım metriklerini (p50/p90/p99) tercih edin ve tutarlı toplamalar için hizalama pencerelerini kullanın.
Gösterge Panoları
- Hızlı bir başlangıç için yerleşik servis gösterge panolarını kullanın. Projeler arası metrikleri gruplamak için özel gösterge panoları oluşturun. Panelleri nedenden (CPU, bellek) önce semptoma (gecikme, hatalar, doygunluk) göre düzenleyin.
- Filolar için örnek başına grafiklerden kaçının; gürültüyü azaltmak ve sinyali artırmak için servis, bölge veya MIG’e göre birleştirin.
Uyarı politikaları
- Kullanıcı deneyimine bağlı semptom tabanlı uyarılar tasarlayın: kullanılabilirlik SLO tüketimi, gecikme yüzdelikleri, hata oranları. Hızlı ve yavaş tüketimi yakalamak için çoklu pencere, çoklu tüketim oranlı uyarılar kullanın (örneğin, 1 saatte %2 ve 5 dakikada %5).
- Makul bildirim hızı limitleri ve otomatik kapatma davranışları belirleyin. Runbook’ları belgelemek için olay otomatik müdahale ek açıklamalarını kullanın.
- Katı programlara sahip kritik toplu işler ve veri işlem hatları için metrik yokluğu uyarılarını kullanın.
- Log tabanlı metrikler, uygulama veya güvenlik olayları (örneğin, tekrarlanan permissionDenied) için uyarıları destekler.
Bildirim kanalları
- Kanalları önem derecesine göre yapılandırın: SEV1 için çağrı (nöbetçi, SMS, telefon), SEV2/3 için sohbet, düşük öncelikli olanlar için e-posta veya webhook’lar. Biletleme veya otomasyon ile entegrasyon için Pub/Sub kullanın.
- Kanalları periyodik olarak test edin; güncel olmayan kanallar sessiz bir hata modudur.
Çalışma süresi denetimleri ve sentetik izleme
- Global gözlem noktalarından yapılan HTTP(S) ve TCP denetimleri, dışarıdan erişilebilirliği doğrular. Kısmi arızaları tespit etmek için denetimleri içerik eşleşmesi ile birlikte kullanın.
- Dahili servisler için hibrit bağlantı veya Private Service Connect aracılığıyla özel çalışma süresi denetimlerini kullanın.
- Hata modları: denetimler DNS TTL gecikmesi, TLS sertifika rotasyon sorunları veya bölge kapsamlı kesintiler nedeniyle başarısız olabilir; çağrı yapmadan önce metriklerle doğrulayın.
Çok projeli izleme
- Birleştirilmiş gösterge panoları ve uyarılar için tek bir Monitoring çalışma alanı kullanın ve tüm projeleri bağlayın. Bu, filo genelindeki SLO’ları basitleştirir ve tekrarları azaltır.
Loglama, Denetim ve Uygulama Teşhisi
Cloud Logging, platform ve uygulama logları için log yönlendiricisi, depolama ve sorgu düzlemidir. Tamamlayıcı APM araçları (Error Reporting, Trace, Profiler) kök neden tespitini hızlandırır.
Log yönlendirme, bucket’lar, sink’ler ve saklama
- Sink’ler aracılığıyla log bucket’larına (varsayılan veya özel), BigQuery’ye (analitik), Pub/Sub’a (akış işleme) veya Cloud Storage’a (arşivleme) yönlendirin.
- Veri yerleşimi ve performans için bölgesel kapsamlı log bucket’ları kullanın. Uyumluluk gerektiriyorsa CMEK uygulayın.
- Bucket başına saklama süresi belirleyin (örneğin, operasyonlar için 30–90 gün, denetim için çok yıllık). Daha uzun saklama süresi maliyeti artırır; harcamayı kontrol etmek için agresif bir şekilde filtreleyin.
- Hariç tutmalar, ayrıntılı logların (örneğin, sağlık kontrolleri) alınmasını azaltır. İstemeden kritik logları atlamamak için filtreleri doğrulayın.
Örnek: denetim logları için bir BigQuery sink’i oluşturma
undefined
Örnek: bir hariç tutma oluşturma
undefined
Sorgular ve Log Gezgini
- resource.type, severity, labels ve JSON payload’ları üzerinde gelişmiş filtreler kullanın. Yaygın sorun ayıklama yolları (startup failures, permissionDenied, quotaExceeded) için sorguları kaydedin.
- Uyarı ve gösterge panoları için dağılım ve sayaç tipi log tabanlı metrikler oluşturun.
Cloud Audit Logs
- Yönetici Etkinliği logları: her zaman açık, alım için ücret yok; yönetici yazma işlemlerini (örneğin, createInstance) kaydeder.
- Veri Erişimi logları: okuma ve yazma veri düzlemi operasyonlarını (örneğin, storage.objects.get) kaydeder. Birçok servis için varsayılan olarak devre dışıdır; hacim ve maliyet yüksek olabileceğinden seçici olarak etkinleştirin.
- Sistem Olayı logları: Google sistem eylemleri (örneğin, otomatik ölçekleyici, bakım amaçlı canlı taşıma).
- İlke Reddi logları: IAM ve kuruluş ilkesi reddinin açık kayıtları. Erişim sorunlarını giderme ve güvenlik incelemeleri için kritiktir.
- Saklama ve inceleme için denetim loglarını BigQuery’ye yönlendirin; ilişkilendirme için authenticationInfo.principalEmail gibi etiketleri dizinleyin.
Error Reporting, Trace ve Profiler
- Error Reporting, yığın izlerini (stack trace) servis ve sürüme göre otomatik olarak gruplar; yeni hata grupları ve ani artışlar için bildirim kanallarıyla entegre edin.
- Cloud Trace, istek gecikme dağılımlarını ve span’leri toplar; ek yük ve doğruluk arasında denge kurmak için örneklemeyi ayarlayın (örneğin, yüksek QPS’li servisler için 1000’de 1, OpenTelemetry toplayıcıları kullanılıyorsa kuyruk tabanlı örnekleme ile).
- Profiler, üretim ortamında düşük ek yüklü sürekli CPU/heap profili oluşturma sağlar. Veri hacmini ve ek yükü kontrol etmek için sık kullanılan yollarla veya temsili iş yükleriyle sınırlayın. Okunabilir çağrı grafikleri için kaynak eşlemesi kullanın.
- Ödünleşimler: daha yüksek örnekleme, teşhisi iyileştirir ancak maliyeti ve potansiyel PII sızıntısını artırır; hassas alanları temizleyin ve tokenizasyon kullanın.
Servis, Kaynak ve Ağ Sorunlarını Giderme
Etkili sorun giderme, semptomlardan sistem sınırlarına, ardından kaynaklara ve bağımlılıklara doğru ilerler.
Yönetilen servis sağlığı, servis durumu, kotalar, bölgesel olaylar
- Bir olayın sizden kaynaklanıp kaynaklanmadığını (upstream) doğrulamak için servis sağlığını ve güncel bölgesel duyuruları kontrol edin. Hata patlamaları, yükselmiş gecikme süresi veya kota hatalarını arayın.
- Kotalar proje başına ve genellikle bölge başına uygulanır; loglardaki quotaExceeded ve rateLimitExceeded hataları kısıtlama (throttling) olduğunu gösterir. Yoğun olaylardan önce kota artışı talep edin.
- Hata modu: Kısmi bölgesel kesintiler aralıklı hatalar olarak görünebilir; mümkün olan yerlerde çok bölgeli yük devretme (failover) yapılandırın.
Kaynak sağlığı ve VM teşhisi
- Örnek (instance) operasyonlarını, bakım olaylarını ve sağlık kontrollerini kullanın. MIG’ler için, hatalı imajları veya yapılandırmaları izole etmek amacıyla otomatik onarım (autohealing) sonrası yeniden başlatmaları ve sağlık kontrolü hatalarını inceleyin.
Önyükleme (boot) ve çekirdek (kernel) mesajları için VM seri konsolu:
undefined
- Yaygın nedenler: çekirdek çökmeleri (kernel panic), önyüklemeyi engelleyen hatalı fstab girdileri, yanlış ağ yapılandırmaları, SSH hatalarına neden olan yanlış OS Login yapılandırması.
Sorumluluğu atanabilir erişim için kullanıcı başına SSH anahtarları ve IAM rolleri (compute.osLogin veya compute.osAdminLogin) ile OS Login kullanımını sağlayın.
Hata analizi için Logs Explorer
- Semptom logları (5xx, deadlineExceeded) ile başlayın, kaynak etiketlerine göre pivot yapın, ardından dağıtım değişiklikleri ve kota logları ile ilişkilendirin. Değişim noktalarını bulmak için histogram görünümlerini kullanın.
Ağ gözlemlenebilirliği
VPC Flow Logs: VNIC başına 5’li (5-tuple) trafik örneklemesi; alt ağlarda (subnet) etkinleştirin. Performans ve ayrıntı dengesi için örnekleme (örneğin, 0.5) ve meta veri seçeneklerini ayarlayın.
undefined
Güvenlik duvarı loglaması: Beklenmedik engellemeleri veya gölgede kalmış kuralları (shadowing) teşhis etmek için kritik kurallardaki izin verme/reddetme kararlarını yakalayın.
undefined
Connectivity Tests: VPC’ler, peering, Cloud VPN, Cloud Interconnect ve güvenlik duvarı kuralları arasındaki erişilebilirliği modelleyin ve doğrulayın. Değişiklik öncesi doğrulama ve olay triyajı için kullanışlıdır.
undefined
- Tamamlayıcı sinyaller: Dışarı giden (egress) ve uç (edge) sorunları için Cloud NAT ve yük dengeleyici (load balancer) logları. Hata modları arasında asimetrik yönlendirme, eksik rotalar, yanlış sıralanmış güvenlik duvarı kuralları ve ilke (policy) kısıtlamaları bulunur.
Güvenilirlik, SLO’lar ve Olay Operasyonları
Operasyonel disiplin, telemetriyi kullanıcıyı etkileyen hedeflerle ve tutarlı olay müdahalesiyle ilişkilendirir.
SLO’lar, hata bütçeleri ve referans çizgileri
- Kullanıcı odaklı SLI’lar (kullanılabilirlik, gecikme, doğruluk) üzerinde SLO’lar tanımlayın. Örnek: Okuma isteklerinin %99,9’u 30 gün boyunca 200 ms altında tamamlanır.
- Hata bütçelerini takip edin ve hizmet ile sürüm versiyonuna göre özet panolar tasarlayın. Yeni sürüm dağıtımlarını bütçe tüketimine göre denetleyin.
- Trafik artmadan önce performans referans çizgileri oluşturun; regresyonlar mutlak değerlerle değil, sapmalarla tespit edilir.
Uyarı gürültüsünü azaltma
- Örnek (instance) seviyesi uyarılar yerine hizmet seviyesi uyarıları tercih edin. Değişim oranı ve yüzdelik dilim tabanlı koşullar kullanın. Bakım pencereleri için bildirim kısıtlama, olayların otomatik kapatılması ve uyarıları sessize alma yöntemlerini uygulayın.
- Ortak etiketler ve politikalar aracılığıyla uyarıları tekilleştirin; aynı olay için hem veritabanı hem de uygulama ekiplerine çağrı (paging) yapılmasını önlemek için bağımlılık farkındalığı olan yönlendirme kullanın.
Olay müdahale iş akışı
- Önceliklendirin ve ciddiyet seviyesini belirleyin; rolleri atayın (olay komutanı, operasyonlar, iletişim, yazman).
- Eskalasyon yolları: nöbetçi (on-call) rotasyonları, konu uzmanları ve tedarikçi desteği (destek taleplerine proje ID’si, istek ID’leri, zaman damgaları ve bölgeleri ekleyin).
- İletişim: tek bir doğruluk kaynağı (sohbet kanalı ve olay dokümanı) oluşturun. Etki, etki azaltma ve tahmini çözüm süreleri (ETA) ile periyodik paydaş güncellemeleri sağlayın.
- Etki azaltma playbook’ları: geri alma (rollback), yük devretme (failover), özellik bayrağını (feature flag) devre dışı bırakma veya kapasite ekleme. Etki alanı dar, geri alınabilir değişiklikleri tercih edin.
Olay sonrası değerlendirme ve RCA (Kök Neden Analizi)
- Kanıta dayalı: metrikleri, logları, izleri (trace) ve değişiklik olaylarını ilişkilendirin. Hangi tespit sinyallerinin tetiklendiğini, neden tetiklenip tetiklenmediğini ve tespit/etki azaltma süresini dahil edin.
- Sadece en yakın nedeni değil, katkıda bulunan faktörleri de belirleyin. Sahipleri ve son teslim tarihleri olan somut eylem maddeleri oluşturun; runbook’ları ve uyarıları buna göre güncelleyin.
- Suçlayıcı olmayan kültür, tam şeffaflığı ve sistemsel düzeltmeleri teşvik eder.
Operasyonel runbook’lar
- Yapı: tetikleyici ve tespit, hızlı teşhis ağacı, güvenli etki azaltma yöntemleri, geri alma/geri yükleme adımları, doğrulama ve çıkış kriterleri.
- Komutları ve filtreleri kopyala-yapıştır için hazır tutun; müdahale edenler için en az ayrıcalıklı IAM’i doğrulayın (örneğin, yalnızca yazma amaçlı yedeklemeler için
storage.objectCreator; iş yükü kimliği için adanmış hizmet hesapları). - Runbook’ları değişiklik yönetimi ile versiyonlayın; game day’ler sırasında test edin.
Pratik Problem Senaryosu
Northwind Outfitters, Google Cloud üzerinde bölgesel bir e-ticaret platformu işletmektedir. Yakın zamanda yaşanan bir trafik artışının ardından, kullanıcılar aralıklı olarak ödeme sayfasında zaman aşımları ve yavaş ürün aramaları bildirmektedir. Operasyon ekibinin güvenilirliği hızla yeniden sağlaması, uyarı gürültüsünü azaltması ve birden çok projedeki teşhis yeteneklerini güçlendirmesi gerekmektedir.
Yaklaşım:
- Projeler arası izlemeyi birleştirin
- Eylem: Tek bir Monitoring çalışma alanı oluşturun ve prod, payments ve search projelerini bağlayın. Ödeme ve arama için kullanılabilirlik, gecikme ve hata oranlarını gösteren bir “Kullanıcı Yolculuğu” panosu oluşturun.
- Gerekçe: Merkezi görünürlük, hizmet seviyesinde önceliklendirmeyi destekler ve hizmetler arası sorunları (örneğin, arama gecikmesinin ödeme zaman aşımlarına kademeli olarak yansıması) ilişkilendirir.
- SLO’ları ve tüketim oranı (burn-rate) uyarılarını uygulayın
- Eylem: SLO’ları tanımlayın: %99,9 ödeme 400 ms altında, %99,95 arama 250 ms altında. Gecikme ve hata oranı SLI’ları üzerinde çok pencereli tüketim oranı uyarıları (1 saatte %2 ve 5 dakikada %5) oluşturun. Nöbetçi ekibi çağrı (paging) ile, paydaşları sohbet üzerinden bilgilendirin.
- Gerekçe: Tüketim oranı uyarıları, normal sapmalar için çağrı oluşturmadan hızlı regresyonları ve sürekli yavaşlamaları yakalar.
- İçerik eşleştirmeli sentetik çalışma süresi denetimleri ekleyin
- Eylem: Genel erişim noktaları için TCP ve HTTPS çalışma süresi denetimleri ve dahili ödeme API’sine özel bir çalışma süresi denetimi yapılandırarak yanıt gövdesinin “ok” içerdiğini doğrulayın.
- Gerekçe: Erişilebilirliği ve yanlış yönlendirilmiş arka uçlar veya performansı düşmüş üst sistemler gibi kısmi arızaları tespit eder.
- Log rotalarını ve saklama sürelerini sıkılaştırın
- Eylem: Adanmış log bucket’ları oluşturun: ops (90 gün), security-audit (2 yıl, CMEK). Admin Activity, Data Access, System Event ve Policy Denied loglarını analitik için sink’ler aracılığıyla BigQuery’ye yönlendirin. Gereksiz yere çok log üreten sağlık denetimleri için hariç tutma kuralları ekleyin.
- Gerekçe: Doğru boyutlandırılmış saklama süresi maliyetleri kontrol eder; BigQuery hızlı adli analiz sağlar. Hariç tutma kuralları, kritik kanıtları kaybetmeden gürültüyü azaltır.
- Uygulama teşhisini etkinleştirin
- Eylem: Hizmetleri Trace için OpenTelemetry ile enstrümante edin; arka uç ve ön uç için Error Reporting’i etkinleştirin; Profiler’ı, ödeme hizmetinde CPU ve heap profilleriyle ve konservatif örnekleme ile kullanıma alın.
- Gerekçe: Trace’ler gecikme darboğazlarını belirler; Error Reporting yeni hata gruplarını vurgular; Profiler, düşük ek yük ile CPU çekişmesini ve bellek sızıntılarını ortaya çıkarır.
- Ağ gözlemlenebilirliğini güçlendirin
- Eylem: Prod alt ağlarında VPC Flow Logs’u (0.5 örnekleme, tüm meta verileri dahil et) ve arama ile ödeme servislerine gelen trafik için izin ver/reddet kurallarında güvenlik duvarı loglamasını etkinleştirin. Web katmanından arama servisine ve ödeme servisinden Cloud SQL’e Connectivity Tests oluşturun.
- Gerekçe: Akış ve güvenlik duvarı logları; paket kayıplarını, yeniden iletimleri ve gölgelenmiş kuralları ortaya çıkarır; Connectivity Tests, erişilebilirliği doğrular ve yanlış yapılandırmaları belirler.
- Kaynak seviyesinde teşhis ve güvenli erişim
Eylem: Kararsız VM’ler için önyükleme sorunlarını seri konsol ile inceleyin:
undefined
- SSH gerekiyorsa, OS Login’i zorunlu kılın ve “ops-admins” grubuna
compute.osAdminLoginiznini verin. Her yönetici kendi SSH anahtarını kullanır. - Gerekçe: Seri konsol logları, çekirdek (kernel) ve başlangıç (init) hatalarını ortaya çıkarır. Kullanıcı başına anahtarlarla OS Login, kimin ne yaptığının belli olduğu, en az ayrıcalıklı erişimi sağlar.
- Kota ve bölgesel durum doğrulaması
- Eylem: Loglardaki son
quotaExceededolaylarını inceleyin; arama otomatik ölçeklendirmesi için bölgesel API ve IP kotasını artırın. Etkilenen bölge için hizmet durumu bilgilendirmelerini kontrol edin; yük dengeleyici ağırlıklandırması ile trafiği geçici olarak kaydırın. - Gerekçe: Kota kısıtlamaları ve bölgesel olaylar, yaygın aralıklı arıza kaynaklarıdır; proaktif ölçeklendirme ve trafik yönlendirme etkiyi azaltır.
- Gürültü azaltma ve runbook güncellemeleri
- Eylem: Örnek başına CPU uyarılarını hizmet seviyesi doygunluk uyarıları ile değiştirin. Eylem gerektirmeyen uyarıları sessize almak için bakım pencereleri ekleyin. Runbook’ları yeni önceliklendirme sorguları, trace panoları ve geri alma prosedürleri ile güncelleyin.
- Gerekçe: Çağrı (paging) yorgunluğunu azaltır ve tutarlı, güvenli müdahaleleri hızlandırır.
- Olay sonrası değerlendirme ve eylemler
- Eylem: Suçlayıcı olmayan bir değerlendirme yapın. Tüketim oranı olaylarını, artan arama kuyruk gecikmesi ve yakın zamanda yapılan bir indeks dağıtımı ile ilişkilendirin. Eylem maddeleri: arama için kanarya (canary) dağıtımları, indeks boyutu için koruma mekanizmaları ve otomatik ölçeklendirici için ek pay ekleyin; periyodik uyarı kanalı testleri yapmayı taahhüt edin.
- Gerekçe: Kanıta dayalı RCA, tekrarı önler ve tespit, etki azaltma ve dayanıklılığı iyileştirir.
← Dağıtım · Tüm alanlar · Güvenlik →
Bu soruları çözün → · ExamRoll.io’da süreli pratik →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Sınavınızı geçin →