Google PCA: Kosten, Performance und nachhaltiges Cloud-Design — Lernleitfaden
Teil des Google Professional Cloud Architect — Lernleitfaden. Üben Sie mit verifizierten Antworten im Google-Prüfungscenter, oder absolvieren Sie zeitlich begrenzte Übungstests auf ExamRoll.io.
Überblick
Kosten, Leistung und nachhaltiges Cloud-Design sind gemeinsam zu optimierende Disziplinen. Der Aufbau effizienter Architekturen auf Google Cloud erfordert finanzielle Transparenz, eine elastische Kapazität, die der Nachfrage folgt, eine strikte Handhabung des Datenlebenszyklus, eine fundierte Platzierung und Caching für Netzwerke sowie eine kontinuierliche Messung. Dieser Abschnitt erläutert Design- und Betriebsmuster, die Verschwendung reduzieren, ohne Zuverlässigkeit, Sicherheit oder Leistung zu beeinträchtigen, und hebt Fehlermodi und Kompromisse hervor, um kostspielige Überraschungen zu vermeiden.
Kostenarchitektur und finanzielle Verantwortlichkeit
Etablieren Sie Finanzkontrollen als Teil Ihrer Plattform-Baseline.
Abrechnungsanalyse und -zuweisung
- Exportieren Sie Abrechnungsdaten nach BigQuery für eine abfragbare Ausgabenanalyse nahezu in Echtzeit nach Projekt, Dienst, SKU und Label. Partitionieren Sie nach Tag für skalierbare Abfragen und richten Sie Zugriffskontrollen für Datasets für Finanz- und Technik-Stakeholder ein.
- Verwenden Sie Budgets mit Warnschwellenwerten, um Ausgabenabweichungen zu verhindern. Leiten Sie Budget-Benachrichtigungen an Pub/Sub weiter und automatisieren Sie Reaktionen (zum Beispiel das Anhalten unkritischer Workloads). Beachten Sie, dass Benachrichtigungen nicht transaktional sind und Meldeverzögerungen aufweisen können; verlassen Sie sich nicht allein auf sie als Kontrolle für außer Kontrolle geratene Jobs.
Labels, Tags und Kostenzuordnung
- Standardisieren Sie unternehmensweite Labels (cost_center, env, owner, app) und erzwingen Sie diese zur Bereitstellungszeit mit Deployment-Vorlagen oder Policy-as-Code.
- Bevorzugen Sie hierarchische Tags und eine Ordner-/Projektstruktur, um Chargeback-/Showback-Modelle abzubilden. Verwenden Sie sowohl Labels (auf Ressourcenebene) als auch Tags (für Richtlinien- und Abrechnungsumfang), um eine präzise Zuweisung zu erreichen.
Budget-Leitplanken und Anomalieerkennung
- Konfigurieren Sie Budgets pro Projekt und pro Portfolio; legen Sie mehrere Schwellenwerte fest (z. B. 50, 80, 100 Prozent) sowie „prognostizierte“ Benachrichtigungen für proaktives Handeln.
- Nutzen Sie Recommender-Empfehlungen (inaktive VMs, nicht angehängte Laufwerke, IPs, ungenutzte Commitments), um Verschwendung kontinuierlich zu reduzieren.
Praktische Beispiele
Labels bei der Erstellung anwenden:
undefined
- Fragen Sie den Abrechnungsexport nach nicht gekennzeichneten Ausgaben ab, um die Einhaltung durch CI/CD-Prüfungen zu erzwingen.
Häufige Fehlermodi und Kompromisse:
- Inkonsistente Labels machen die Kostenzuordnung unmöglich; erzwingen Sie dies mit Organisationsrichtlinien und Validierung in Pipelines.
- Eine zentralisierte Abrechnung ohne teambezogene Budgets behindert die Verantwortlichkeit; erstellen Sie Budgets auf Team- oder Produktebene.
- Verzögerte Budget-Benachrichtigungen bedeuten, dass schnelle Spitzenwerte das Budget überschreiten können; ergänzen Sie nach Möglichkeit Obergrenzen und Kontingente.
Recheneffizienz und Leistung
Passen Sie Ressourcen an Workload-Profile an, automatisieren Sie die Elastizität und reservieren oder rabattieren Sie die stabile Grundlast.
Rightsizing und benutzerdefinierte Maschinentypen
- Analysieren Sie kontinuierlich CPU, Arbeitsspeicher, Festplatten-IOPS und Netzwerkauslastung für das Rightsizing. Verwenden Sie benutzerdefinierte Maschinentypen, um vCPU und Arbeitsspeicher an den tatsächlichen Bedarf der App anzupassen und zu vermeiden, für ungenutzten Arbeitsspeicher zu bezahlen.
- Achten Sie auf Leistungsreserven: Streben Sie eine dauerhafte CPU-Auslastung von 60–75 Prozent an und stellen Sie sicher, dass die Arbeitsspeicherreserven für GC oder Lastspitzen ausreichen. Zu aggressives Rightsizing erhöht das Risiko von Drosselung oder OOMs (Out-of-Memory-Fehlern).
Autoscaling und Lebenszyklus-Planung
- Verwenden Sie das Autoscaling für verwaltete Instanzgruppen basierend auf relevanten Signalen (CPU, Load-Balancer-Kapazität oder benutzerdefinierte Warteschlangentiefe). Konfigurieren Sie Aufwärmphasen und Scale-In-Kontrollen, um „Thrashing“ (instabiles Skalierungsverhalten) zu verhindern.
- Planen Sie für Umgebungen, die nicht rund um die Uhr laufen, das Starten/Stoppen von VMs, GKE-Knotenpools oder der Mindestanzahl von Cloud Run-Instanzen, um Ausgaben für ungenutzte Ressourcen zu vermeiden. Ein einfacher erster Schritt ist, mit Cloud Scheduler einen Cloud Run-Job auszulösen, der Entwicklungsinstanzen nachts stoppt.
Rabattinstrumente
- Rabatte für zugesicherte Nutzung (Committed-use discounts): Sichern Sie eine Nutzung von 1–3 Jahren für stabile Workloads zu, die für Commitments in Frage kommen. Stimmen Sie die Größe des Commitments auf die historische Nutzung und die Geschäftsprognosen ab; überdimensionierte Commitments verschwenden Geld.
- Spot VMs: Ideal für fehlertolerante, Batch- oder verteilte Workloads. Sie können jederzeit zurückgefordert werden; implementieren Sie Checkpointing und Multi-Instanzgruppen mit On-Demand-Fallbacks.
- Beispiel:
undefined
- Kapazitätsreservierungen: Reservieren Sie zonale oder regionale Kapazität für kritische Flotten, um Fehler beim Hochskalieren während regionaler Engpässe zu vermeiden.
- Beispiel:
undefined
- Auslastungsmetriken und Leistungsoptimierung
- Instrumentieren Sie mit Cloud Monitoring, Profiler und Trace. Messen Sie p50/p95-Latenz, CPU Steal, GC-Zeit und Warteschlangen-Backlogs. Optimieren Sie „Hot Code Paths“ (häufig ausgeführte Codepfade), bevor Sie horizontal skalieren.
- Binden Sie leistungsempfindliche Workloads an Regionen und Zonen mit geeigneten CPU-Plattformen und ziehen Sie bei Bedarf Persistent Disks mit hohem Durchsatz oder Hyperdisk in Betracht.
Fehlermodi und Kompromisse:
- Unbegrenztes Autoscaling kann Kontingente und Kostenziele überschreiten; erhöhen Sie Kontingente vorab, legen Sie eine maximale Anzahl von Replikaten fest und nutzen Sie prädiktives Autoscaling für bekannte Lastspitzen.
- Spot VMs können zu Fluktuation in Teilen der Flotte führen; verteilen Sie die Last auf verschiedene Zonen und implementieren Sie Hooks für eine ordnungsgemäße Beendigung (Graceful Termination).
- Überdimensionierte CUDs oder nicht ausgelastete Reservierungen führen zu unumkehrbaren Kosten (Sunk Costs); überprüfen Sie Commitments vierteljährlich.
Kosten-Leistungs-Verhältnis von Speicher, Datenbanken und Analysen
Wählen Sie Speicherkategorien und Datenbankkapazitätsmodelle, die den Zugriffsmustern, der Aufbewahrung und den Leistungs-SLOs entsprechen.
- Speicherkategorien und Lebenszyklusrichtlinien
- Verwenden Sie Standard für „heiße“ Daten (hot), Nearline für monatlichen Zugriff, Coldline für vierteljährlichen Zugriff und Archive für langfristigen, seltenen Zugriff. Halten Sie Daten und Rechenleistung in derselben Region, um Egress-Kosten zu vermeiden.
- Wenden Sie Lebenszyklusmanagement an, um Objekte automatisch zu verschieben oder zu löschen. Beachten Sie Mindestspeicherdauern und Abrufgebühren; vorzeitige Klassenwechsel können mehr kosten als sie einsparen.
Beispiel für eine Lebenszyklusrichtlinie (Löschen nach mehr als 90 Tagen):
undefined
-
undefined
Datenübertragung und Archivierung
- Regionsübergreifender Zugriff verursacht oft Egress-Kosten; platzieren Sie Produzenten und Konsumenten am selben Standort (Co-Location). Verwenden Sie Private Google Access und VPC-SC für einen sicheren, kostenbewussten Zugriff auf Google-APIs. Vermeiden Sie bei Langzeitarchiven den häufigen Abruf aus Archive, um hohe Abrufgebühren zu verhindern.
Dimensionierung und Leistung von Datenbanken
- Relational: Dimensionieren Sie für den speicherresidenten Arbeitssatz (Working Set), IOPS und Lesereplikas. Aktivieren Sie die automatische Speichererweiterung und überwachen Sie die Replikationsverzögerung (Replication Lag); skalieren Sie vertikal oder sharden Sie horizontal, wenn die Verzögerung RPO/RTO gefährdet.
- NoSQL/Zeitreihen: Verwenden Sie Bigtable für die Erfassung mit hohem Durchsatz und geringer Latenz mit einem geeigneten Zeilenschlüsseldesign, um Hotspots zu vermeiden.
Kostenkontrollen und Kapazitätsmodelle für BigQuery
- On-Demand (pro gescanntem TB): schneller Start, Risiko von Kostenspitzen. Kapazitätsbasierte Reservierungen: vorhersagbare Ausgaben, Kontrolle über Gleichzeitigkeit und Durchsatz. Flex-Commitments fangen kurzfristige Spitzen ab.
Optimieren Sie Abfragen durch Partitionierung und Clustering; erzwingen Sie Partitionsfilter, um vollständige Tabellenscans zu verhindern:
undefined
Legen Sie pro Job ein Maximum an abgerechneten Bytes fest, um die Ausgaben zu begrenzen:
undefined
- Verwenden Sie materialisierte Ansichten, den Ergebniscache, approximative Aggregationen und vermeiden Sie
SELECT *in der Produktion. Halten Sie Speicher und Rechenleistung in derselben Region.
Fehlermodi und Kompromisse:
- Das Verschieben von „heißen“ Objekten (hot) nach Coldline/Archive löst Abrufkosten und Gebühren für vorzeitiges Löschen aus.
- BigQuery On-Demand ohne Kontrollen kann durch ungefilterte Scans zu unkontrollierbaren Kosten führen; erzwingen Sie ein Maximum an abgerechneten Bytes und Partitionsfilter.
- Übermäßiges Sharding von Datenbanken erhöht die betriebliche Komplexität; führen Sie vor dem Aufteilen Benchmarks durch.
Netzwerke, Durchsatz, Kontingente und nachhaltiges Design
Datenverschiebung und das Design der Nebenläufigkeit beeinflussen Kosten und Leistung stark; Nachhaltigkeitsaspekte verfeinern die Platzierung und Zeitplanung zusätzlich.
Netzwerk-Egress, regionsübergreifender Datenverkehr, CDN und Caching
- Minimieren Sie Hops zwischen Regionen; replizieren Sie Daten nur dorthin, wo es die Nähe zum Benutzer oder Compliance-Anforderungen erfordern. Verwenden Sie Cloud CDN, um statische und zwischenspeicherbare dynamische Inhalte auszulagern; optimieren Sie Cache-Schlüssel, TTLs und signierte URLs für hohe Trefferquoten.
- Cachen Sie nahe an den Clients (CDN), am Rande Ihrer VPC (Proxy-Cache) und innerhalb von Diensten (In-Memory-Caches wie Memorystore). Achten Sie auf veraltete Daten und Invalidierungsstürme; definieren Sie explizite Cache-Control-Header.
Leistungsmessung, Lasttests und Skalierung
- Legen Sie SLOs fest und messen Sie diese mit Cloud Monitoring, Uptime-Prüfungen, Cloud Trace und Profiler. Verfolgen Sie p95/p99-Latenz und Sättigungssignale.
- Führen Sie Lasttests mit realistischen Daten und Bedenkzeit (Think Time) durch. Führen Sie Tests gestaffelt durch, um das Auslösen globaler Ratenbegrenzungen zu vermeiden; beantragen Sie temporäre Kontingenterhöhungen.
- Skalieren Sie den Durchsatz durch horizontale Replikate, geshardete Warteschlangen, partitionierte Themen und Autoscaler, die von Backlog-Metriken gesteuert werden. Bevorzugen Sie nach Möglichkeit asynchrone Pipelines.
Kontingente, Nebenläufigkeit, Ratenbegrenzungen und Backpressure
- Inventarisieren Sie die dienstspezifischen Kontingente pro Region; erzwingen Sie clientseitiges exponentielles Backoff mit Jitter für 429/5xx-Antworten. Implementieren Sie Zulassungssteuerung (Admission Control) und warteschlangenbasiertes Backpressure, um Abhängigkeiten zu schützen.
- Optimieren Sie die Flusssteuerung (Flow Control) von Pub/Sub (maximale ausstehende Nachrichten/Bytes), das Batching und die Parallelität. Passen Sie in Cloud Run und GKE die Nebenläufigkeit (Concurrency) an CPU und Speicher an (Right-Sizing), um eine Inflation der Tail-Latenz zu verhindern.
Nachhaltigkeitsbewusstes Design
- Bevorzugen Sie Serverless- und Managed Services mit hoher Auslastung. Wählen Sie Regionen mit einem höheren Anteil an kohlenstofffreier Energie, wenn Latenz und Compliance dies zulassen.
- Planen Sie Batch- und flexible Jobs in Zeitfenstern mit geringem Kohlenstoffausstoß; nutzen Sie das Carbon Footprint Reporting, um die Auswirkungen zu verfolgen.
- Verwenden Sie energieeffiziente Maschinentypen und ziehen Sie ARM-basierte Rechenleistung in Betracht, wo diese kompatibel ist, um die Leistung pro Watt zu verbessern.
Governance, die Zuverlässigkeit, Sicherheit, Leistung und Kosten ausbalanciert
- Definieren Sie architektonische Leitplanken (Guardrails): obligatorische Labels, Budget-Benachrichtigungen, Organisationsrichtlinien (z. B. Einschränkung externer IPs), SLO-/Fehlerbudgets und Kosten-SLOs.
- Führen Sie regelmäßige Überprüfungen der Kosten-Leistungs-Relation mit den Abteilungen Engineering, Sicherheit und Finanzen durch. Integrieren Sie Recommender und benutzerdefinierte Dashboards; erstellen Sie Runbooks zur Problembehebung.
- Wägen Sie Kompromisse explizit ab: Multi-Region vs. Regional (Dauerhaftigkeit und Latenz vs. Kosten und Egress), Verschlüsselungs- und Inspektionsschichten (Sicherheit vs. CPU und Latenz) und aggressives Autoscaling (Leistung vs. Kontingent- und Ausgabenrisiko).
Typische Fehlermodi und Kompromisse:
- Regionsübergreifende Analysen auf einem Datensatz in einer einzigen Region verursachen anhaltenden Egress; replizieren oder verlagern Sie die Rechenleistung.
- Eine Fehlkonfiguration des CDN führt zu niedrigen Trefferquoten; überwachen Sie Cache-Treffer und Origin-Egress, um Einsparungen zu validieren.
- Fehlendes Backpressure bei Teilausfällen verstärkt den Fehler; implementieren Sie Circuit Breaker und werfen Sie Last kontrolliert ab (Load Shedding).
Praktisches Problemszenario
Acme Learn, ein Online-Bildungsunternehmen, verzeichnet bei Live-Events unvorhersehbare Lastspitzen am Abend. Die Kosten steigen durch regionsübergreifende BigQuery-Abfragen, Autoscaling-Schübe und den Egress von statischen Assets stark an. Die Führungsebene möchte zudem die CO2-Bilanz verbessern, ohne die Benutzererfahrung zu beeinträchtigen.
Ansatz:
Konsolidierung der Abrechnungstransparenz und Durchsetzung der Kostenzuordnung
- Erstellen Sie einen Abrechnungsexport nach BigQuery und Dashboards, die nach Produkt, Umgebung und Region segmentiert sind, unter Verwendung von Labels und Tags, die in Deployment-Vorlagen standardisiert sind.
- Begründung: Die nahezu in Echtzeit verfügbare Transparenz verknüpft Ausgaben mit den verantwortlichen Teams und ermöglicht so die Budgetverantwortung. Labels ermöglichen eine granulare Kostenverrechnung (Chargeback) und Anomalieerkennung.
Neugestaltung der Analytik zur gemeinsamen Platzierung von Rechenleistung und Speicher (Co-Location)
- Verschieben Sie Event-Analyse-Datensätze und geplante Abfragen in dieselbe Region wie die Stream-Prozessoren. Stellen Sie für BigQuery Teams mit hohem Volumen von On-Demand auf Kapazitätsreservierungen um, die für die Spitzenlast-Nebenläufigkeit mit einem kleinen Flex-Puffer dimensioniert sind.
- Begründung: Die gemeinsame Platzierung eliminiert den Egress zwischen den Regionen. Kapazitätsbasiertes BigQuery stabilisiert die Kosten unter Last bei gleichbleibender Leistung.
Optimierung der Inhaltsauslieferung durch Edge-Caching
- Stellen Sie statischen und semi-dynamischen Lerninhalten ein Cloud CDN voran und legen Sie explizite Cache-Control-Header und signierte URLs für Premium-Inhalte fest. Passen Sie die TTLs basierend auf der Veränderlichkeit der Inhalte an.
- Begründung: Hohe Cache-Trefferquoten verlagern den Datenverkehr von den Ursprungsservern (Origins) an den Edge, was den Egress und die Rechenlast am Ursprung reduziert und gleichzeitig die Latenz während Lastspitzen verbessert.
Härtung von Autoscaling und Reservierungen für Live-Events
- Fügen Sie eine regionale verwaltete Instanzgruppe für die API-Schicht hinzu, deren Autoscaler-Ziele sowohl auf CPU als auch auf den Request-Backlog ausgerichtet sind. Erstellen Sie eine kleine zonale Kapazitätsreservierung, um Burst-Spielraum während der Events zu garantieren. Aktivieren Sie prädiktives Autoscaling vor geplanten Sitzungen.
- Begründung: Das Autoscaling mit zwei Signalen reagiert sowohl auf die Auslastung als auch auf die Nachfrage, während Reservierungen und prädiktives Aufwärmen Kaltstartlatenz und Kapazitätsengpässe vermeiden.
Anwendung eines Compute-Mix: Grundlast auf Commitments, Spitzenlast auf Spot
- Erwerben Sie 1-Jahres-Commitments für die Grundlast der API- und Datenverarbeitungs-Workloads. Konfigurieren Sie Batch-Transkodierungs- und Anreicherungsjobs auf Spot VMs mit Checkpointing und zonenübergreifenden Instanzgruppen.
- Begründung: Commitments reduzieren die Kosten für den Dauerbetrieb; Spot VMs bieten kostengünstige Elastizität für unterbrechbare Arbeiten, ohne den Benutzerverkehr zu gefährden.
Einführung eines Speicher-Lebenszyklus und regionaler Platzierung
- Bewahren Sie „heiße“ Kursmetadaten und Thumbnails in regionalem Standard-Speicher in der Nähe der bereitstellenden Rechenleistung auf. Überführen Sie Protokolle und rohe Clickstreams nach 30 Tagen in Nearline und löschen Sie sie nach 180 Tagen. Verwenden Sie für Compliance-Archive den Archive-Speicher mit dokumentierten Abruf-SLAs.
- Begründung: Richtet die Speicherklasse an den Zugriffsmustern aus, was die laufenden Kosten reduziert und gleichzeitig die Aufbewahrungsfristen einhält.
Einführung von Leitplanken für die BigQuery-Nutzung
- Fordern Sie Partitionsfilter für große Tabellen und legen Sie auf Projektebene Standardwerte für die maximal abzurechnenden Bytes pro Job fest. Führen Sie materialisierte Sichten für gängige Aggregate und partitionierte Ingestion-Muster ein.
- Begründung: Verhindert versehentliche vollständige Tabellenscans, stabilisiert die Ausgaben und beschleunigt häufige Abfragen.
Entwicklung für Durchsatz mit Backpressure und Kontingenten
- Integrieren Sie Cloud Tasks für ratenbegrenzte Workflows und konfigurieren Sie Pub/Sub-Abonnenten mit Flusssteuerung (Flow Control). Implementieren Sie exponentielles Backoff mit Jitter für Drittanbieter-APIs und legen Sie Obergrenzen für die Nebenläufigkeit pro Dienst in Cloud Run fest.
- Begründung: Steuert die Nachfrage, um Kontingente einzuhalten, schützt Abhängigkeiten bei Lastspitzen und vermeidet kaskadierende Ausfälle.
Verankerung von Nachhaltigkeit im Betrieb
- Bevorzugen Sie, wo machbar, Serverless, wählen Sie Regionen mit einem höheren Anteil an kohlenstofffreier Energie für Analysen und planen Sie nicht dringende Batch-Jobs in Zeitfenstern mit geringem Kohlenstoffausstoß. Verfolgen Sie die Emissionen mit Carbon Footprint und beziehen Sie diese in die vierteljährlichen Überprüfungen ein.
- Begründung: Verbessert die Leistung pro Watt und reduziert die CO2-Bilanz mit minimalen Kompromissen für den Endbenutzer.
Kontinuierliche Governance
- Erstellen Sie Budgets und Benachrichtigungen pro Produkt, erzwingen Sie Labels über Richtlinien und etablieren Sie monatliche Überprüfungen von Kosten, Leistung und SLOs. Automatisieren Sie die Bereinigung von ungenutzten Ressourcen und nicht angehängten Festplatten auf Basis des Recommenders.
- Begründung: Eine fortlaufende Governance sichert die erzielten Gewinne, verhindert Rückschritte und gleicht Zuverlässigkeit, Sicherheit, Leistung und Kosten im Laufe der Zeit aus.
Dieses Design reduziert den Egress, stabilisiert die Analysekosten, gewährleistet eine vorhersagbare Leistung bei Live-Events und fördert Nachhaltigkeitsziele, ohne die Benutzererfahrung zu beeinträchtigen.
← DevOps · Alle Domänen
Diese Fragen üben → · Zeitlich begrenzte Übung auf ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Bestehe deine Prüfung →