Een data engineer moet eenmalig Apache Parquet-objecten in een S3-bucket lezen en slechts één kolom extraheren. Welke optie bereikt dit met minimale operationele overhead?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik S3 Select om een SQL SELECT-statement te schrijven om de vereiste kolom uit de S3-objecten op te halen..
Waarom dit het antwoord is
S3 Select is de meest efficiënte oplossing omdat het je in staat stelt om SQL-query's rechtstreeks op objecten in S3 uit te voeren, inclusief Parquet-bestanden, zonder het hele object te hoeven downloaden of een compute-cluster te starten. Dit minimaliseert de operationele overhead en de kosten. De andere opties zijn minder optimaal: Een AWS Lambda-functie met pandas zou het hele Parquet-object moeten downloaden en in het geheugen laden, wat inefficiënt is voor grote bestanden en hogere kosten met zich meebrengt. AWS Glue DataBrew is een visuele tool voor datatransformatie en -opschoning, wat overdreven is voor een eenvoudige kolomextractie en meer operationele overhead vereist. Het uitvoeren van een AWS Glue crawler en vervolgens Amazon Athena gebruiken, voegt extra stappen en componenten toe (crawler, Glue Data Catalog, Athena-engine) die niet nodig zijn voor deze eenmalige, gerichte taak.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig