EduLogic wil twee Bedrock-modellen vergelijken op nauwkeurigheid van antwoorden en veiligheid voordat er één in productie wordt genomen. Ze moeten automatische, herhaalbare metingen op schaal uitvoeren en ook menselijke beoordelingen verzamelen voor edge cases. Welke architectuur implementeert het beste zowel geautomatiseerde evaluatie met ingebouwde metrics als menselijke evaluatie voor gesamplede outputs?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Maak een geautomatiseerde evaluatietaak in Bedrock (of de Bedrock evaluation API) die de modellen uitvoert op een gelabelde testset (JSONL met input/referentieparen) en ingebouwde metrics berekent (BLEU/ROUGE/F1, veiligheidsscores). Bewaar evaluatie-artefacten en metrische rapporten in S3. Voor menselijke evaluatie, sample een gestratificeerde subset van modeloutputs en maak een SageMaker Ground Truth labeling job (of gebruik Amazon A2I) met een aangepaste labeling UI om menselijke beoordelingen te verzamelen; combineer menselijke labels met automatische metrics voor de uiteindelijke modelselectie..
Waarom dit het antwoord is
De correcte optie combineert geautomatiseerde en menselijke evaluatie efficiënt. Bedrock's evaluatietaak biedt ingebouwde metrics (zoals BLEU/ROUGE/F1 en veiligheidsscores) voor schaalbare, herhaalbare metingen op een gelabelde dataset, wat cruciaal is voor objectieve modelvergelijking. Het opslaan van artefacten in S3 zorgt voor duurzaamheid en traceerbaarheid. Voor menselijke beoordeling van edge cases, biedt SageMaker Ground Truth of Amazon A2I een gestructureerde manier om menselijke feedback te verzamelen op een gesamplede subset, wat kosteneffectief is en toch kwalitatieve inzichten oplevert. De andere opties zijn minder geschikt: Het parsen van CloudWatch Logs met Lambda voor metrics is omslachtig en minder nauwkeurig dan Bedrock's ingebouwde evaluatie. Handmatige samenvoeging van feedback is inefficiënt en niet schaalbaar. SageMaker Model Monitor is primair voor monitoring in productie en Bedrock heeft geen ingebouwde menselijke beoordelingswachtrij die automatisch wordt aangemaakt voor ambigue gevallen. Alleen menselijke evaluatie via Mechanical Turk voor alle outputs is extreem duur, tijdrovend en niet schaalbaar, en negeert de waarde van geautomatiseerde, objectieve metrics.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig