EduLogic vuole confrontare due modelli Bedrock per l'accuratezza delle risposte e la sicurezza prima di implementarne uno in produzione. Hanno bisogno di eseguire metriche automatiche e ripetibili su larga scala e anche di raccogliere giudizi umani per i casi limite. Quale architettura implementa al meglio sia la valutazione automatizzata con metriche integrate sia la valutazione umana per gli output campionati?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Creare un job di valutazione automatizzata in Bedrock (o l'API di valutazione Bedrock) che esegua i modelli su un set di test etichettato (JSONL con coppie input/riferimento) e calcoli metriche integrate (BLEU/ROUGE/F1, punteggi di sicurezza). Persistere gli artefatti di valutazione e i report delle metriche su S3. Per la valutazione umana, campionare un sottoinsieme stratificato degli output del modello e creare un job di etichettatura SageMaker Ground Truth (o usare Amazon A2I) con un'interfaccia utente di etichettatura personalizzata per raccogliere giudizi umani; combinare le etichette umane con le metriche automatiche per la selezione finale del modello..
Perché questa è la risposta
L'opzione corretta descrive l'approccio più completo e scalabile. Utilizza la valutazione automatizzata di Bedrock (o l'API) per metriche integrate come BLEU/ROUGE/F1 e punteggi di sicurezza su larga scala, essenziale per il confronto iniziale dei modelli. La persistenza su S3 garantisce la tracciabilità. Per i casi limite e le sfumature umane, il campionamento stratificato degli output e l'uso di SageMaker Ground Truth o Amazon A2I con un'interfaccia personalizzata permettono di raccogliere giudizi umani mirati ed efficienti. La combinazione di metriche automatiche e feedback umano fornisce una valutazione robusta per la selezione del modello. Le altre opzioni sono meno efficaci: L'esecuzione in tempo reale con CloudWatch e Lambda per le metriche è meno strutturata e non ottimizzata per la valutazione comparativa di modelli pre-produzione. Il feedback umano tramite un modulo web pubblico è inefficiente e non scalabile. SageMaker Model Monitor è per il monitoraggio in produzione, non per la valutazione comparativa pre-produzione. L'affermazione che Bedrock creerebbe automaticamente una coda di revisione umana integrata non è accurata. Affidarsi esclusivamente a Mechanical Turk per tutti gli output è estremamente costoso, lento e non scalabile per grandi volumi, e ignora i benefici delle metriche automatiche che forniscono una base quantitativa.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta