AmazonAmazon ML Engineer Associate MLA-C01 Certification
·TW
·更新於 4 Aug 2026
EduLogic 希望在將其中一個 Bedrock 模型投入生產之前,比較兩個模型的答案準確性和安全性。他們需要大規模執行自動化、可重複的指標,並針對邊緣案例收集人工判斷。哪種架構最能實現內建指標的自動化評估和抽樣輸出的S人工評估?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 在 Bedrock 中建立自動化評估任務(或 Bedrock 評估 API),在帶有標籤的測試集(包含 input/reference 對的 JSONL)上執行模型,並計算內建指標(BLEU/ROUGE/F1、安全分數)。將評估產物和指標報告儲存到 S3。對於人工評估,對模型輸出進行分層抽樣,並建立 SageMaker Ground Truth 標記任務(或使用 Amazon A2I)以及自訂標記 UI 來收集人工判斷;將人工標籤與自動化指標結合,以進行最終的模型選擇。.
為什麼這是答案
正確答案提供了一種全面且可擴展的方法,結合了自動化評估和人工判斷。Bedrock 評估任務(或 API)允許在大規模上自動計算內建指標(如 BLEU/ROUGE/F1 和安全分數),並將結果儲存到 S3。對於人工評估,使用 SageMaker Ground Truth 或 Amazon A2I 進行分層抽樣,確保對邊緣案例進行有針對性的審查,並將人工標籤與自動化指標結合,以做出明智的模型選擇。
其他選項的缺點:
即時執行模型並依賴 CloudWatch Logs 和 Lambda 函數計算啟發式方法,這是一種手動且效率低下的方法,難以大規模擴展,並且公開的網路表單收集人工回饋也不夠安全和可控。
SageMaker Model Monitor 主要用於生產模型的資料漂移和模型品質監控,而不是預生產的模型比較和安全評估。Bedrock 不會自動建立人工審查佇列。
僅依賴人工評估成本高昂、耗時,且難以大規模執行,同時也放棄了自動化指標提供的效率和客觀性。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡