AmazonAmazon ML Engineer Associate MLA-C01 Certification
·CN
·更新于 4 Aug 2026
EduLogic 希望在将 Bedrock 模型投入生产之前,比较两个 Bedrock 模型的答案准确性和安全性。他们需要大规模运行自动、可重复的指标,并收集针对边缘情况的人工判断。哪种架构最能实现内置指标的自动化评估和针对采样输出的人工评估?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 在 Bedrock 中(或使用 Bedrock 评估 API)创建一个自动化评估作业,在带标签的测试集(包含输入/参考对的 JSONL 文件)上运行模型,并计算内置指标(BLEU/ROUGE/F1、安全分数)。将评估工件和指标报告持久化到 S3。对于人工评估,对模型输出进行分层抽样,并创建一个 SageMaker Ground Truth 标注作业(或使用 Amazon A2I),其中包含自定义标注 UI 以收集人工判断;将人工标签与自动指标结合起来进行最终模型选择。.
为什么这是答案
正确选项提供了自动化评估和人工评估的最佳组合。它利用 Bedrock 的评估功能(包括评估 API)在标记数据集上自动计算 BLEU/ROUGE/F1 和安全分数等内置指标,并将结果存储在 S3 中,确保可重复性和可扩展性。对于人工评估,它建议对模型输出进行分层抽样,并使用 SageMaker Ground Truth 或 Amazon A2I 创建自定义标注作业,这是一种高效且可扩展的人工审核方法。这种方法将自动指标与人工判断相结合,以全面评估模型。
其他选项不理想:
实时运行模型并依靠 CloudWatch Logs 和 Lambda 进行启发式计算,以及手动合并人工反馈,效率低下且难以扩展。
SageMaker Model Monitor 主要用于生产中的模型漂移检测,而不是预生产的准确性和安全性评估,并且 Bedrock 不会自动创建人工审核队列。
仅依赖 Amazon Mechanical Turk 进行所有输出的人工评估,忽略了自动化指标的价值,成本高昂且耗时,并且可能无法提供可扩展的全面评估。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡