一位数据科学家将使用 Amazon SageMaker Data Wrangler 摄取历史 S3 数据,进行探索性数据分析 (EDA) 以查找罕见异常。为了在执行 EDA 时最大限度地减少计算资源,数据科学家应该选择哪个导入选项?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 First K 选项导入数据,根据领域知识选择 K 值。.
为什么这是答案
为了在执行探索性数据分析 (EDA) 时最大限度地减少计算资源,同时仍能有效查找罕见异常,数据科学家应选择“First K”选项导入数据,并根据领域知识选择合适的 K 值。 “First K”选项允许您仅加载数据集的开头 K 行。对于查找罕见异常,如果这些异常在时间序列数据中可能出现在早期,或者您想快速预览数据结构和潜在模式,这种方法非常有效。它显著减少了需要处理的数据量,从而节省了计算资源。 “None”选项会尝试加载所有数据,这会消耗大量计算资源,尤其是在处理大型 S3 数据集时,与最小化资源的目标相悖。“Stratified”和“Randomized”选项虽然在某些采样场景下有用,但它们通常需要对整个数据集进行扫描或更复杂的处理才能生成样本,这在初始阶段可能不如“First K”高效,并且对于查找“罕见”异常,如果异常分布不均,随机采样可能错过它们。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡