一位資料科學家將使用 Amazon SageMaker Data Wrangler 攝取歷史 S3 資料,以進行探索性資料分析 (EDA) 來尋找罕見的異常。為了在執行 EDA 時最大限度地減少運算資源,資料科學家應該選擇哪種匯入選項?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 使用 First K 選項匯入資料,並根據領域知識選擇 K 值。.
為什麼這是答案
資料科學家正在尋找罕見的異常,這意味著他們需要確保樣本中包含這些異常。使用「First K」選項可以讓資料科學家根據領域知識選擇一個 K 值,以確保在匯入的資料子集中包含足夠的異常實例,同時最小化運算資源。 「None」選項會匯入所有資料,這會增加運算資源。 「Stratified」選項適用於保持類別分佈,但對於尋找罕見異常可能效率不高,因為它可能不會保證包含足夠的異常實例。 「Randomized」選項會隨機選擇樣本,這可能導致罕見異常被排除在樣本之外。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡