Amazon AIF-C01: ML 資料工程 — 學習指南

屬於 AWS AI Practitioner AIF-C01 — 學習指南. 使用經過驗證的解答練習: Amazon 考試中心, 或參加限時模擬考試: ExamRoll.io.

資料收集、標註、版本控制與治理

收集具代表性且可稽核的資料集,是所有機器學習的基礎步驟。使用 Amazon S3 作為中央的持久性儲存,並啟用 S3 版本控制 (S3 Versioning) 和物件鎖定 (object lock) 來保存原始輸入並擷取來源歷程 (provenance)。若要進行結構化擷取和編目,請在 AWS Glue Data Catalog 中註冊資料集,並使用 Lake Formation 應用細粒度的存取控制。當需要人工標註時,Amazon SageMaker Ground Truth 提供內建的工作流程、註釋使用者介面和主動學習迴圈,可在降低標註成本的同時,為標註者一致性和信賴度建立中繼資料。常見的陷阱包括收集有偏見或不具代表性的樣本、未能記錄血緣關係 (lineage) 和標註規則,以及標籤品質檢查不足;可透過儲存標註稽核紀錄、對子集進行盲性重新標註,以及使用標籤合併的啟發式方法來緩解這些問題。隱私和合規性決策會驅動架構設計:使用 S3 伺服器端加密搭配 KMS 管理的 CMK、透過 IAM 政策和 VPC 端點 (AWS PrivateLink) 限制存取,並在分享資料進行模型訓練前,使用 Amazon Comprehend 執行 PII (個人可識別資訊) 的探索和修訂 (redaction)。對於長時間執行的程式,應擷取資料集快照、使用資料集 ID 加上標籤,並透過 Amazon SageMaker Experiments 或像 DVC 這類的外部工具來追蹤實驗,以實現可重現的訓練和法規報告。

前處理、特徵工程與 EDA

轉換和特徵決定了模型泛化的能力。使用 AWS Glue 或 Amazon SageMaker Data Wrangler 來剖析、清理和正規化資料,並透過 Amazon QuickSight 或託管於 Amazon SageMaker Studio 中的 Jupyter notebooks 進行迭代式的探索性資料分析 (EDA)。對於生產環境的特徵管理,應採用 Amazon SageMaker Feature Store,以確保離線和線上特徵計算的一致性,並避免訓練/服務歪斜 (train/serve skew);將原始特徵和衍生特徵分開儲存,並記錄特徵的建立邏輯。時間序列和串流管線應利用 Amazon Kinesis 或 AWS Glue 串流 ETL 來實現低延遲的特徵更新。典型的陷阱包括資料洩漏 (data leakage)——即未來資訊洩漏到訓練資料中——不當處理遺失值,以及離線訓練特徵與線上服務特徵之間的不匹配。設計管線時的決策標準取決於新鮮度與成本之間的權衡:對於大量的歷史重新計算,選擇批次 ETL;對於近乎即時的個人化,選擇串流;當需要低延遲的線上特徵時,則選擇混合式架構。在 Glue 中或作為 SageMaker Processing 任務的一部分,自動化驗證檢查和綱要強制執行,以提早捕捉綱要偏移 (schema drift)。

嵌入、增強、合成資料與基礎模型的資料集

嵌入 (Embeddings) 將文字、圖像或多模態輸入轉換為能捕捉語義關係的密集向量;它們是語義搜尋、檢索增強生成 (RAG) 和分群等應用的動力來源。建立一個檢索增強生成 (RAG) 模式,您可以使用 Amazon Bedrock 或託管於 SageMaker 的編碼器來生成嵌入,將向量儲存在 Amazon OpenSearch Service (k-NN)、Amazon Kendra 或託管的向量儲存中,並檢索上下文來作為基礎模型的條件。當真實範例稀少時,資料增強和合成資料生成是實用的方法:使用 SageMaker 中的生成式模型來建立釋義 (paraphrases)、圖像轉換 (透過 Albumentations 或 SageMaker Processing),或保護隱私的合成記錄。注意不要過度依賴合成資料——低擬真度可能會引入分佈偏移 (distribution shift),並使模型對人為產物 (artifacts) 過度擬合。對於基礎模型 (FM) 的訓練資料集,應策劃高品質的範例、使用提示模板 (prompt templates) 將格式標準化,並在 S3 中對每個資料集快照進行版本控制。對於與第三方 FM 一起使用的私有資料,應優先選擇私有微調路徑 (將運算資源帶入 VPC),或部署僅檢索的管線,這種管線只會將非敏感的上下文傳送給 FM,同時將來源文件保留在安全的向量儲存中;應用修訂 (redaction) 和權杖級別的遮罩 (token-level masking) 以防止洩漏。提示工程 (Prompt engineering) 和指令模板 (系統提示) 對於塑造模型回應至關重要;根據所需的確定性和創造力來調整 temperature、top_k 或 top_p。

評估、部署、監控與生命週期管理

評估必須明確,使用與業務目標一致的指標:迴歸任務使用 RMSE 或 MAE,二元分類評估 precision/recall/F1 與 ROC AUC,而摘要任務則使用 ROUGE 的各種變體。在評估階段進行驗證與交叉驗證,並保留一個盲測集以供最終驗收。使用 Amazon SageMaker 端點 (即時或無伺服器推論) 或 Amazon Bedrock 進行託管式 FM 服務來部署;透過選擇較小的蒸餾模型、啟用多模型端點,或針對無法預測的流量使用 SageMaker Serverless Inference 來優化延遲。在生產環境中使用 Amazon SageMaker Model Monitor 監控效能與資料漂移,並針對指標下降設定警示;採用金絲雀或藍/綠部署來限制風險。模型的存取控制是透過 IAM 角色政策、資源層級權限及網路隔離來強制執行。實務上常見的陷阱包括選擇錯誤的指標 (例如對不平衡類別使用準確率)、忽略概念漂移,以及未能對訓練資料和推論日誌進行檢測以供稽核。使用 SageMaker Pipelines 進行機器學習的 CI/CD,以標準化重新訓練的頻率、保持資料集與模型版本的一致性,並為合規性維護一個可供辯護的稽核軌跡。

實務問題:使用案例情境

情境:BrightCart 是一家線上生鮮雜貨連鎖店,正在將其地端的庫存系統現代化至 AWS,並希望建立一個生成式 AI 聊天機器人,用以回答客戶問題並回傳即時庫存位置,同時根據合規規則保護客戶與庫存資料。他們的 AWS AI 環境包括用於資料集的 S3、用於交易庫存的 Amazon RDS、用於開發的 SageMaker Studio、用於存取基礎模型的 Bedrock,以及 VPC 網路。

挑戰:建立一個私有、低延遲、啟用 RAG 的聊天機器人,它能擷取當前庫存,並避免暴露敏感資料或觸發幻覺。

建議方法:

  1. 佈建一個私有 VPC 並為 Bedrock 和 SageMaker 設定 AWS PrivateLink 端點;將標準的產品文件與庫存快照儲存在 S3 中,並使用伺服器端加密 (KMS),同時啟用 S3 版本控制。
  2. 在私有子網路中,使用 Bedrock 編碼器或 SageMaker 模型持續從產品文件中計算嵌入,並將向量儲存在 Amazon OpenSearch Service 中,搭配 k-NN 以進行快速的最近鄰擷取;將即時庫存保留在 Amazon RDS 中,並提供一個安全的執行期連接器以供擷取。
  3. 實作一個檢索增強的管線,其中應用程式首先查詢 OpenSearch 以取得上下文,然後使用一個包含所擷取上下文與明確安全說明的系統提示詞模板來呼叫 Bedrock;透過輸入驗證來淨化使用者輸入,並在擷取前使用 Amazon Comprehend 偵測 PII 並加以編輯。
  4. 將聊天機器人部署在 Application Load Balancer 後方,透過 VPC 中的 API gateway 經由 Bedrock 提供 FM 服務,啟用對 CloudWatch 的日誌記錄並限制存取,並使用 SageMaker Model Monitor 和定期的人工稽核來監控模型回應與漂移。

理由:此方法使用 RAG 模式以最小化敏感資料的暴露,利用私有網路與 KMS 以符合合規性,將即時庫存與模型上下文分開以確保準確性,並應用監控與人在迴路 (human-in-the-loop) 的檢查來控制幻覺並確保持續的可靠性。


AI 安全與隱私 · 所有領域 · 模型訓練、評估與最佳化

練習這些題目 → · 在 ExamRoll.io 上限時練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通過考試 →

瀏覽 Amazon →

Related guides

一站式存取

一份訂閱。所有考試。

每個方案都可無限存取答案搜尋、練習測驗、AI 解釋和完整的資源庫 — 支援 20 多種語言。

每月
24.87
Just €0.83/day
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

最佳價值
12 個月
179.87
Just €0.49/daySave 40%
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

✓ 包含免費方案 · ✓ 隨時取消 · ✓ 所有方案解鎖完整產品