Amazon MLS-C01: 自然語言處理與語音 — 學習指南
屬於 AWS Machine Learning Specialty MLS-C01 — 學習指南. 使用經過驗證的解答練習: Amazon 考試中心, 或參加限時模擬考試: ExamRoll.io.
文字前處理、Tokenization 與淨化
穩健的文字前處理是可靠 NLP 管線的基礎。首先要進行 Unicode 標準化、移除 HTML 標籤和控制字元;使用 AWS Glue 或 SageMaker Processing job (ml.m5.xlarge) 來執行可擴展的 Python 或 PySpark 清理步驟。Tokenization 的選擇是一個決策點:單詞 tokenizer 很簡單,但會受詞彙外 (out-of-vocabulary, OOV) token 的問題所苦;而子詞 (subword) tokenizer,例如 Byte-Pair Encoding 或 WordPiece (BERT 所使用),能降低 OOV 風險,對於多語言或包含大量產品名稱的語料庫是較佳的選擇。透過移除 PII、將日期和數字標準化,以及在表情符號/主題標籤傳達情感時將其對應到標準形式,來淨化使用者生成的內容。注意常見的陷阱:過度移除停用詞 (stopword) 可能會損害主題模型和序列模型,而將所有字母轉為小寫會移除對命名實體辨識有用的格位訊號。在生產環境中,應在 SageMaker Processing 或 Lambda layer 中實作確定性的前處理,並在 SageMaker Model Registry 中記錄前處理的程式碼和產出物版本,以便 Model Monitor 能根據相同的管線計算資料偏移。當處理數百萬則簡短評論時,可將 tokenized 後的輸出壓縮成 parquet 格式存放在 S3,並使用 SageMaker Batch Transform 進行下游的特徵提取,以避免每次請求都產生 tokenization 的延遲。
Embeddings 與語義表示
根據任務複雜度和運算預算來選擇 embeddings。若需要快速、可擴展的 embeddings,可透過 SageMaker 中的 BlazingText 來訓練或使用預訓練的 Word2Vec (在 ml.c5.4xlarge 上使用 supervised 或 skip-gram 模式) 來取得單詞的密集向量;再透過 IDF 加權平均將其匯總成句子向量,以進行主題計數。對於語義檢索和需要上下文的任務,可使用 SageMaker Training 上的 GPU 執行個體 (ml.p3.2xlarge 或 ml.p4d.24xlarge,視規模而定) 搭配 Hugging Face 框架來微調 transformer 模型 (BERT、DistilBERT 或 Sentence-BERT),並在 ml.g4dn 或 ml.p3 上使用優化後的推論,以部署對延遲敏感的端點。在 S3 或 SageMaker Feature Store 中產生並儲存 embeddings;對於近似最近鄰搜尋,可在專用的推論叢集上使用 Faiss,或使用 Amazon Kendra 進行企業級搜尋。注意陷阱:對多義詞使用靜態 embeddings 會失去上下文;維度過高會增加儲存空間並減慢最近鄰查找速度——可應用 PCA/UMAP 或量化 (quantization) 來解決。當下游模型對 embedding 偏移很敏感時,應實作 Model Monitor 來追蹤 embedding 的分佈變化,並使用一致的 tokenizer 和模型檢查點定期重新產生 embedding。
序列模型、意圖/詞槽處理與實體提取
序列模型涵蓋範圍很廣,從傳統的 LSTM/GRU 到用於 seq2seq 任務的 transformer encoder-decoder 模型。對於對話系統中的意圖偵測和詞槽填充 (slot filling),可利用 Amazon Lex 來管理意圖、詞槽類型和履行掛鉤 (fulfillment hooks);並整合 Lambda 進行複雜的詞槽驗證或上下文豐富化。對於客製化模型,可以在 BERT 之上使用條件隨機場 (conditional random fields) 來訓練 token 層級的 NER,或在 SageMaker 上使用 Hugging Face 的 token-classification 微調功能 (在 ml.p3.2xlarge 上進行 GPU 訓練)。諸如摘要或翻譯等 Sequence-to-sequence 的使用案例,偏好使用 encoder-decoder transformer 模型 (T5, BART),且需要較大的 GPU 執行個體進行訓練;可使用混合精度 (AMP) 和梯度累積 (gradient accumulation) 來處理長序列。實體提取可以使用 Amazon Comprehend 來辨識開箱即用的命名實體,但對於特定領域的實體 (如產品 SKU、化學名稱),則應選擇 Comprehend Custom Entities 或微調您自己的 NER 模型。一個常見的陷阱是將意圖分類與詞槽驗證混為一談——高的意圖準確率不保證詞槽值的正確性;應加入結構描述驗證 (schema validation)、信賴度閾值和後備意圖 (fallback intents)。在生產環境中,可透過 SageMaker 端點來部署模型,並使用多模型端點 (multi-model endpoints) 來提高成本效益,或使用非同步推論或 Batch Transform 來處理高吞吐量的離線任務。
← 深度學習與電腦視覺 · 所有領域 · 時間序列與預測 →
練習這些題目 → · 在 ExamRoll.io 上限時練習 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通過考試 →