AmazonAmazon ML Engineer Associate MLA-C01 Certification
·TW
·更新於 4 Aug 2026
StreamDocs 是一家法律文件 SaaS 公司,正在從一個大型 S3 儲存桶中的 PDF 檔案建立 Amazon Bedrock 知識庫。他們希望向量搜尋能支援語義檢索並儲存文件元資料 (document_id, page)。哪種配置最能平衡檢索品質、可維護性和 AWS 受管元件?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 將 Bedrock 知識庫配置為使用包含 PDF 的 S3 儲存桶前綴作為資料來源。提取文字並將文件分塊為重疊的文字區塊(每個區塊約 500 個 token,重疊 50-100 個 token),同時保留元資料 (document_id, page)。使用 k-NN (dense_vector) 欄位和 HNSW ANN 將向量索引到 Amazon OpenSearch Service 中,並將元資料儲存在 OpenSearch 索引中。透過 IAM 角色使用 KMS 加密 S3 和 OpenSearch 存取。.
為什麼這是答案
此選項最佳地平衡了檢索品質、可維護性和 AWS 受管元件。Amazon Bedrock 知識庫直接支援從 S3 儲存桶攝取 PDF,自動處理文字提取和分塊,並允許指定分塊策略(例如 500 個 token 的重疊區塊),這對於語義檢索至關重要。它還能保留元資料。將向量索引到 Amazon OpenSearch Service 的 k-NN (densevector) 欄位中,並使用 HNSW ANN 演算法,提供了高效且高品質的相似性搜尋。OpenSearch 也能儲存元資料。透過 IAM 角色和 KMS 加密確保了安全性。
其他選項的缺陷:
將分塊設定為極小的區塊會導致上下文丟失,降低檢索品質。將嵌入儲存在 DynamoDB 並直接查詢進行相似性搜尋,會增加複雜性並降低效率,因為 DynamoDB 不適合向量搜尋。
S3 Select 適用於資料過濾,不支援語義相似性查詢,也無法處理嵌入。
在查詢時串流 PDF 並按需計算嵌入會導致高延遲和重複計算,效率低下。不持久儲存向量會導致每次查詢都需重新計算,且 Bedrock 的內部快取不適用於大規模、持久的相似性搜尋。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡