AmazonAmazon ML Engineer Associate MLA-C01 Certification
·CN
·更新于 4 Aug 2026
StreamDocs 是一家法律文档 SaaS 公司,正在使用一个大型 S3 存储桶中的 PDF 文件构建 Amazon Bedrock 知识库。他们希望进行支持语义检索并存储文档元数据(document_id、page)的向量搜索。哪种配置能够最好地平衡检索质量、可维护性和 AWS 托管组件?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 将 Bedrock 知识库配置为使用包含 PDF 的 S3 存储桶前缀作为数据源。提取文本并将文档分块为重叠的文本块(每个块约 500 个 token,重叠 50-100 个 token),同时保留元数据(document_id、page)。使用 HNSW ANN 将向量索引到 Amazon OpenSearch Service 的 k-NN (dense_vector) 字段中,并将元数据存储在 OpenSearch 索引中。通过 IAM 角色使用 KMS 加密 S3 和 OpenSearch 访问。.
为什么这是答案
正确答案提供了最佳的平衡。Amazon Bedrock 知识库直接支持从 S3 桶摄取数据,并能自动处理文本提取、分块和嵌入生成。使用 Amazon OpenSearch Service 作为向量存储(通过 k-NN 字段和 HNSW ANN 算法)是实现高性能语义检索的托管式、可扩展且成熟的方法,同时允许存储和检索元数据。适当的分块策略(重叠的文本块)有助于提高检索质量。IAM 角色和 KMS 加密确保了安全性。
其他选项的问题在于:
将嵌入存储在 DynamoDB 中并直接查询不适合大规模相似性搜索,且 DynamoDB 不是为向量搜索设计的。
依赖 S3 Select 进行语义相似性查找是不可行的,S3 Select 仅用于基于 SQL 的数据过滤,不提供语义搜索功能,且未摄取嵌入会严重限制检索能力。
在查询时通过 Kinesis Data Streams 流式传输 PDF 并按需计算嵌入效率低下,成本高昂,且不持久存储向量会影响性能和可扩展性。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡