AmazonAmazon ML Engineer Associate MLA-C01 Certification·KO·업데이트됨 3 Aug 2026
법률 문서 SaaS인 StreamDocs는 대규모 S3 버킷의 PDF 파일들을 사용하여 Amazon Bedrock 지식 기반을 구축하고 있습니다. 이들은 의미 검색을 지원하고 문서 메타데이터(document_id, page)를 저장하는 벡터 검색을 원합니다. 검색 품질, 유지 관리성 및 AWS 관리형 구성 요소 간의 균형을 가장 잘 맞추는 구성은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: PDF가 포함된 S3 버킷 접두사를 데이터 소스로 사용하도록 Bedrock 지식 기반을 구성합니다. 텍스트를 추출하고 문서를 겹치는 텍스트 청크(청크당 약 500토큰, 50~100토큰 중복)로 분할하여 메타데이터(document_id, page)를 보존합니다. k-NN(dense_vector) 필드와 HNSW ANN을 사용하여 Amazon OpenSearch Service에 벡터를 인덱싱하고 OpenSearch 인덱스에 메타데이터를 저장합니다. IAM 역할을 통해 S3 및 OpenSearch 액세스를 위해 KMS 암호화를 사용합니다..
이것이 정답인 이유
이 구성은 Bedrock 지식 기반의 일반적인 아키텍처를 따르며, S3에서 PDF를 데이터 소스로 사용하고 OpenSearch Service를 벡터 저장소로 활용합니다. 텍스트 청크 분할 및 중복은 검색 품질을 높이며, documentid 및 page 메타데이터 보존은 검색 결과의 관련성을 향상시킵니다. k-NN 및 HNSW ANN은 효율적인 벡터 검색을 가능하게 합니다. IAM 역할과 KMS 암호화는 보안 모범 사례를 준수합니다.
다른 옵션들은 다음과 같은 이유로 적절하지 않습니다.
DynamoDB는 벡터 검색에 최적화된 서비스가 아니며, 유사성 검색을 직접 수행하기 어렵습니다.
S3 Select는 벡터 검색을 지원하지 않으므로 의미론적 유사성 조회를 수행할 수 없습니다.
Kinesis Data Streams를 사용하여 매번 PDF를 스트리밍하고 임베딩을 계산하는 것은 비효율적이며, 벡터를 영구적으로 저장하지 않으면 검색 성능이 저하됩니다.