StreamDocs, een SaaS voor juridische documenten, bouwt een Amazon Bedrock knowledge base op vanuit een grote S3-bucket met PDF's. Ze willen vector search die semantische retrieval ondersteunt en documentmetadata (document_id, page) opslaat. Welke configuratie balanceert retrievalkwaliteit, onderhoudbaarheid en AWS managed componenten het beste?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Configureer de Bedrock knowledge base om de S3-bucketprefix met PDF's als databron te gebruiken. Extraheer tekst en chunk documenten in overlappende tekstchunks (~500 tokens per chunk met 50–100 token overlap) waarbij metadata (document_id, page) behouden blijft. Indexeer vectoren in Amazon OpenSearch Service met behulp van het k-NN (dense_vector) veld met HNSW ANN en sla metadata op in de OpenSearch-index. Gebruik KMS-encryptie voor S3- en OpenSearch-toegang via een IAM-rol..
Waarom dit het antwoord is
De correcte optie beschrijft de standaard en meest efficiënte architectuur voor een Bedrock knowledge base. Het gebruik van S3 als databron, het chunking-proces met overlappende chunks van 500 tokens (wat een goede balans biedt tussen context en granulariteit), en het behouden van metadata (documentid, page) zijn best practices voor retrievalkwaliteit. Het indexeren van vectoren in Amazon OpenSearch Service met k-NN (densevector) en HNSW ANN is de aanbevolen methode voor efficiënte en semantische vector search, terwijl metadata direct in OpenSearch worden opgeslagen voor snelle toegang. KMS-encryptie en IAM-rollen zorgen voor de vereiste beveiliging en toegangscontrole. De andere opties zijn minder geschikt: Zeer kleine chunks (5-10 woorden) leiden tot verlies van context en slechte retrievalkwaliteit. DynamoDB is geen geoptimaliseerde vector database en API Gateway is niet bedoeld voor directe similarity search op embeddings. S3 Select is niet ontworpen voor semantische gelijkenis op basis van embeddings en kan geen vector search uitvoeren. Het streamen van PDF's naar Bedrock bij elke query en het on-demand berekenen van embeddings is inefficiënt en duur. Het niet persistent opslaan van vectoren maakt snelle similarity search onmogelijk.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig