StreamDocs, un SaaS di documenti legali, sta creando una knowledge base Amazon Bedrock da un grande bucket S3 di PDF. Desiderano una ricerca vettoriale che supporti il recupero semantico e memorizzi i metadati dei documenti (document_id, page). Quale configurazione bilancia al meglio la qualità del recupero, la manutenibilità e i componenti gestiti da AWS?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Configurare la knowledge base Bedrock per utilizzare il prefisso del bucket S3 contenente i PDF come origine dati. Estrarre il testo e suddividere i documenti in blocchi di testo sovrapposti (~500 token per blocco con sovrapposizione di 50-100 token) preservando i metadati (document_id, page). Indicizzare i vettori in Amazon OpenSearch Service utilizzando il campo k-NN (dense_vector) con HNSW ANN e memorizzare i metadati nell'indice OpenSearch. Utilizzare la crittografia KMS per l'accesso a S3 e OpenSearch tramite un ruolo IAM..
Perché questa è la risposta
L'opzione corretta descrive il processo standard e raccomandato per la creazione di una knowledge base Bedrock per il recupero semantico. L'utilizzo di Amazon OpenSearch Service con campi densevector e HNSW ANN è ideale per la ricerca vettoriale efficiente e scalabile, mentre la conservazione dei metadati (documentid, page) in OpenSearch consente un filtraggio e un recupero precisi. La suddivisione in blocchi sovrapposti di circa 500 token bilancia la granularità del recupero con la coerenza contestuale. La crittografia KMS e i ruoli IAM garantiscono la sicurezza. Le altre opzioni sono meno appropriate: La suddivisione in blocchi estremamente piccoli (5-10 parole) comprometterebbe il contesto semantico. DynamoDB non è ottimizzato per la ricerca di similarità vettoriale e l'interrogazione diretta tramite API Gateway non è una soluzione scalabile o efficiente per questo caso d'uso. S3 Select non supporta la ricerca di similarità semantica basata su embedding vettoriali e non è progettato per sostituire un database vettoriale. Il calcolo degli embedding su richiesta con Kinesis Data Streams e senza memorizzazione persistente dei vettori sarebbe inefficiente, costoso e non scalabile per un grande volume di documenti, oltre a non sfruttare le capacità di ricerca vettoriale di Bedrock.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta