StreamDocs, firma SaaS zajmująca się dokumentami prawnymi, tworzy bazę wiedzy Amazon Bedrock z dużego zasobnika S3 zawierającego pliki PDF. Chcą wyszukiwania wektorowego, które obsługuje semantyczne wyszukiwanie i przechowuje metadane dokumentów (document_id, page). Jaka konfiguracja najlepiej równoważy jakość wyszukiwania, łatwość utrzymania i zarządzane komponenty AWS?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Skonfiguruj bazę wiedzy Bedrock tak, aby używała prefiksu zasobnika S3 zawierającego pliki PDF jako źródła danych. Wyodrębnij tekst i podziel dokumenty na nakładające się fragmenty tekstu (około 500 tokenów na fragment z nakładaniem się 50–100 tokenów), zachowując metadane (document_id, page). Indeksuj wektory w Amazon OpenSearch Service, używając pola k-NN (dense_vector) z HNSW ANN i przechowuj metadane w indeksie OpenSearch. Użyj szyfrowania KMS dla dostępu do S3 i OpenSearch za pośrednictwem roli IAM..
Dlaczego to jest odpowiedź
Ta opcja jest poprawna, ponieważ Amazon Bedrock Knowledge Bases natywnie integruje się z Amazon S3 jako źródłem danych, automatycznie obsługując wyodrębnianie tekstu i fragmentowanie. Zalecane rozmiary fragmentów (500 tokenów z nakładaniem się 50–100 tokenów) są standardową praktyką dla wyszukiwania semantycznego, równoważąc kontekst i precyzję. Amazon OpenSearch Service z polem k-NN (densevector) i HNSW ANN jest optymalnym, zarządzanym rozwiązaniem do przechowywania wektorów i metadanych, zapewniającym wydajne wyszukiwanie podobieństwa. Szyfrowanie KMS i role IAM zapewniają bezpieczeństwo. Pozostałe opcje są nieprawidłowe: Dzielenie na bardzo małe fragmenty (5–10 słów) zazwyczaj prowadzi do utraty kontekstu semantycznego. DynamoDB nie jest zoptymalizowane jako magazyn wektorowy, a bezpośrednie zapytania przez API Gateway nie są skalowalnym rozwiązaniem do wyszukiwania wektorowego. Przechowywanie surowych plików PDF i poleganie na S3 Select do wyszukiwania semantycznego jest nieefektywne, ponieważ S3 Select nie obsługuje wyszukiwania wektorowego. Obliczanie osadzeń na żądanie za pomocą Kinesis i brak trwałego przechowywania wektorów jest nieefektywne i kosztowne dla dużych zbiorów danych, a poleganie na wewnętrznej pamięci podręcznej Bedrock do wyszukiwania podobieństwa nie jest gwarantowane ani konfigurowalne.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana