Importowanie plików CSV do BigQuery kończy się pomyślnie, ale zaimportowane dane nie odpowiadają źródłowym bajt po bajcie. Jaka jest najbardziej prawdopodobna przyczyna?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Kodowanie pliku CSV różni się od domyślnego kodowania BigQuery.
Dlaczego to jest odpowiedź
Najbardziej prawdopodobną przyczyną niezgodności danych jest różnica w kodowaniu plików CSV w stosunku do domyślnego kodowania BigQuery (UTF-8). BigQuery interpretuje dane zgodnie z oczekiwanym kodowaniem, a jeśli plik źródłowy używa innego (np. Latin-1 lub Windows-1250), niektóre znaki mogą zostać błędnie przetłumaczone, co prowadzi do widocznych rozbieżności, mimo że import technicznie zakończył się sukcesem. Pozostałe opcje są mniej prawdopodobne: Określenie formatu jako CSV jest zazwyczaj wymagane do pomyślnego załadowania; brak tego spowodowałby błąd, a nie rozbieżności. Pominięcie nieprawidłowych wierszy mogłoby zmniejszyć liczbę załadowanych danych, ale nie zmieniłoby istniejących danych w sposób, który sugeruje "nie odpowiadają bajt po bajcie". Brak procesu ETL przed załadowaniem może prowadzić do nieuporządkowanych danych, ale niekoniecznie do błędnej interpretacji bajt po bajcie, chyba że dotyczy to również kodowania.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana