ORC 파일을 Cloud Storage 버킷으로 마이그레이션했으며 Dataproc 클러스터에서 Hive를 사용하려고 합니다. 성능을 위해 데이터를 HDFS로 복제하는 것을 선택할 수 있습니다. Dataproc에서 Hive를 사용하기 시작할 수 있는 두 가지 방법은 무엇입니까? (두 가지 선택)
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: gsutil을 실행하여 모든 ORC 파일을 Cloud Storage 버킷에서 마스터 노드로 전송한 다음 Hadoop 유틸리티를 사용하여 HDFS로 복사하고 HDFS에서 Hive 테이블을 마운트합니다., Hadoop용 Cloud Storage 커넥터를 사용하여 ORC 파일을 외부 Hive 테이블로 노출한 다음 해당 외부 테이블을 기본 Hive 테이블로 복제합니다..
이것이 정답인 이유
첫 번째 정답은 Cloud Storage에서 Dataproc 마스터 노드로 파일을 전송한 다음 Hadoop 유틸리티(예: hdfs dfs -put)를 사용하여 HDFS로 복사하는 직접적인 방법을 설명합니다. 이는 데이터를 HDFS에 물리적으로 저장하여 Hive가 로컬 HDFS에서 직접 데이터를 처리하도록 합니다. 두 번째 정답은 Cloud Storage 커넥터를 사용하여 Cloud Storage의 ORC 파일을 외부 Hive 테이블로 직접 연결하는 방법을 설명합니다. 이 방법은 데이터를 HDFS로 복사할 필요 없이 Hive가 Cloud Storage의 데이터에 액세스하도록 합니다. 이후 이 외부 테이블을 기본(관리형) Hive 테이블로 복제하여 성능 최적화(예: 데이터 형식 변경, 파티셔닝)를 수행할 수 있습니다. 오답인 gsutil을 사용하여 HDFS로 직접 전송하는 것은 불가능합니다. gsutil은 Cloud Storage와 로컬 파일 시스템 간의 전송을 지원합니다. gsutil을 사용하여 Dataproc 노드로 전송하는 것은 가능하지만, HDFS에 저장하려면 추가 단계가 필요합니다. BigQuery를 사용하는 것은 Hive와 직접적인 데이터 마이그레이션 방법이 아니며, 추가적인 변환 및 비용이 발생합니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음