AmazonAmazon ML Engineer Associate MLA-C01 Certification·KO·업데이트됨 3 Aug 2026
FinCorp는 AWS에서 사기 감지 파이프라인을 운영합니다. 과거 특징 값(feature values)을 S3에 보존하기 위해 오프라인 스토어가 활성화된 여러 SageMaker Feature Group을 생성했습니다. 데이터 과학자들은 트랜잭션 기록(transaction_timestamp가 있는 S3의 CSV)을 각 트랜잭션 시간 기준의 올바른 과거 특징 값과 SQL을 사용하여 Athena에서 조인하는 훈련 데이터셋을 생성해야 합니다. 대규모 훈련 내보내기(exports)를 위한 과거 특징 타임스탬프에 대한 성능이 좋고 올바른 조인을 안정적으로 활성화하는 구성 및 단계는 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 각 FeatureGroup을 생성할 때, 오프라인 parquet 파일이 저장되는 S3 접두사를 가리키는 DataCatalogConfig(Glue 테이블)로 오프라인 스토어를 활성화합니다. FeatureGroup이 record_identifier_column 및 event_time_feature_name으로 구성되었는지 확인합니다. 훈련 역할에 Glue 및 S3 읽기 권한을 부여한 다음, 적절한 파티션 가지치기(partition pruning)와 함께 기본 키 및 event_time <= transaction_timestamp를 사용하여 트랜잭션 테이블을 FeatureGroup Glue 테이블에 조인하는 Athena SQL을 작성합니다..
이것이 정답인 이유
정답은 SageMaker Feature Store의 오프라인 스토어와 Athena를 사용하여 대규모 훈련 데이터셋을 효율적으로 생성하는 모범 사례를 설명합니다. DataCatalogConfig를 사용하여 Glue 테이블을 생성하면 Athena가 Feature Group의 Parquet 데이터를 쿼리할 수 있습니다. recordidentifiercolumn 및 eventtimefeaturename은 정확한 시간 기반 조인을 위해 필수적입니다. 적절한 IAM 권한과 eventtime <= transactiontimestamp 조건 및 파티션 가지치기를 사용한 Athena SQL 쿼리는 과거 특징 값을 효율적이고 정확하게 조인하여 훈련 데이터셋을 구성합니다.
다른 옵션들은 다음과 같은 이유로 적절하지 않습니다.
온라인 스토어만 사용하는 것은 대규모 과거 데이터 조인에 비효율적이며, GetRecord는 단일 레코드 조회에 적합합니다.
SageMaker Batch Transform을 사용하여 featurestore-runtime API를 호출하는 것은 대규모 과거 데이터 조인에 적합하지 않으며, 온라인 스토어는 과거 시점 조회를 지원하지 않습니다.
Glue 크롤러는 DataCatalogConfig 없이 Feature Group의 파티션 스키마를 항상 정확하게 추론하지 못할 수 있으며, 특히 eventtime과 같은 특정 Feature Store 메타데이터를 활용하지 못합니다.