Un ingeniero de ML debe construir un pipeline que utilice Amazon Athena para dos cargas de trabajo: transformaciones por lotes a gran escala y entrenamiento de modelos, y consultas de baja latencia casi en tiempo real para inferencia y análisis. ¿Qué formato de archivo producirá la latencia MÁS BAJA tanto para el procesamiento por lotes como para el procesamiento casi en tiempo real?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Apache Parquet.
Por qué esta es la respuesta
Apache Parquet es un formato de almacenamiento de datos columnar optimizado para el procesamiento analítico. Su naturaleza columnar permite a Athena leer solo las columnas necesarias para una consulta, reduciendo drásticamente la cantidad de datos escaneados y mejorando la latencia para cargas de trabajo por lotes y casi en tiempo real. También soporta compresión y codificación eficientes, lo que disminuye el tamaño del almacenamiento y acelera la recuperación de datos. CSV es un formato basado en filas que requiere escanear todas las columnas, incluso si solo se necesita un subconjunto, lo que resulta en mayor latencia. Nested JSON y Deserialized JSON son formatos basados en texto que no están optimizados para el rendimiento de consultas analíticas a gran escala, ya que requieren un análisis completo de la estructura de datos para cada consulta, lo que aumenta significativamente la latencia.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta