Quando si preparano i dati di training CSV per un algoritmo integrato di SageMaker, la conversione del dataset in un numpy.array ha ridotto la velocità di training. Cosa si dovrebbe fare per ottimizzare i dati di training per gli algoritmi integrati di SageMaker?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Convertire il dataset nel formato RecordIO protobuf..
Perché questa è la risposta
La conversione del dataset nel formato RecordIO protobuf è la soluzione ottimale. Gli algoritmi integrati di SageMaker sono progettati per funzionare in modo efficiente con questo formato, che è ottimizzato per lo streaming e l'elaborazione distribuita, riducendo significativamente i tempi di training rispetto ad altri formati. L'utilizzo di SageMaker batch transform per convertire i dati in un DataFrame non è l'obiettivo, poiché i DataFrame non sono il formato più efficiente per gli algoritmi integrati. Comprimere i dati in Apache Parquet con AWS Glue può ridurre lo spazio di archiviazione, ma non offre lo stesso livello di ottimizzazione delle prestazioni di training di RecordIO protobuf per gli algoritmi integrati. L'ottimizzazione degli iperparametri di SageMaker è utile per trovare i migliori parametri del modello, non per ottimizzare il formato dei dati di input.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta