Amazon MLS-C01: Elaborazione del linguaggio naturale e del parlato — Guida allo studio

Fa parte della AWS Machine Learning Specialty MLS-C01 — Guida allo studio. Esercitati con risposte verificate nel centro esami Amazon, oppure fai test cronometrati su ExamRoll.io.

Pre-elaborazione, tokenizzazione e sanificazione del testo

Una pre-elaborazione del testo robusta è il fondamento per pipeline NLP affidabili. Iniziare normalizzando l’Unicode, rimuovendo l’HTML ed eliminando i caratteri di controllo; utilizzare AWS Glue o un job di SageMaker Processing (ml.m5.xlarge) per eseguire passaggi di pulizia scalabili in Python o PySpark. La scelta della tokenizzazione è un punto decisionale: i tokenizzatori di parole sono semplici ma soffrono di token fuori vocabolario (OOV); i tokenizzatori di sub-parole come Byte-Pair Encoding o WordPiece (usato da BERT) riducono il rischio di OOV e sono preferibili per corpora multilingue o con molti nomi di prodotto. Sanificare i contenuti generati dagli utenti rimuovendo le PII, normalizzando date e numeri e mappando emoji/hashtag a forme canoniche quando trasmettono sentiment. Attenzione alle trappole comuni: una rimozione aggressiva delle stopword può danneggiare i topic model e i modelli di sequenza, e la conversione in minuscolo (lowercasing) rimuove segnali di maiuscole/minuscole (casing) utili per il riconoscimento di entità nominate (named-entity recognition). Per la produzione, implementare una pre-elaborazione deterministica in un layer di SageMaker Processing o Lambda e registrare il codice di pre-elaborazione e le versioni degli artefatti in SageMaker Model Registry, in modo che Model Monitor possa calcolare il data-drift rispetto alla stessa pipeline. Quando si gestiscono milioni di commenti brevi, comprimere l’output tokenizzato in formato parquet su S3 e utilizzare SageMaker Batch Transform per l’estrazione di feature a valle (downstream) per evitare la latenza di tokenizzazione per ogni richiesta.

Embedding e rappresentazioni semantiche

Scegliere gli embedding in base alla complessità del task e al budget di calcolo. Per embedding veloci e scalabili, addestrare o utilizzare Word2Vec pre-addestrato tramite BlazingText in SageMaker (usare le modalità supervised o skip-gram su ml.c5.4xlarge) per ottenere vettori densi per le parole; aggregare in vettori di frase con una media pesata su IDF per il conteggio dei topic. Per il recupero semantico (semantic retrieval) e task contestuali, effettuare il fine-tuning di modelli transformer (BERT, DistilBERT o Sentence-BERT) utilizzando il framework Hugging Face su SageMaker Training con istanze GPU (ml.p3.2xlarge o ml.p4d.24xlarge a seconda della scala) e usare l’inferenza ottimizzata su ml.g4dn o ml.p3 per endpoint sensibili alla latenza. Produrre e archiviare gli embedding in S3 o SageMaker Feature Store; per la ricerca del vicino più prossimo approssimata (approximate nearest-neighbor search) usare Faiss su un cluster di inferenza dedicato o Amazon Kendra per la ricerca aziendale (enterprise search). Attenzione alle trappole: l’uso di embedding statici per parole polisemiche fa perdere il contesto; una dimensionalità eccessiva aumenta lo storage e rallenta le ricerche del vicino più prossimo — applicare PCA/UMAP o la quantizzazione. Quando i modelli a valle (downstream) sono sensibili al drift degli embedding, implementare Model Monitor per tracciare i cambiamenti nella distribuzione degli embedding e rigenerare gli embedding periodicamente con un tokenizzatore e un checkpoint del modello coerenti.

Modelli di sequenza, gestione di intenti/slot ed estrazione di entità

La modellazione di sequenze (sequence modeling) spazia dai classici LSTM/GRU ai transformer encoder-decoder per task seq2seq. Per il rilevamento di intenti (intent detection) e il riempimento di slot (slot filling) nei sistemi conversazionali, sfruttare Amazon Lex per gestire intenti, tipi di slot e hook di fulfillment; integrare Lambda per la validazione complessa degli slot o l’arricchimento del contesto. Per modelli personalizzati (bespoke), addestrare un NER a livello di token usando i conditional random fields sopra BERT o usare il fine-tuning per la classificazione di token di Hugging Face su SageMaker (addestramento su GPU con ml.p3.2xlarge). I casi d’uso sequence-to-sequence come la riassunzione (summarization) o la traduzione favoriscono i transformer encoder-decoder (T5, BART) e richiedono istanze GPU più grandi per l’addestramento; usare la precisione mista (AMP) e l’accumulo del gradiente (gradient accumulation) per gestire sequenze lunghe. L’estrazione di entità (entity extraction) può usare Amazon Comprehend per le entità nominate predefinite (out-of-the-box), ma per entità specifiche di un dominio (SKU di prodotti, nomi di sostanze chimiche) scegliere Comprehend Custom Entities o effettuare il fine-tuning del proprio modello NER. Una trappola comune è confondere la classificazione degli intenti con la validazione degli slot: un’elevata accuratezza dell’intento non garantisce valori di slot corretti; aggiungere la validazione dello schema, soglie di confidenza e intenti di fallback. Per la produzione, esporre i modelli tramite endpoint di SageMaker, utilizzando endpoint multi-modello per l’efficienza dei costi, e usare l’inferenza asincrona o Batch Transform per task offline ad alto throughput.

Voce: trascrizione, sintesi e soluzioni vocali end-to-end

Le pipeline vocali richiedono considerazioni sia sul modello acustico che su quello linguistico. Per la trascrizione, Amazon Transcribe gestisce i casi d’uso comuni con funzionalità come vocabolari personalizzati e filtri di vocabolario per migliorare il riconoscimento di nomi di marchi o prodotti; abilita i vocabolari personalizzati e i filtri di vocabolario nelle impostazioni del processo di Transcribe e utilizza l’identificazione del canale o la diarizzazione dell’oratore in presenza di messaggi vocali o log con più oratori. Per audio molto brevi con latenza rigorosa, preferisci Transcribe Streaming in tempo reale con connessioni WebSocket a bassa latenza e considera il modello linguistico personalizzato di Transcribe per il gergo specializzato. Per la sintesi vocale (text-to-speech), Amazon Polly offre voci neurali e supporto SSML; utilizza lessici e tag SSML per controllare la pronuncia, la prosodia e le pause per un’esperienza cliente naturale. Integra Lex con Transcribe e Polly per creare bot vocali e connettiti ad Amazon Connect per la telefonia. Una trappola frequente è affidarsi unicamente ai modelli linguistici predefiniti per nomi specifici del dominio: aggiungi sempre vocabolari personalizzati o effettua il fine-tuning dei modelli. Per esigenze offline o on-premise, impacchetta modelli leggeri utilizzando SageMaker Neo o distribuisci modelli acustici più piccoli su dispositivi edge, centralizzando al contempo gli aggiornamenti pesanti dei modelli linguistici nel cloud e versionandoli in SageMaker Model Registry.

Problema Pratico: Scenario d’Uso

Scenario: GlobalNews Analytics opera su AWS con pipeline di dati in S3 e pre-elaborazione in SageMaker Processing. Acquisiscono milioni di commenti di utenti in inglese ogni giorno e mantengono un endpoint SageMaker per l’analisi degli argomenti (topic analytics).

Sfida: Identificare gli argomenti più discussi da commenti rumorosi e spesso brevi, gestendo al contempo slang, emoji e migliaia di nomi propri (nomi di prodotti/luoghi).

Approccio Raccomandato:

  1. Utilizzare un processo di SageMaker Processing (ml.m5.4xlarge) per eseguire una sanitizzazione deterministica: rimozione di HTML, normalizzazione Unicode, mappatura di emoji in token, conversione in minuscolo dove appropriato e archiviazione del testo pulito come file parquet su S3.
  2. Generare embedding di frasi contestuali tramite il fine-tuning di un modello Sentence-BERT utilizzando Hugging Face su SageMaker Training con ml.p3.2xlarge; persistere gli embedding su S3 e, opzionalmente, su Feature Store.
  3. Raggruppare (clusterizzare) gli embedding con Faiss (cluster di CPU o nodi basati su GPU) per scoprire gruppi di argomenti ed eseguire un processo di SageMaker Processing per calcolare i principali n-grammi e le frasi rappresentative per ogni cluster; opzionalmente, affinare i cluster con UMAP per la riduzione della dimensionalità.
  4. Mettere in produzione esponendo un endpoint di inferenza leggero (ml.g4dn.xlarge) per l’embedding di nuovi commenti, utilizzare Batch Transform per il re-clustering notturno e abilitare SageMaker Model Monitor per rilevare il drift degli embedding e attivare il re-training quando lo scostamento della distribuzione supera le soglie.

Logica: Questo approccio bilancia una pre-elaborazione scalabile, embedding contestuali per testo breve/rumoroso e una scoperta efficiente degli argomenti basata sulla similarità, utilizzando al contempo SageMaker per il training, l’inferenza e il monitoraggio per garantire riproducibilità e prontezza operativa.


Deep Learning e Computer Vision · Tutti i domini · Serie temporali e previsione

Esercitati su queste domande → · Pratica cronometrata su ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Supera l'esame →

Sfoglia Amazon →

Related guides

Accesso tutto incluso

Un abbonamento. Ogni esame.

Ogni piano sblocca la ricerca illimitata di risposte, test pratici, spiegazioni AI e la libreria completa di risorse — in oltre 20 lingue.

Mensile
24.87
Just €0.83/day
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

Miglior valore
12 mesi
179.87
Just €0.49/daySave 40%
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

✓ Piano gratuito incluso · ✓ Annulla in qualsiasi momento · ✓ Tutti i piani sbloccano il prodotto completo