Amazon AIF-C01: Fondamenti di AI e ML — Guida allo studio

Fa parte della AWS AI Practitioner AIF-C01 — Guida allo studio. Esercitati con risposte verificate nel centro esami Amazon, oppure fai test cronometrati su ExamRoll.io.

Concetti Fondamentali e Tipi di Modelli

La comprensione della terminologia fondamentale è alla base di un’architettura solida e di decisioni consapevoli sui compromessi da adottare. L’apprendimento supervisionato (supervised learning) mappa input a output etichettati e si suddivide in regressione per target continui e classificazione per classi discrete; la classificazione multiclasse (20 classi di geni) rispetto a decisioni binarie modifica la scelta del modello e delle funzioni di perdita (loss function). L’apprendimento non supervisionato (unsupervised learning) individua strutture in dati non etichettati attraverso il clustering e la riduzione della dimensionalità per la segmentazione e il rilevamento di anomalie (anomaly detection). Le famiglie di algoritmi comuni includono modelli lineari e insiemi di alberi (interpretabili, veloci per dati tabulari), metodi basati su kernel (SVM) e reti neurali (flessibili, ad alta capacità per immagini, audio e testo). Per i task su immagini, dominano le reti convoluzionali o i modelli fondazionali di visione pre-addestrati (tramite Amazon SageMaker JumpStart o Amazon Rekognition Custom Labels); per il testo, le architetture transformer alimentano i modelli linguistici di grandi dimensioni (LLM) e i modelli di sequenza. I requisiti di interpretabilità spingono gli specialisti verso modelli più semplici o strumenti di spiegabilità come SageMaker Clarify. La selezione del modello bilancia le prestazioni predittive, l’interpretabilità, la latenza di inferenza e il costo: un modello basato su alberi può essere sufficiente per la classificazione genica se è richiesta trasparenza, mentre i modelli profondi (deep model) si adattano a task su immagini o linguaggio ad alta dimensionalità. Conoscere queste famiglie e sapere quando riutilizzare modelli pre-addestrati rispetto all’addestramento da zero guida verso soluzioni efficienti e conformi.

Ciclo di Vita del ML, Gestione dei Dati e delle Feature

Il ciclo di vita del machine learning inizia con la definizione del problema (problem framing), la raccolta dei dati, l’etichettatura, l’ingegneria delle feature (feature engineering), l’addestramento, la validazione, il deployment, il monitoraggio e l’iterazione. Negli ambienti AWS, SageMaker orchestra molte fasi del ciclo di vita: SageMaker Processing per le trasformazioni dei dati, SageMaker Feature Store per l’archiviazione centralizzata delle feature e il loro serving online/offline, e SageMaker Pipelines per la CI/CD dei flussi di lavoro dei modelli. La qualità delle etichette e il bilanciamento delle classi sono colli di bottiglia frequenti; è bene investire in pipeline di annotazione robuste o utilizzare SageMaker Ground Truth per ridurre le etichette errate (noisy labels) e l’apprendimento attivo (active learning) per focalizzare lo sforzo umano. La tracciabilità delle feature (feature lineage) e i controlli di accesso sono importanti per la riproducibilità e la governance; è necessario registrare le feature e i modelli in SageMaker Model Registry e versionare i set di dati in Amazon S3 con policy sul ciclo di vita. Per la produzione, includere il monitoraggio automatizzato del modello con SageMaker Model Monitor per rilevare data drift, concept drift e degrado dell’accuratezza, e integrare gli allarmi tramite Amazon CloudWatch e AWS Lambda. Progettare le pipeline con idempotenza e capacità di ripristino: utilizzare pattern basati su eventi (eventi S3, Step Functions) e progettare le risorse di calcolo e archiviazione per scalare — addestramento su istanze EC2/GPU o Trainium, inferenza su istanze Inf1/Neptune/Graviton — in base ai requisiti di latenza e throughput.

Valutazione, Algoritmi e Trappole Comuni

La selezione delle metriche di valutazione e delle baseline è una pratica decisiva. Per i problemi di classificazione, considerare precision, recall, F1-score e l’area sotto la curva ROC; per la classificazione multiclasse, utilizzare la recall per classe e le medie macro/micro. La valutazione della regressione utilizza RMSE, MAE e R-quadro (R-squared). Per il serving in produzione, l’efficienza di esecuzione è misurata dalla latenza di coda (P95/P99) e dal throughput (richieste al secondo), e dal costo per inferenza. Le trappole tipiche includono la scelta dell’accuratezza (accuracy) in set di dati sbilanciati, l’overfitting dovuto a un’eccessiva ottimizzazione degli iperparametri sui dati di test e la mancata calibrazione quando le probabilità vengono utilizzate per decisioni di business. Utilizzare la validazione incrociata (cross-validation) e la validazione su un set di dati di holdout, e implementare modelli di baseline (euristiche semplici) per garantire che il ML aggiunga valore. Quando i dati etichettati sono scarsi, utilizzare il transfer learning, la data augmentation per le immagini o approcci semi-supervisionati. Per la spiegabilità (explainability) e la conformità, abbinare modelli opachi a strumenti di spiegazione post-hoc (SHAP, gradienti integrati) e integrare SageMaker Clarify. Scelte di algoritmi comuni su AWS: XGBoost per dati tabulari con addestramento rapido su SageMaker, CNN per immagini tramite Torch/TensorFlow su istanze GPU, e transformer per il testo utilizzando Hugging Face su SageMaker o i modelli fondazionali di Bedrock per la generazione aumentata da recupero (retrieval-augmented generation).

Modelli Fondamentali, Pattern di Deployment e Sicurezza

I modelli fondamentali (foundation model) accelerano lo sviluppo ma introducono scelte architetturali e considerazioni sulla sicurezza distinte. Amazon Bedrock fornisce accesso gestito a più modelli di base e supporta il fine-tuning, i flussi di lavoro di RAG (retrieval-augmented generation) e l’integrazione con database vettoriali (vector store) come Amazon OpenSearch Service (k-NN) o Amazon Kendra per la ricerca semantica. Scegliere tra fine-tuning, instruction-tuning o adattatori leggeri (lightweight adapter) in base alla dimensione dei dati e alle esigenze di sicurezza. Per l’inferenza a bassa latenza e alto throughput, considerare il deployment di modelli ottimizzati su Amazon EC2 Inf1 (Inferentia) o l’uso di SageMaker Neo/Edge Manager per compilare e ospitare modelli su dispositivi edge; l’inferenza on-device con la latenza più bassa in assoluto richiede la quantizzazione e il pruning del modello, nonché un runtime locale tramite SageMaker Edge Manager o AWS IoT Greengrass, sacrificando in parte le dimensioni e l’accuratezza del modello. I pattern di sicurezza includono endpoint VPC, AWS PrivateLink per Bedrock, ruoli IAM restrittivi, crittografia S3 basata su KMS per i dati sensibili e la registrazione degli audit (audit logging). Per ridurre le allucinazioni e gli attacchi tramite prompt (prompt attack), implementare delle barriere di protezione (guardrail): sanitizzazione dell’input, template per i prompt, filtri sulle risposte e controlli RLHF o di post-elaborazione. Monitorare l’utilizzo e le chiamate API anomale con CloudTrail e implementare limiti di frequenza (rate limit) e rilevamento delle anomalie per proteggere l’accesso al modello e la privacy dei dati.

Problema Pratico: Scenario d’Uso

Scenario: GreenGene Labs utilizza un ambiente AI su AWS con Amazon S3 per i dati grezzi, SageMaker per lo sviluppo di modelli e Amazon Bedrock per la sperimentazione con i modelli fondamentali. L’azienda gestisce metadati genomici e clinici sensibili con controlli di accesso rigorosi e necessita di un’inferenza scalabile per le dashboard di ricerca.

Sfida: Classificare campioni di geni umani in 20 categorie con una logica decisionale trasparente, mantenere il riutilizzo delle feature tra i team e distribuire un’API monitorata a bassa latenza per i ricercatori.

Approccio Raccomandato:

  1. Usare SageMaker Processing e Ground Truth per preparare ed etichettare i dati, archiviando le feature curate in SageMaker Feature Store.
  2. Addestrare modelli interpretabili (XGBoost, alberi decisionali) in SageMaker Training; registrare i modelli in SageMaker Model Registry e tracciarne la lineage.
  3. Eseguire il deployment del modello migliore su un endpoint SageMaker dietro un Application Load Balancer con autoscaling; abilitare SageMaker Model Monitor per il rilevamento del drift e gli allarmi CloudWatch.
  4. Per la sperimentazione con rappresentazioni più grandi, usare modelli di Bedrock o Hugging Face per gli embedding e aggiungere un indice vettoriale OpenSearch per la ricerca di similarità; combinare il risultato con il modello interpretabile per la classificazione finale.

Logica: La gestione centralizzata delle feature e le pipeline riproducibili riducono la fuga di dati (data leakage) e accelerano la collaborazione, mentre la priorità data ai modelli interpretabili soddisfa i requisiti di trasparenza e gli embedding di Bedrock consentono una rappresentazione più ricca senza sacrificare la governance.


Tutti i domini · Concetti di AI Generativa

Esercitati su queste domande → · Pratica cronometrata su ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Supera l'esame →

Sfoglia Amazon →

Related guides

Accesso tutto incluso

Un abbonamento. Ogni esame.

Ogni piano sblocca la ricerca illimitata di risposte, test pratici, spiegazioni AI e la libreria completa di risorse — in oltre 20 lingue.

Mensile
24.87
Just €0.83/day
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

Miglior valore
12 mesi
179.87
Just €0.49/daySave 40%
Tutto incluso:
  • Ricerca risposte illimitata
  • Test pratici illimitati
  • Spiegazioni basate su AI
  • Libreria completa di risorse
  • Oltre 20 lingue
  • Aggiornamenti settimanali dei contenuti
  • Premi e referral
  • Supporto prioritario
Inizia la prova gratuita

Nessuna carta di credito richiesta*

✓ Piano gratuito incluso · ✓ Annulla in qualsiasi momento · ✓ Tutti i piani sbloccano il prodotto completo