Amazon AIF-C01: MLOps e Deployment — Guida allo studio
Fa parte della AWS AI Practitioner AIF-C01 — Guida allo studio. Esercitati con risposte verificate nel centro esami Amazon, oppure fai test cronometrati su ExamRoll.io.
Pattern di deployment e inferenza: in tempo reale, batch, serverless ed edge
La scelta di un pattern di inferenza inizia con la valutazione dei compromessi a livello di servizio tra latenza, throughput, costo e complessità operativa. Per esigenze di bassa latenza e alto throughput, le soluzioni tipiche sono gli endpoint in tempo reale provisioned di Amazon SageMaker (endpoint a modello singolo o multi-modello) o SageMaker Real-Time Inference con autoscaling e istanze GPU; si utilizzano le varianti di endpoint per implementare rollout di tipo canary o blue/green. Per processi offline di grandi dimensioni in cui la latenza non è critica, SageMaker Batch Transform o l’elaborazione distribuita su AWS Glue/EMR sono soluzioni economiche e semplici da scalare. Per carichi di lavoro imprevedibili o con un basso numero di QPS, SageMaker Serverless Inference o l’invocazione di modelli da AWS Lambda (con la concorrenza provisioned quando necessario) riducono l’overhead di gestione e i costi. I deployment edge richiedono il packaging dei modelli con SageMaker Edge Manager e la loro distribuzione tramite AWS IoT Greengrass per dispositivi con connettività intermittente e requisiti stringenti di latenza o privacy. Le trappole comuni per gli operatori del settore includono la scelta di endpoint in tempo reale per traffico sporadico (con conseguenti costi elevati), la mancata verifica degli avvii a freddo (cold start) per i deployment serverless e la sottostima dei requisiti di memoria/GPU per gli endpoint multi-modello. Le decisioni dovrebbero essere guidate dagli SLO (latenza p99, throughput), dalle dimensioni del modello, dai pattern di concorrenza e dalla frequenza di aggiornamento prevista; è fondamentale eseguire il profiling con traffico rappresentativo prima di scegliere un pattern di hosting.
Model registry, pipeline e CI/CD per una delivery ripetibile
Un flusso di lavoro di produzione robusto utilizza SageMaker Model Registry per versionare gli artefatti, tracciare la lineage del modello e gestire i flussi di approvazione, e SageMaker Pipelines per comporre passaggi ripetibili di addestramento, validazione e deployment. L’integrazione del controllo di versione basato su Git con AWS CodePipeline e CodeBuild abilita la CI del codice del modello: unit test, controlli dello schema dei dati e valutazione automatizzata del modello che funge da gate per la promozione nel registro. L’automazione del deployment dovrebbe implementare ambienti a stadi (dev → staging → prod) e supportare rollback automatici o lo spostamento del traffico tramite varianti di endpoint, deployment blue/green o routing basato su Lambda. I feature store (SageMaker Feature Store) garantiscono la coerenza tra addestramento e inferenza archiviando le definizioni delle feature e i timestamp. Le trappole comuni includono la mancata registrazione degli iperparametri e delle versioni dell’ambiente, la non automazione dei test di validazione (schema dei dati, soglie di performance) e la mancanza di artefatti immutabili (archiviare gli artefatti del modello in S3 o ECR). Utilizzare l’infrastructure-as-code (CloudFormation o CDK) per la configurazione degli endpoint, garantire la riproducibilità fissando le versioni di librerie e seed, e pianificare trigger di riaddestramento (data drift, pianificazioni periodiche) integrati con la stessa pipeline.
Monitoraggio, Model Monitor e controlli operativi
Il monitoraggio operativo deve coprire il data drift, il concept drift, il degrado delle performance, la latenza e l’utilizzo delle risorse. Amazon SageMaker Model Monitor può creare una baseline delle distribuzioni di addestramento e profilare continuamente il traffico di inferenza per rilevare feature drift, valori mancanti e modifiche allo schema; quando il ground truth è disponibile, Model Monitor può anche tracciare la qualità delle predizioni e il target drift. Strumentare il logging dell’inferenza verso Amazon S3 e CloudWatch, e inviare i log in streaming ad Amazon Kinesis o Amazon EventBridge per allarmi in tempo reale e trigger di pipeline automatizzati. Evitare errori comuni come trattare ogni allarme di drift come un segnale per il riaddestramento (spostamenti transitori e stagionalità possono causare falsi positivi) o impostare soglie senza comprendere la varianza naturale. Per le classi sbilanciate, preferire precision, recall e F1 score rispetto all’accuracy per rilevare un degrado significativo. Implementare RBAC e crittografia (KMS) per gli artefatti del modello, utilizzare endpoint VPC e AWS PrivateLink per un accesso sicuro ai servizi, e catturare le tracce di audit tramite AWS CloudTrail. Mantenere playbook operativi per la remediation: validare le pipeline di dati, confrontare le performance delle coorti recenti e, a seconda dei casi, riaddestrare, eseguire un rollback o applicare calibrazioni e correzioni alle feature.
- Metriche di valutazione chiave e quando usarle
- Accuracy: correttezza generale; fuorviante con dati sbilanciati
- Precision: correttezza delle predizioni positive; da usare quando i falsi positivi sono costosi
- Recall (Sensitivity): capacità di trovare i casi positivi; da usare quando i falsi negativi sono costosi
- F1 score: media armonica di precision e recall; scelta bilanciata per classi sbilanciate
- AUC-ROC: qualità del ranking attraverso le soglie; utile per classificatori binari indipendentemente dalla soglia
Spiegabilità, Model Card e controlli pronti per la conformità
La spiegabilità deve essere operativa, verificabile e adattata alle esigenze degli stakeholder. Amazon SageMaker Clarify fornisce controlli del bias pre-addestramento, metriche del bias post-addestramento e attribuzioni delle feature per singola previsione tramite SHAP, che possono essere prodotte al momento dell’inferenza o in batch offline. Le spiegazioni a runtime dovrebbero essere registrate insieme alle previsioni e alle “impronte digitali” (fingerprint) degli input per garantire la tracciabilità; archiviare le spiegazioni in S3 e indicizzarle per il recupero. Le Model Card documentano l’uso previsto, la provenienza dei dati, le metriche di valutazione su sezioni (slice) pertinenti, le limitazioni note e le avvertenze sulle prestazioni; mantenere le versioni delle Model Card all’interno del Model Registry per soddisfare la governance. I casi d’uso finanziari e regolamentati richiedono audit trail deterministici: conservare gli artefatti del modello, gli iperparametri, i dati di valutazione e i log delle spiegazioni; implementare gate di approvazione con intervento umano (human-in-the-loop) per le decisioni ad alto impatto e mantenere spiegazioni controfattuali per i casi complessi. Per un’integrazione sicura con i foundation model gestiti, utilizzare gli endpoint di interfaccia di AWS PrivateLink per chiamare Amazon Bedrock dall’interno di un VPC, crittografare i payload con KMS e applicare controlli granulari a livello di IAM e di rete. La scelta dei servizi per l’archiviazione degli embedding e la ricerca vettoriale dipende dalle esigenze di recupero; confrontare le opzioni in base alle prestazioni e ai costi operativi:
- Amazon OpenSearch Service (k-NN): ricerca vettoriale scalabile con analytics integrati
- Amazon Kendra: ricerca semantica gestita con connettori integrati e funzionalità enterprise
- Amazon RDS (Postgres + pgvector): archiviazione vettoriale transazionale, più semplice per dataset relazionali
- ANN personalizzata su Amazon EKS o ECS: massima flessibilità per NMSLIB/FAISS, ma con un maggiore onere operativo
Problema Pratico: Scenario d’Uso
Scenario: FinSight gestisce una pipeline di decisioni sul credito in AWS utilizzando SageMaker per l’addestramento dei modelli, Bedrock per le spiegazioni generative ausiliarie e Amazon S3 per i dati. I modelli sono distribuiti come endpoint in tempo reale di SageMaker all’interno di un VPC, e Model Monitor è abilitato per profilare le feature in ingresso.
Sfida: Model Monitor ha segnalato un feature drift oltre le soglie consentite e le normative aziendali richiedono decisioni verificabili e spiegabili per qualsiasi modifica automatizzata dei limiti di credito.
Approccio Raccomandato:
- Usare gli avvisi di SageMaker Model Monitor per attivare una regola di EventBridge che invii i dati del drift a un workflow di riaddestramento di SageMaker Pipelines, ed eseguire uno snapshot dell’inferenza corrente e dei dati di input recenti in un bucket S3 di quarantena.
- Eseguire un processo di validazione automatizzato all’interno di SageMaker Pipelines che confronti le distribuzioni dei dati recenti con la baseline, calcoli le metriche di valutazione (precision/recall/F1) e produca spiegazioni SHAP per singolo campione con SageMaker Clarify per una coorte rappresentativa.
- Se i controlli automatici hanno esito positivo, registrare il nuovo modello nel SageMaker Model Registry con una Model Card aggiornata che includa le performance su diverse sezioni (slice) e le spiegazioni; utilizzare le varianti di endpoint e il traffic shifting per un rollout graduale. Se i controlli falliscono, creare un incident nella coda operativa e avviare una fase di revisione umana prima di qualsiasi rollout.
- Per le chiamate sicure a Bedrock che generano spiegazioni leggibili dall’uomo, instradare il traffico di Bedrock tramite AWS PrivateLink e crittografare i payload con KMS; registrare tutti gli output delle spiegazioni in S3 e collegarli ai record di inferenza per la verificabilità.
Motivazione: Questo approccio combina il rilevamento automatico, la validazione riproducibile e il deployment controllato (guarded deployment) con audit trail e spiegazioni per singola decisione, allineando i controlli operativi con la trasparenza normativa e minimizzando le azioni errate di riaddestramento o rollback.
← Addestramento · Tutti i domini · Ottimizzazione dei Costi e Pricing per AI →
Esercitati su queste domande → · Pratica cronometrata su ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Supera l'esame →