Amazon MLS-C01: Traitement du langage naturel et parole — Guide d'étude

Fait partie du AWS Machine Learning Specialty MLS-C01 — Guide d’étude. Entraînez-vous avec des réponses vérifiées dans le centre d’examens Amazon, ou passez des tests chronométrés sur ExamRoll.io.

Prétraitement, tokenisation et nettoyage du texte

Un prétraitement de texte robuste est le fondement de pipelines de NLP fiables. Commencez par normaliser l’Unicode, supprimer le HTML et retirer les caractères de contrôle ; utilisez AWS Glue ou une tâche SageMaker Processing (ml.m5.xlarge) pour exécuter des étapes de nettoyage évolutives en Python ou PySpark. Le choix de la tokenisation est un point de décision : les tokeniseurs par mot sont simples mais souffrent de jetons hors vocabulaire (OOV) ; les tokeniseurs par sous-mot tels que Byte-Pair Encoding ou WordPiece (utilisé par BERT) réduisent le risque d’OOV et sont préférables pour les corpus multilingues ou riches en noms de produits. Nettoyez le contenu généré par les utilisateurs en supprimant les PII, en normalisant les dates et les nombres, et en mappant les emojis/hashtags à des formes canoniques lorsqu’ils véhiculent un sentiment. Méfiez-vous des pièges courants : une suppression agressive des mots vides peut nuire aux modèles de thèmes et aux modèles de séquence, et la mise en minuscules supprime les signaux de casse utiles à la reconnaissance d’entités nommées. Pour la production, implémentez un prétraitement déterministe dans une couche SageMaker Processing ou Lambda et enregistrez les versions du code de prétraitement et des artefacts dans SageMaker Model Registry afin que Model Monitor puisse calculer la dérive des données par rapport au même pipeline. Lorsque vous traitez des millions de commentaires courts, compressez la sortie tokenisée au format parquet sur S3 et utilisez SageMaker Batch Transform pour l’extraction de caractéristiques en aval afin d’éviter la latence de tokenisation à chaque requête.

Incorporations lexicales et représentations sémantiques

Choisissez les incorporations lexicales en fonction de la complexité de la tâche et du budget de calcul. Pour des incorporations rapides et évolutives, entraînez ou utilisez un modèle Word2Vec pré-entraîné via BlazingText dans SageMaker (utilisez les modes supervisé ou skip-gram sur ml.c5.4xlarge) pour obtenir des vecteurs denses pour les mots ; agrégez-les en vecteurs de phrase avec une moyenne pondérée par l’IDF pour le comptage de thèmes. Pour la recherche sémantique et les tâches contextuelles, affinez des modèles de type transformeur (BERT, DistilBERT ou Sentence-BERT) en utilisant le framework Hugging Face sur SageMaker Training avec des instances GPU (ml.p3.2xlarge ou ml.p4d.24xlarge selon l’échelle) et utilisez une inférence optimisée sur ml.g4dn ou ml.p3 pour les points de terminaison sensibles à la latence. Produisez et stockez les incorporations dans S3 ou SageMaker Feature Store ; pour la recherche de plus proches voisins approximative, utilisez Faiss sur un cluster d’inférence dédié ou Amazon Kendra pour la recherche d’entreprise. Attention aux pièges : l’utilisation d’incorporations statiques pour les mots polysémiques fait perdre le contexte ; une dimensionnalité excessive augmente le stockage et ralentit les recherches de plus proches voisins — appliquez une PCA/UMAP ou la quantification. Lorsque les modèles en aval sont sensibles à la dérive des incorporations, implémentez Model Monitor pour suivre les changements de distribution des incorporations et ré-générez-les périodiquement avec un tokeniseur et un point de contrôle de modèle cohérents.

Modèles de séquence, gestion des intentions/slots et extraction d’entités

La modélisation de séquences s’étend des LSTMs/GRUs classiques aux transformeurs encodeur-décodeur pour les tâches seq2seq. Pour la détection d’intention et le remplissage de slots dans les systèmes conversationnels, tirez parti d’Amazon Lex pour gérer les intentions, les types de slots et les hooks de traitement ; intégrez Lambda pour la validation de slots complexes ou l’enrichissement de contexte. Pour les modèles sur mesure, entraînez une NER au niveau du jeton en utilisant des champs aléatoires conditionnels par-dessus BERT ou utilisez le fine-tuning de classification de jetons de Hugging Face sur SageMaker (entraînement sur GPU avec ml.p3.2xlarge). Les cas d’usage séquence-à-séquence tels que le résumé ou la traduction favorisent les transformeurs encodeur-décodeur (T5, BART) et nécessitent des instances GPU plus grandes pour l’entraînement ; utilisez la précision mixte (AMP) et l’accumulation de gradient pour traiter de longues séquences. L’extraction d’entités peut utiliser Amazon Comprehend pour les entités nommées prêtes à l’emploi, mais pour les entités spécifiques à un domaine (SKU de produits, noms de produits chimiques), choisissez Comprehend Custom Entities ou affinez votre propre modèle de NER. Un piège courant est de confondre la classification d’intention avec la validation des slots — une haute précision de l’intention ne garantit pas des valeurs de slot correctes ; ajoutez une validation de schéma, des seuils de confiance et des intentions de repli. Pour la production, exposez les modèles via des points de terminaison SageMaker avec des points de terminaison multi-modèles pour l’efficacité des coûts, et utilisez l’inférence asynchrone ou Batch Transform pour les tâches hors ligne à haut débit.

Parole : transcription, synthèse et solutions vocales de bout en bout

Les pipelines de traitement de la parole nécessitent de prendre en compte à la fois les modèles acoustiques et les modèles de langage. Pour la transcription, Amazon Transcribe gère les cas d’usage courants avec des fonctionnalités telles que les vocabulaires personnalisés et le filtrage de vocabulaire pour améliorer la reconnaissance des noms de marques ou de produits ; activez les vocabulaires personnalisés et le filtrage de vocabulaire dans les paramètres de la tâche Transcribe, et utilisez l’identification des canaux ou la diarisation des locuteurs en présence de messages vocaux ou de journaux à plusieurs locuteurs. Pour l’audio ultra-court avec une latence stricte, préférez Transcribe Streaming en temps réel avec des connexions WebSocket à faible latence et envisagez le modèle de langage personnalisé de Transcribe pour le jargon spécialisé. Pour la synthèse vocale (text-to-speech), Amazon Polly fournit des voix neuronales et le support de SSML ; utilisez des lexiques et des balises SSML pour contrôler la prononciation, la prosodie et les pauses afin d’offrir une expérience client naturelle. Intégrez Lex avec Transcribe et Polly pour créer des bots vocaux, et connectez-vous à Amazon Connect pour la téléphonie. Un piège fréquent consiste à se fier uniquement aux modèles de langage par défaut pour les noms spécifiques à un domaine : ajoutez toujours des vocabulaires personnalisés ou affinez les modèles. Pour les besoins hors ligne ou sur site (on-premises), empaquetez des modèles légers à l’aide de SageMaker Neo ou déployez des modèles acoustiques plus petits sur des appareils en périphérie (edge), tout en centralisant les mises à jour des modèles de langage lourds dans le cloud et en les versionnant dans SageMaker Model Registry.

Problème pratique : Scénario d’utilisation

Scénario : GlobalNews Analytics, qui s’exécute sur AWS, dispose de pipelines de données dans S3 et effectue le prétraitement dans SageMaker Processing. Ils ingèrent des millions de commentaires d’utilisateurs en anglais chaque jour et maintiennent un point de terminaison SageMaker pour l’analyse de sujets.

Défi : Identifier les sujets les plus discutés à partir de commentaires bruités et souvent courts, tout en gérant l’argot, les emojis et des milliers de noms propres (noms de produits/lieux).

Approche recommandée :

  1. Utiliser une tâche SageMaker Processing (ml.m5.4xlarge) pour effectuer un nettoyage déterministe : suppression du HTML, normalisation Unicode, mappage des emojis vers des jetons (tokens), mise en minuscules le cas échéant, et stocker le texte nettoyé au format Parquet sur S3.
  2. Générer des plongements de phrases contextuels (sentence embeddings) en affinant un modèle Sentence-BERT à l’aide de Hugging Face sur SageMaker Training avec ml.p3.2xlarge ; persister les plongements sur S3 et éventuellement dans Feature Store.
  3. Regrouper les plongements avec Faiss (cluster de CPU ou nœuds basés sur GPU) pour découvrir des groupes de sujets et exécuter une tâche SageMaker Processing pour calculer les n-grammes principaux et les phrases représentatives par cluster ; affiner éventuellement les clusters avec UMAP pour la réduction de dimensionnalité.
  4. Mettre en production en exposant un point de terminaison d’inférence léger (ml.g4dn.xlarge) pour le plongement de nouveaux commentaires, utiliser Batch Transform pour le regroupement nocturne (re-clustering), et activer SageMaker Model Monitor pour détecter la dérive des plongements (embedding drift) et déclencher un réentraînement lorsque le décalage de distribution dépasse les seuils.

Justification : Cette approche équilibre un prétraitement évolutif, des plongements contextuels pour les textes courts/bruités, et une découverte de sujets efficace basée sur la similarité, tout en utilisant SageMaker pour l’entraînement, l’inférence et la surveillance afin de garantir la reproductibilité et la préparation opérationnelle.


Apprentissage profond et vision par ordinateur · Tous les domaines · Séries temporelles et prévision

Entraînez-vous sur ces questions → · Tests chronométrés sur ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Réussissez votre examen →

Parcourir Amazon →

Related guides

Accès tout-en-un

Un seul abonnement. Chaque examen.

Chaque plan débloque la recherche de réponses illimitée, les tests pratiques, les explications IA et la bibliothèque complète de ressources — en plus de 20 langues.

Mensuel
24.87
Just €0.83/day
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

Meilleur rapport qualité/prix
12 mois
179.87
Just €0.49/daySave 40%
Tout inclus :
  • Recherche de réponses illimitée
  • Tests pratiques illimités
  • Explications basées sur l'IA
  • Bibliothèque complète de ressources
  • Plus de 20 langues
  • Mises à jour de contenu hebdomadaires
  • Récompenses et parrainages
  • Support prioritaire
Commencer l'essai gratuit

Aucune carte de crédit requise*

✓ Plan gratuit inclus · ✓ Annulez à tout moment · ✓ Tous les plans débloquent le produit complet