Amazon MLS-C01: Doğal Dil İşleme ve Konuşma — Çalışma kılavuzu

Şunun bir parçası: AWS Machine Learning Specialty MLS-C01 — Çalışma kılavuzu. Doğrulanmış cevaplarla şurada pratik yapın: Amazon sınav merkezi, veya şurada süreli deneme sınavları çözün: ExamRoll.io.

Metin ön işleme, tokenizasyon ve temizleme

Güvenilir NLP ardışık düzenlerinin (pipeline) temeli, sağlam metin ön işlemedir. Unicode’u normalleştirerek, HTML’i temizleyerek ve kontrol karakterlerini kaldırarak başlayın; ölçeklenebilir Python veya PySpark temizleme adımlarını çalıştırmak için AWS Glue veya bir SageMaker Processing işi (ml.m5.xlarge) kullanın. Tokenizasyon seçimi bir karar noktasıdır: kelime tokenizörleri basittir ancak kelime dağarcığı dışı (out-of-vocabulary - OOV) token sorunu yaşarlar; Byte-Pair Encoding veya WordPiece (BERT tarafından kullanılır) gibi alt kelime (subword) tokenizörleri OOV riskini azaltır ve çok dilli veya ürün adı ağırlıklı külliyatlar (corpus) için tercih edilir. Kullanıcı tarafından oluşturulan içeriği; PII’yi (Kişisel Tanımlayıcı Bilgiler) kaldırarak, tarihleri ve sayıları normalleştirerek ve duygu ifade ettiklerinde emojileri/hashtag’leri standart formlara eşleyerek temizleyin (sanitize). Sık karşılaşılan tuzaklara dikkat edin: agresif bir şekilde etkisiz kelimelerin (stopword) kaldırılması, konu modellerine ve dizi modellerine zarar verebilir ve küçük harfe dönüştürme, isimlendirilmiş varlık tanıma (named-entity recognition) için yararlı olan büyük/küçük harf sinyallerini ortadan kaldırır. Üretim ortamı için, SageMaker Processing veya Lambda katmanında deterministik ön işleme uygulayın ve Model Monitor’ün aynı ardışık düzene göre veri kaymasını (data-drift) hesaplayabilmesi için ön işleme kodunu ve yapıt (artifact) sürümlerini SageMaker Model Registry’de kaydedin. Milyonlarca kısa yorumla çalışırken, istek başına tokenizasyon gecikmesini önlemek için tokenize edilmiş çıktıyı S3 üzerinde parquet formatında sıkıştırın ve sonraki aşamadaki özellik çıkarımı (feature extraction) için SageMaker Batch Transform kullanın.

Gömme (embedding) ve anlamsal temsiller

Gömme seçimini, görevin karmaşıklığına ve işlem (compute) bütçenize göre yapın. Hızlı, ölçeklenebilir gömmeler için, kelimelere yönelik yoğun vektörler (dense vectors) elde etmek amacıyla SageMaker’daki BlazingText aracılığıyla Word2Vec’i eğitin veya önceden eğitilmiş olanı kullanın (ml.c5.4xlarge üzerinde supervised veya skip-gram modlarını kullanın); konu sayıları için IDF ağırlıklı ortalama ile cümle vektörlerine birleştirin. Anlamsal geri getirme (semantic retrieval) ve bağlamsal görevler için, GPU örneklerine (ölçeğe bağlı olarak ml.p3.2xlarge veya ml.p4d.24xlarge) sahip SageMaker Training üzerinde Hugging Face çatısını (framework) kullanarak transformer modellerini (BERT, DistilBERT veya Sentence-BERT) ince ayardan geçirin (fine-tune) ve gecikmeye duyarlı uç noktalar (endpoint) için ml.g4dn veya ml.p3 üzerinde optimize edilmiş çıkarım (inference) kullanın. Gömmeleri S3 veya SageMaker Feature Store’da üretin ve saklayın; yaklaşık en yakın komşu (approximate nearest-neighbor) araması için özel bir çıkarım kümesinde (cluster) Faiss’i veya kurumsal arama için Amazon Kendra’yı kullanın. Tuzaklara dikkat edin: çok anlamlı (polysemous) kelimeler için statik gömmeler kullanmak bağlamı kaybettirir; aşırı boyutsallık depolamayı artırır ve en yakın komşu aramalarını yavaşlatır—PCA/UMAP veya nicemleme (quantization) uygulayın. Sonraki aşamadaki modeller gömme kaymasına (embedding drift) duyarlı olduğunda, gömme dağılımı kaymalarını izlemek için Model Monitor’ü uygulayın ve tutarlı bir tokenizör ve model kontrol noktası (checkpoint) ile periyodik olarak yeniden gömme işlemi yapın.

Dizi modelleri, niyet/alan yönetimi ve varlık çıkarma

Dizi modellemesi (sequence modeling), klasik LSTMs/GRU’lardan seq2seq görevleri için transformer kodlayıcı-kod çözücülere (encoder-decoder) kadar uzanır. Diyalog sistemlerinde niyet tespiti (intent detection) ve alan doldurma (slot filling) için niyetleri, alan türlerini ve yerine getirme kancalarını (fulfillment hooks) yönetmek amacıyla Amazon Lex’ten yararlanın; karmaşık alan doğrulaması veya bağlam zenginleştirme için Lambda’yı entegre edin. Özel modeller için, BERT üzerinde koşullu rastgele alanlar (conditional random fields) kullanarak token seviyesinde NER eğitin veya SageMaker üzerinde (ml.p3.2xlarge ile gpu eğitimi) Hugging Face token-sınıflandırma ince ayarını kullanın. Özetleme veya çeviri gibi diziden diziye (sequence-to-sequence) kullanım senaryoları, kodlayıcı-kod çözücü transformer’ları (T5, BART) tercih eder ve eğitim için daha büyük GPU örnekleri gerektirir; uzun dizileri sığdırmak için karma hassasiyet (mixed precision - AMP) ve gradyan biriktirme (gradient accumulation) kullanın. Varlık çıkarma (entity extraction) için hazır isimlendirilmiş varlıklar (named entities) için Amazon Comprehend kullanılabilir, ancak alana özgü varlıklar (ürün SKU’ları, kimyasal adları) için Comprehend Custom Entities’i seçin veya kendi NER modelinizi ince ayardan geçirin. Yaygın bir tuzak, niyet sınıflandırmasını alan doğrulamasıyla karıştırmaktır—yüksek niyet doğruluğu, doğru alan değerlerini garanti etmez; şema doğrulaması, güven eşikleri ve geri dönüş niyetleri (fallback intents) ekleyin. Üretim ortamı için, maliyet verimliliği amacıyla modelleri çoklu model uç noktaları (multi-model endpoints) ile SageMaker uç noktaları aracılığıyla sunun ve yüksek verimli çevrimdışı görevler için eşzamansız çıkarım (asynchronous inference) veya Batch Transform kullanın.

Konuşma: transkripsiyon, sentez ve uçtan uca ses çözümleri

Konuşma işlem hatları hem akustik hem de dil modeli hususlarını gerektirir. Transkripsiyon için Amazon Transcribe, marka veya ürün adlarının tanınmasını artırmak amacıyla özel kelime dağarcıkları ve kelime dağarcığı filtreleme gibi özelliklerle yaygın kullanım senaryolarını ele alır; Transcribe iş ayarlarında özel kelime dağarcıklarını ve kelime dağarcığı filtrelemeyi etkinleştirin ve sesli mesajlar veya çok konuşmacılı kayıtlar mevcut olduğunda kanal tanımlama veya konuşmacı günlüğü (speaker diarization) kullanın. Katı gecikme süresi gerektiren çok kısa sesler için, düşük gecikmeli WebSocket bağlantılarına sahip gerçek zamanlı Transcribe Streaming’i tercih edin ve özel jargon için Transcribe’ın özel dil modelini (custom language model) kullanmayı düşünün. Metinden sese dönüştürme (text-to-speech) için Amazon Polly, nöral sesler ve SSML desteği sağlar; doğal bir müşteri deneyimi için telaffuzu, prozodiyi ve duraklamaları kontrol etmek amacıyla sözlükler (lexicons) ve SSML etiketleri kullanın. Sesli botlar oluşturmak için Lex’i Transcribe ve Polly ile entegre edin ve telefon hizmetleri için Amazon Connect’e bağlayın. Sık düşülen bir tuzak, alana özgü isimler için yalnızca varsayılan dil modellerine güvenmektir—her zaman özel kelime dağarcıkları ekleyin veya modellere ince ayar (fine-tune) yapın. Çevrimdışı veya şirket içi (on-premises) ihtiyaçlar için, SageMaker Neo kullanarak hafif modelleri paketleyin veya uç cihazlara (edge devices) daha küçük akustik modeller dağıtın; bu sırada ağır dil modeli güncellemelerini bulutta merkezileştirin ve SageMaker Model Registry’de sürümleyin.

Pratik Problem: Kullanım Senaryosu

Senaryo: GlobalNews Analytics, AWS üzerinde çalışmakta olup S3’te veri işlem hatlarına ve SageMaker Processing’de ön işlemeye sahiptir. Her gün milyonlarca İngilizce kullanıcı yorumunu alıyor ve konu analizi için bir SageMaker uç noktasını (endpoint) sürdürüyorlar.

Zorluk: Gürültülü ve genellikle kısa olan yorumlardan en çok tartışılan konuları belirlerken argo, emoji ve binlerce özel ismi (ürün/yer adları) yönetmek.

Önerilen Yaklaşım:

  1. Deterministik temizleme işlemi için bir SageMaker Processing işi (ml.m5.4xlarge) kullanın: HTML etiketlerini temizleme, Unicode normalizasyonu, emojileri token’lara eşleme, uygun yerlerde küçük harfe dönüştürme ve temizlenmiş metni S3’te parquet olarak saklama.
  2. ml.p3.2xlarge ile SageMaker Training üzerinde Hugging Face kullanarak bir Sentence-BERT modeline ince ayar (fine-tuning) yaparak bağlamsal cümle gömülmeleri (contextual sentence embeddings) oluşturun; gömülmeleri S3’e ve isteğe bağlı olarak Feature Store’a kalıcı olarak kaydedin.
  3. Konu gruplarını keşfetmek için gömülmeleri Faiss (CPU kümesi veya GPU destekli düğümler) ile kümeleyin ve küme başına en iyi n-gram’ları ve temsili cümleleri hesaplamak için bir SageMaker Processing işi çalıştırın; isteğe bağlı olarak boyut azaltma için UMAP ile kümeleri iyileştirin.
  4. Yeni yorumları gömmek için hafif bir çıkarım uç noktası (ml.g4dn.xlarge) sunarak, gecelik yeniden kümeleme için Batch Transform kullanarak ve gömülme kaymasını (embedding drift) tespit edip dağılım kayması eşikleri aştığında yeniden eğitimi tetiklemek için SageMaker Model Monitor’ü etkinleştirerek süreci üretim ortamına taşıyın.

Gerekçe: Bu yaklaşım, tekrarlanabilirliği ve operasyonel hazırlığı sağlamak amacıyla eğitim, çıkarım ve izleme için SageMaker’ı kullanırken; ölçeklenebilir ön işleme, kısa/gürültülü metinler için bağlamsal gömülmeler ve verimli benzerlik tabanlı konu keşfini dengeler.


Derin Öğrenme ve Bilgisayarlı Görü · Tüm alanlar · Zaman Serileri ve Tahminleme

Bu soruları çözün → · ExamRoll.io’da süreli pratik →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Sınavınızı geçin →

Amazon'a göz atın →

Related guides

Hepsi bir arada erişim

Tek abonelik. Her sınav.

Her plan, sınırsız cevap aramayı, pratik testlerini, AI açıklamalarını ve tam kaynak kütüphanesini — 20'den fazla dilde — açar.

Aylık
24.87
Just €0.83/day
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

En iyi değer
12 ay
179.87
Just €0.49/daySave 40%
Her şey dahil:
  • Sınırsız cevap arama
  • Sınırsız pratik testi
  • AI destekli açıklamalar
  • Tam kaynak kütüphanesi
  • 20+ dil
  • Haftalık içerik güncellemeleri
  • Ödüller ve yönlendirmeler
  • Öncelikli destek
Ücretsiz denemeyi başlat

Kredi kartı gerekmez*

✓ Ücretsiz plan dahil · ✓ İstediğiniz zaman iptal edin · ✓ Tüm planlar tam ürünü açar