あるデータサイエンティストが、50万組の文のペアを使用して、英語から日本語への翻訳のためのsequence-to-sequenceモデルをトレーニングしました。短い文(約5単語)はうまく翻訳されますが、非常に長い文(約100単語)の翻訳は不十分です。この問題を解決するために最も可能性が高い変更は何ですか?
解答を選択
オプションをタップして解答を確認してください。
正解: アテンションメカニズムに関連するハイパーパラメータを調整する。.
これが解答である理由
長いシーケンスの翻訳が不十分な場合、多くの場合、モデルが文の初期部分を「忘れてしまう」という勾配消失問題に直面しています。アテンションメカニズムは、デコーダが各出力ステップで入力シーケンスの関連部分に焦点を当てることを可能にし、この問題を軽減します。したがって、アテンションメカニズムに関連するハイパーパラメータ(例:アテンションの種類、アテンションヘッドの数、アテンションのドロップアウト率)を調整することで、モデルが長い文のすべての部分を適切に考慮できるようになり、翻訳品質が向上する可能性が最も高いです。n-gramへの前処理はコンテキストを失う可能性があり、RNNユニットの数を増やすだけでは勾配消失を解決せず、異なる重み初期化は通常、収束速度や局所最適解からの脱却に影響しますが、長いシーケンスの依存関係を直接改善するものではありません。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要