一位資料科學家使用 50 萬個句子對,訓練了一個用於英翻日的 sequence-to-sequence 模型。短句子(大約五個字)翻譯得很好,但很長的句子(大約 100 個字)翻譯得很差。哪種改變最有可能解決這個問題?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 調整與注意力機制相關的超參數。.
為什麼這是答案
正確答案是調整與注意力機制相關的超參數。在 sequence-to-sequence 模型中,注意力機制允許模型在生成輸出序列的每個部分時,權衡輸入序列的不同部分。當處理長句子時,模型可能難以將注意力集中在輸入序列的相關部分,導致翻譯品質下降。調整注意力機制超參數,例如增加注意力頭的數量或改變注意力類型,可以幫助模型更好地處理長距離依賴關係,從而改善長句子的翻譯。 將文字預處理成 n-grams 可能會增加模型的複雜性,但不太可能直接解決長句子翻譯不佳的問題。增加 RNN 單元的數量以符合最長句子的字數,可能會增加模型的容量,但如果沒有適當的注意力機制,模型仍然可能難以處理長距離依賴。使用不同的權重初始化方案通常用於解決模型收斂問題,而非特定於長句子翻譯的挑戰。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡