一位数据科学家使用50万个句子对训练了一个用于英日翻译的序列到序列模型。短句(大约五个词)翻译得很好,但很长的句子(大约100个词)的翻译质量很差。哪种改变最有可能解决这个问题?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 调整与attention mechanism相关的超参数。.
为什么这是答案
正确答案是调整与attention mechanism相关的超参数。在序列到序列模型中,当处理长序列时,传统的RNN(如LSTM或GRU)由于信息瓶颈和梯度消失问题,很难有效地捕捉长距离依赖。注意力机制允许模型在生成输出序列的每个元素时,动态地关注输入序列中相关的部分,从而显著提高长句翻译的质量。调整其超参数(例如,注意力头的数量、注意力类型或注意力分数计算方式)可以优化模型对长距离依赖的捕捉能力。 将文本预处理为n-gram通常用于传统机器学习模型,而不是深度学习的序列到序列模型,且不能解决长距离依赖问题。增加RNN单元的数量以匹配最长句子的词数是模型设计的一部分,但并不能根本解决长序列的梯度消失或信息瓶颈问题。使用不同的权重初始化方案可能对模型收敛速度和最终性能有影响,但不太可能专门解决长句翻译质量差的问题,尤其是在注意力机制缺失或未优化的前提下。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡