在保留预测信息的同时,为 BigQuery ML 线性回归模型准备一个城市类别特征,并尽量减少编码。您应该怎么做?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 BigQuery SQL 将 city 进行独热编码为二进制列。.
为什么这是答案
正确答案是使用 BigQuery SQL 将 city 进行独热编码为二进制列。独热编码(One-Hot Encoding)是将分类特征转换为数值形式的常用方法,它为每个类别创建一个新的二进制列,从而保留了所有预测信息,并且避免了模型对分类特征进行不正确的序数假设。在 BigQuery ML 中,可以直接使用 SQL 函数(如 ML.FEATURETRANSFORM 或 CASE 语句)来实现独热编码,这是一种高效且最小化编码工作量的方法。 创建新的 BigQuery 视图并省略 city 列会丢失重要的预测信息。使用 TensorFlow 创建带有词汇文件的分类变量是更复杂的外部处理,不符合“尽量减少编码”的要求,且 BigQuery ML 内部已支持类似功能。将每个城市映射到数字区域标签(1-5)会引入错误的序数关系,模型可能会错误地认为数字较大的区域比数字较小的区域“更好”或“更大”,从而影响预测准确性。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡