Chapter 60
章末小测验
章末小测验
让我们测试一下你在这章学到了什么!
1.以下哪些任务可以看作为 token 分类问题?
2. token 分类的预处理部分与其他预处理流程有什么不同?
-100 来标记特殊 token 。", explain: "这不是 token 分类特有的 —— 我们总是用 -100 作为我们想在损失中忽略的 token 的标签。" }, { text: "在进行截断/填充时,我们需要确保将待预测的标签截断或填充到与输入相同的大小", explain: "的确如此!但这并不是唯一的区别。", correct: true } ]} />
3.在 token 分类问题中,当我们分词并想要子词分词时,会出现什么问题?
-100,所以在计算损失时它们会被忽略。" }, { text: "每个词可能产生多个 token ,因此我们最终会得到比我们拥有的标签更多的 token 。", explain: "这是主要的问题,我们需要将原始的标签与 token 对齐。", correct: true }, { text: "添加的 token 没有标签,所以没有问题。", explain: "这是不正确的;我们需要和 token 相同数量的标签,否则我们的模型会报错。" } ]} />
4.“领域适应”是什么意思?
5.掩码语言建模问题中的标签是什么?
6.哪些任务可以被看作是序列到序列的问题?
7.对于序列到序列的问题,预处理数据的正确方法是什么?
{#if fw === 'pt'}
8.为什么需要有一个特定的 Trainer 子类来解决序列到序列问题?
-100 的标签",
explain: "这根本不是自定义的损失计算方法,而是自然语言处理中一种常规的忽略特定 token 计算方式。"
},
{
text: "因为序列到序列问题需要特殊的评估循环",
explain: "没错。序列到序列模型的预测通常需要使用 generate() 方法",
correct: true
},
{
text: "因为该问题中的预测目标是序列到序列中问题部分的文本",
explain: "这不是Trainer需要考虑的部分,因为这些文本在进入Tranier之前已经被预处理过。"
},
{
text: "因为我们在序列到序列问题中使用了两个模型",
explain: "我们确实以某种方式使用两种模型,编码器和解码器,但它们被组合在一个模型中"
}
]}
/>
{:else}
9.为什么在 Transformer 模型上调用 compile() 时通常不需要指定损失的计算方法?
{/if}
