核心要点
定义语料库及其在训练/评测中的角色
区分中英文分词与 subword tokenization
解释停用词列表的利弊:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。
说明预处理对下游任务的影响:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。
简要回答
Corpus(语料库) 是大规模文本集合,用于训练与评测;Tokenization(分词) 把文本切为 token;Stopwords(停用词) 是高频功能词列表(的、the),去除可降低维度但可能丢失否定等关键信号。
标准回答
一、Corpus(语料库)
二、Tokenization(分词/词元化)
- 将字符流切为模型可处理单元
- 英文:空格+标点规则;中文:jieba、统计分词
- 现代 LLM:BPE/SentencePiece subword,平衡 OOV 与词表大小
- 影响上下文长度、API 计费与多语言表现
三、Stopwords(停用词)
- 高频低信息词:the, is, 的, 了
- 去除可降维、加速传统 ML;但 情感/否定 场景可能误删「not」「不」
- 现代深度学习常 不去停用词,让模型自学权重
四、管道示例
原始文本 → 清洗 → tokenize →(可选)去停用 → lemmatize → 特征化/模型。
详见 NLP 预处理 与 Tokenization 术语。
回答思路
【定义】用一句话说清「NLP 中语料库、分词与停用词分别」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
延伸学习
延伸阅读:文本预处理。术语:Tokenization、语言模型。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:认为停用词必须删除;混淆分词与词形还原;不说 subword 与词级分词区别。
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
