核心要点

  • 定义语料库及其在训练/评测中的角色

  • 区分中英文分词与 subword tokenization

  • 解释停用词列表的利弊:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。

  • 说明预处理对下游任务的影响:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。

简要回答

Corpus(语料库) 是大规模文本集合,用于训练与评测;Tokenization(分词) 把文本切为 tokenStopwords(停用词) 是高频功能词列表(的、the),去除可降低维度但可能丢失否定等关键信号。

标准回答

一、Corpus(语料库)

二、Tokenization(分词/词元化)

  • 将字符流切为模型可处理单元
  • 英文:空格+标点规则;中文:jieba、统计分词
  • 现代 LLMBPE/SentencePiece subword,平衡 OOV 与词表大小
  • 影响上下文长度、API 计费与多语言表现

三、Stopwords(停用词)

  • 高频低信息词:the, is, 的, 了
  • 去除可降维、加速传统 ML;但 情感/否定 场景可能误删「not」「不」
  • 现代深度学习常 不去停用词,让模型自学权重

四、管道示例

原始文本 → 清洗 → tokenize →(可选)去停用 → lemmatize → 特征化/模型。
详见 NLP 预处理Tokenization 术语

回答思路

  • 【定义】用一句话说清「NLP 中语料库、分词与停用词分别」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:文本预处理。术语:Tokenization语言模型

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:认为停用词必须删除;混淆分词与词形还原;不说 subword 与词级分词区别。

追问

追问 1BPE 和 WordPiece 区别?

都 merge 高频子词对扩词表;BPE 用频次,WordPiece 用似然增益。GPT 系多用 BPE,BERT 用 WordPiece。目标都是 subword 平衡词表与 OOV。

追问 2停用词列表如何定制?

通用列表 + 领域黑名单(法律「 hereby」、医疗缩写)。用 TF-IDF 看是否真有区分度;情感任务保留否定词。

追问 3语料库偏见如何影响模型?

性别/种族刻板印象、地域方言覆盖不足会导致生成偏见。需多样性审计、去偏处理、RLHF 对齐,并文档化训练数据来源。

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习