核心要点
区分词干提取(启发式截断)与词形还原(词典+词性)
举例 running→run vs running→run/stem run
说明对检索、分类、主题模型的影响
知道中文分词与归一化的对应做法
简要回答
Stemming 用规则快速砍掉词尾(Porter),不求合法词形;Lemmatization 结合词典与 词性 还原词典原形(better→good)。检索索引常用 stemming 求召回;需要可读性与准确词形时用 lemmatization。
标准回答
一、先给出结论和背景
- Stemming(词干提取):- 启发式规则去后缀:running, runs, ran → run(Porter/Snowball)
- 快、无需词典;可能产生非词(「studies」→「studi」)
- 适合信息检索扩大召回
- Lemmatization(词形还原):- 用词性 + 词典映射:am/is/are → be;mice → mouse
- 结果仍是合法词,语义更准确
- 适合情感分析、问答、需要人类可读输出的场景
二、拆开关键步骤和判断点
- 对比:| 维度 | Stemming | Lemmatization |
|------|----------|---------------|
| 速度 | 快 | 较慢(需 POS+词典) |
| 准确性 | 粗糙 | 高 |
| 资源 | 无词典 | 需 WordNet 等 | - 中文:无形态变化,侧重 分词、繁简转换、同义词归一,而非经典 stemming。
三、补上落地边界和取舍
- 选型:搜索索引/大规模日志 → stemming;NLP 下游分类/抽取 → lemmatization。详见 NLP 预处理。
回答思路
【定义】用一句话说清「词形还原与词干提取有何区别?何时选用」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
延伸学习
知识库:NLP 文本预处理。术语:词性标注、Tokenization。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:认为二者完全等价;举例错误(stemming 不会把 better→good);忽略 lemmatization 需要 POS。
追问
追问 1:Porter Stemmer 原理?
多步后缀规则(sses→ss, ies→i, ed/ing 删除等),按顺序应用。英语专用,其他语言需 Snowball 多语言 stemmer 或换方案。
追问 2:归一化会影响情感极性吗?
会。把「not good」lemmatize 若拆不当会丢否定;stemming「happiness」与「unhappy」可能错误合并。情感任务慎用激进归一化。
追问 3:BERT 还需要 stemming 吗?
subword tokenization 已部分处理形态;通常直接喂原文。stemming 主要在传统 IR 与词袋管道中仍有价值。
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
