核心要点

  • 区分词干提取(启发式截断)与词形还原(词典+词性)

  • 举例 running→run vs running→run/stem run

  • 说明对检索、分类、主题模型的影响

  • 知道中文分词与归一化的对应做法

简要回答

Stemming 用规则快速砍掉词尾(Porter),不求合法词形;Lemmatization 结合词典与 词性 还原词典原形(better→good)。检索索引常用 stemming 求召回;需要可读性与准确词形时用 lemmatization。

标准回答

一、先给出结论和背景

  • Stemming(词干提取):- 启发式规则去后缀:running, runs, ran → run(Porter/Snowball)
  • 快、无需词典;可能产生非词(「studies」→「studi」)
  • 适合信息检索扩大召回
  • Lemmatization(词形还原):- 用词性 + 词典映射:am/is/are → be;mice → mouse
  • 结果仍是合法词,语义更准确
  • 适合情感分析、问答、需要人类可读输出的场景

二、拆开关键步骤和判断点

  • 对比:| 维度 | Stemming | Lemmatization |
    |------|----------|---------------|
    | 速度 | 快 | 较慢(需 POS+词典) |
    | 准确性 | 粗糙 | 高 |
    | 资源 | 无词典 | 需 WordNet 等 |
  • 中文:无形态变化,侧重 分词、繁简转换、同义词归一,而非经典 stemming。

三、补上落地边界和取舍

  • 选型:搜索索引/大规模日志 → stemming;NLP 下游分类/抽取 → lemmatization。详见 NLP 预处理

回答思路

  • 【定义】用一句话说清「词形还原与词干提取有何区别?何时选用」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

知识库:NLP 文本预处理。术语:词性标注Tokenization

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:认为二者完全等价;举例错误(stemming 不会把 better→good);忽略 lemmatization 需要 POS。

追问

追问 1Porter Stemmer 原理?

多步后缀规则(sses→ss, ies→i, ed/ing 删除等),按顺序应用。英语专用,其他语言需 Snowball 多语言 stemmer 或换方案。

追问 2归一化会影响情感极性吗?

会。把「not good」lemmatize 若拆不当会丢否定;stemming「happiness」与「unhappy」可能错误合并。情感任务慎用激进归一化。

追问 3BERT 还需要 stemming 吗?

subword tokenization 已部分处理形态;通常直接喂原文。stemming 主要在传统 IR 与词袋管道中仍有价值。

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习