核心要点

  • 定义 POS 标注任务与标签集(Penn Treebank 等)

  • 说明对句法分析、NER、翻译等下游任务的作用

  • 了解歧义消解(如 book 名词/动词)

  • 知道从 HMM/CRF 到 Transformer 的方法演进

简要回答

词性标注(POS) 为每个词分配语法类别(名词、动词等),是句法分析、信息抽取和机器翻译的基础预处理。它能消歧(「Time flies」),并为依存解析提供语言学先验。

标准回答

任务:输入 token 序列,输出对应词性标签(如 NN, VB, JJ)。

为何重要

  1. 句法分析基础:依存/成分解析常依赖 POS 特征
  2. 消歧:同一词形不同词性含义不同(「计划」名/动)
  3. 信息抽取:名词短语 chunking、术语识别
  4. 机器翻译:目标语言词序与形态生成需要 POS 信息
  5. 文本规范化: lemmatization 需知词性选正确词根

方法演进

难点:罕见词、领域术语、社交媒体非规范文本;中文需先分词,分词错误会传导到 POS。

详见 序列标注

回答思路

  • 【定义】用一句话说清「词性标注(POS)在 NLP 中有何意义」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

知识库:NLP 序列标注。术语:词性标注Tokenization

常见误区

⚠️ 常见踩坑

认为 POS 对现代端到端 LLM 完全无用(仍有工具链价值);混淆 POS 与 NER;不说清歧义例子。

追问

追问 1POS 标注错误会如何影响下游?

依存解析 attachment 错误、NER 边界漂移、翻译形态错误会级联放大。应用管道中应对低置信 POS 做回退或端到端联合模型。

追问 2Universal POS tagset 是什么?

跨语言统一的 17 类粗粒度标签(NOUN, VERB…),便于多语言 NLP 工具链(UD 树库)对齐,牺牲部分语言特有细节。

追问 3BERT 还需要 POS 吗?

端到端任务可不显式用 POS,但 POS 仍用于语言学分析、低资源语言工具、可解释性与部分特征工程。工业 NLP 管道中 spaCy/Stanza 仍默认提供 POS。

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习