核心要点

  • 定义命名实体类型:人名、地名、机构、时间等

  • 区分 NER 与 POS关系抽取

  • 说明 BIO/BILOU 标注体系

  • 举出搜索、知识图谱、合规等应用

简要回答

命名实体是文本中具有特定意义的专有对象(人、地、组织、日期等)。NER 自动识别并分类这些跨度,是知识图谱构建、智能搜索、文档结构化与合规审查的关键前置步骤。

标准回答

一、先给出结论和背景

  • 命名实体(Named Entity):文本中指代特定对象、事件或数量的短语,如「苹果公司」「2024 年」「北京市」。
  • NER 任务:给定文本,输出实体边界(span)+ 类型标签。常用 BIO 标注:B-PER 实体开始、I-PER 内部、O 非实体。

二、拆开关键步骤和判断点

  • 实体类型:- 通用:PER(人)、ORG(机构)、LOC(地点)、DATE、MONEY
  • 领域定制:药品名、产品型号、法律条款(需自定义 schema)
  • 方法:- 规则 + 词典(高精确、低召回)
  • CRF / BiLSTM-CRF
  • BERT + 线性层(当前主流)
  • LLM 提示抽取(灵活但需校验)

三、补上落地边界和取舍

  1. 搜索增强:实体链接提升 query 理解
  2. 金融/医疗合规:自动标出当事人、药物、诊断
  3. 简历/合同解析:结构化字段入库
    详见 信息抽取

回答思路

  • 【定义】用一句话说清「什么是命名实体?NER 在 NLP 任务中有何用处」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:信息抽取与 NER。术语:BERT关系抽取知识图谱

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:把普通名词当命名实体;混淆 NER 与实体链接(EL);不提嵌套实体与领域适配。

追问

追问 1嵌套 NER 怎么处理?

平面 BIO 无法表达「北京大学」内含「北京」。可用嵌套标签、超图、span-based 分类器(枚举候选 span 再分类),或 pipeline 先长后短。

追问 2NER 和实体链接(EL)区别?

NER 只识别「苹果公司」这个 mention;EL 把它消歧并链接到知识库实体 Q312(Apple Inc.)。EL 需要候选生成 + 排序,解决同名歧义。

追问 3如何评估 NER?

实体级精确匹配:边界与类型都对才算 TP。报告 PrecisionRecall、F1;注意部分匹配(partial match)规则对分数影响很大。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习