核心要点
能定义 NLP 并区分理解与生成任务
举出搜索、翻译、对话、信息抽取等典型应用
说明从规则 → 统计 → 深度学习 → 大模型的演进脉络
能谈数据、标注成本与多语言/低资源挑战
简要回答
自然语言处理(NLP) 让计算机理解、生成与操作人类语言,涵盖分词、句法分析、机器翻译、问答、情感分析等。它连接文本数据与业务价值,是搜索、客服、内容审核与 大语言模型 的基础。
标准回答
一、先给出结论和背景
- 定义:自然语言处理(NLP) 是人工智能中研究如何让机器处理人类语言的学科,输入输出多为文本或语音转写文本。
- 核心任务族:- 理解:分类、命名实体识别(NER)、情感分析、语义检索
- 生成:机器翻译、摘要、对话、代码生成
- 结构化:信息抽取、关系抽取、知识图谱构建
二、拆开关键步骤和判断点
- 为何重要:1. 非结构化文本占企业数据大头,NLP 是解锁其价值的关键
- 搜索推荐、智能客服、合规审核、医疗病历结构化等直接依赖 NLP
- 预训练 Transformer 与 BERT/GPT 大幅降低落地门槛
- 技术演进:规则与词典 → 统计模型(HMM、CRF)→ 神经网络 → 预训练 + 微调 → 指令对齐的大模型。
三、补上落地边界和取舍
- 工程注意:分词与 Tokenization 影响成本;标注质量决定上限;需评估偏见、幻觉与隐私合规。详见 NLP 入门。
回答思路
【定义】用一句话说清「什么是自然语言处理(NLP)?为什么重要」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:把 NLP 等同于 ChatGPT;忽略传统特征工程在资源受限场景的价值;说不清「理解 vs 生成」任务差异。
追问
追问 1:NLP 和 LLM 是什么关系?
追问 2:中文 NLP 有哪些特殊难点?
无天然词边界需分词;简繁、方言、网络用语;多义与省略更常见。需选用适合中文的分词器(jieba、LTP)或 subword 模型,并注意领域适配与 OCR 噪声。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
