简要回答
词袋模型(BoW)把文档表示为词频向量,完全忽略词序与语法。简单高效,适合基线分类,但无法区分「狗咬人」与「人咬狗」,且高维稀疏、难处理多义词。
标准回答
一、先给出结论和背景
二、拆开关键步骤和判断点
- 优点:实现简单、与线性模型/NB 配合好、可解释(看权重最高的词)。
- 核心局限:1. 语序丢失:「不好」vs「好不」相同表示
- 语义鸿沟:同义词、近义词不相似(需 Embedding)
- 维度灾难:词表大 → 稀疏、存储与计算贵
- OOV:未见词零向量
- 多义词:一词一向量无法消歧
三、补上落地边界和取舍
回答思路
【定义】用一句话说清「什么是词袋模型?有哪些局限」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
延伸学习
延伸阅读:NLP 基础。术语:TF-IDF、Embedding、Tokenization。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:声称 BoW 能捕捉语义;不说词序问题;忽略 TF-IDF 作为改进。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
