核心要点

  • 定义词袋:忽略词序,只统计词频

  • 说明与 TF-IDF 的关系

  • 列举语义丢失、稀疏性、OOV 等局限

  • 能对比 n-gram、Word2Vec、BERT

简要回答

词袋模型(BoW)把文档表示为词频向量,完全忽略词序与语法。简单高效,适合基线分类,但无法区分「狗咬人」与「人咬狗」,且高维稀疏、难处理多义词。

标准回答

一、先给出结论和背景

  • 定义:文档 → 固定词表上的频率/二值向量。步骤:分词 → 建词表 → 统计各词出现次数。
  • 变体:- 原始词频
  • 二元词袋(仍忽略部分顺序)
  • TF-IDF 加权(抑制通用词)

二、拆开关键步骤和判断点

  • 优点:实现简单、与线性模型/NB 配合好、可解释(看权重最高的词)。
  • 核心局限:1. 语序丢失:「不好」vs「好不」相同表示
  1. 语义鸿沟:同义词、近义词不相似(需 Embedding
  2. 维度灾难:词表大 → 稀疏、存储与计算贵
  3. OOV:未见词零向量
  4. 多义词:一词一向量无法消歧

三、补上落地边界和取舍

回答思路

  • 【定义】用一句话说清「什么是词袋模型?有哪些局限」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:NLP 基础。术语:TF-IDFEmbeddingTokenization

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:声称 BoW 能捕捉语义;不说词序问题;忽略 TF-IDF 作为改进。

追问

追问 1BoW 和 TF-IDF 有什么区别?

BoW 用原始计数;TF-IDF 用 tf×idf 降低「的、是」等高频无区分词权重,通常提升分类效果。二者都忽略词序。

追问 2词袋维度怎么控制?

设 min_df/max_df 过滤罕见/过常见词、取 top-K 词、用 Hashing Trick 固定维度、或字符 n-gram 缓解 OOV。

追问 3什么时候仍用 BoW?

极小数据快速基线、可解释性要求高、边缘设备、关键词匹配型任务(热搜词统计)。复杂语义任务应上预训练模型。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习