核心要点

  • 能说明文本如何特征化(TF-IDF、n-gram、词频)

  • 理解决策树在分类任务中的工作流程

  • 知道优缺点:可解释 vs 高维稀疏文本的局限

  • 能对比随机森林、梯度提升与深度模型

简要回答

NLP 中常先把文本转为 TF-IDF 或 n-gram 稀疏向量,再用决策树做情感分类、主题分类、意图识别等。树模型可解释性强,但对高维稀疏文本易过拟合,实践中多与随机森林、XGBoost 或线性模型配合。

标准回答

一、先给出结论和背景

  • 特征化:原始文本 → 分词 → 去停用词 → TF-IDF/词袋/n-gram 特征矩阵。
  • 典型应用:- 情感/意图分类(客服工单路由)
  • 垃圾邮件检测
  • 主题粗分类(新闻频道)

二、拆开关键步骤和判断点

  • 决策树如何工作:按特征(如某词 TF-IDF 是否超过阈值)递归分裂,叶节点输出类别;可用 Gini 或信息增益选分裂点。
  • 优势:训练快、无需 GPU、规则可可视化(「若含 refund 且 rating<3 → 负面」),适合基线与可解释场景。

三、补上落地边界和取舍

  • 局限:高维稀疏下单次分裂利用特征少;难捕捉长距离语义与词序;对未见 n-gram 泛化弱。工业界常用 Random Forest / GBDT 集成多棵树,或直接用 BERT 微调。
    参考 NLP 文本分类

回答思路

  • 【定义】用一句话说清「决策树如何用于自然语言处理任务」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

知识库:文本分类实战。术语:TF-IDFF1 Score。工具:scikit-learn 做基线很快。

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:未提文本必须先向量化;声称决策树能直接「读懂」原始句子;忽略与线性 SVM、朴素贝叶的对比。

追问

追问 1决策树文本分类 vs 朴素贝叶斯怎么选?

朴素贝叶斯假设特征条件独立,在短文本、小数据上极快且稳健;决策树可捕捉非线性特征组合但易过拟合。可先 NB/线性 SVM 做基线,再试 GBDT。

追问 2如何处理类别不平衡?

class_weight、过采样(SMOTE 慎用于高维稀疏)、欠采样、调整分裂准则,或改用 F1 优化。评估看 Precision-Recall 而非只看 Accuracy

追问 3深度模型一定比决策树好吗?

不一定。小数据、需可解释、算力紧时树模型/线性模型更合适;大数据、复杂语义、多语言场景 BERT 类模型通常更优。可用模型蒸馏把大模型知识压缩到小模型。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习