核心要点
字符/词/子词粒度 trade-off
BPE 合并过程
中文分词特殊性
简要回答
Tokenizer 负责文本↔token ID 转换。BPE 从字符级开始,反复合并语料中最频繁的相邻符号对,最终得到子词词表,能处理未登录词且词表可控。
标准回答
一、先把结论讲清楚
为什么需要子词:纯词级词表大、OOV 多;纯字符级序列太长。BPE 流程:1) 初始字符级词表;2) 统计相邻符号对频率;
二、拆开机制和判断点
- 合并最高频对为新符号;4) 重复至词表达目标大小。实践:GPT 系用 BPE,SentencePiece 支持多语言统一词表。
三、补上例子、边界和取舍
Tokenizer 与模型绑定,换模型必须换 tokenizer。中文常被切成较多 token,影响计费与上下文长度。
面试里可以补一句:大模型中的 Tokenizer 是什么 在大模型场景下通常要同时权衡效果、延迟、成本和安全边界。回答时最好带一个例子,比如上下文过长、幻觉、缓存命中或工具调用失败时,系统应该如何降级和观测。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。
追问
追问 1:SentencePiece 和 BPE 区别?
题库专题:子词分词:BPE、WordPiece、Unigram 有什么区别?BPE 多在预分词后的子词上合并;SentencePiece 直接在原始字符流上学习,无需语言特定预分词,中日韩更友好,且把空格也编进词表。LLaMA、T5 常用 SentencePiece。
题库延伸:与本追问相关的专题题 → 子词分词:BPE、WordPiece、Unigram 有什么区别?
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
